디퓨전모델 48
- Kronos: 금융 캔들스틱 데이터를 언어로 이해하는 파운데이션 모델 심층 분석
- pocket-tts: 무거운 GPU 없이 CPU만으로 작동하는 실시간 AI 음성 합성의 원리
- Diffusion LLM이 Qwen보다 5배 빠를까? d3LLM 병렬 디코딩의 조건
- 비디오 배경이 카메라와 함께 휘어진다면? VGGRPO의 잠재 4D 보상
- 이미지, 오디오를 모두 다음 토큰으로 만들면 더 단순할까? LongCat-Next의 비용
- MinerU-Diffusion은 OCR을 3.2배 빠르게 할까: Threshold, VRAM의 교환
- 이미지 이해와 생성이 서로 방해한다면? Cheers의 의미, 디테일 토큰 분리
- DreamVideo-Omni는 두 캐릭터 얼굴 융합을 막을까: Latent Identity RL의 범위
- InternVL-U 4B가 14B를 이길까: 이해, 생성 분리와 실제 VRAM 조건
- MM-Zero의 '데이터 0'은 사실일까: Proposer, Coder, Solver와 합성 편향
- 냉장고 문을 열 때 손이 관통한다면: ArtHOI의 4D 재구성
- VLM은 텍스트 모델부터 학습해야 할까? Transfusion 공동 사전학습의 대안
- MMM은 1분 영상을 빠르고 선명하게 만들까: Global Mean, Local Mode의 경계
- 이미지 생성 모델이 너무 많다면? Diffusion-GPT 라우터의 선택 기준
- VibeVoice로 90분 팟캐스트를 한 번에 만들까: 7.5Hz 토큰과 중단된 공식 지원
- 물을 채우고 금속을 구부리는 편집은 왜 어려울까: PhysicEdit
- 여러 사람의 얼굴과 목소리가 섞인다면? DreamID-Omni의 이중 결속
- 손은 움직였는데 AI 영상 속 물체가 안 따라오면? Generated Reality의 2D, 3D 제어
- DreamZero는 비디오와 행동을 함께 예측해 제로샷 정책이 될 수 있나
- 2^256 바이너리 토큰이 코드북을 없앨까: BitDance FID 1.24와 30.2배 속도의 조건
- 그림을 지우지 않고 토끼를 코끼리로 바꿀 수 있을까: Stroke of Surprise의 Prefix, Delta 최적화
- 1분 AI 영상의 Character Drift, Teacher도 5초만 보면 왜 못 고칠까?
- 정면 춤 영상을 측면으로 바꾸면 Pose가 무너지는 이유: 3DiMo의 Motion Token
- AI 논문 그림, 한 번에 생성하면 왜 틀릴까? PaperBanana의 4단계 검수
- 로봇이 미래 Frame을 맞히면 Action도 나아질까? LingBot-VA의 World Model
- RAE가 VAE보다 빨리 수렴할까: 1152차원 표현 공간의 이득과 비용
- Being-H0.5는 다른 로봇 사이에서 무엇을 공유하나? Human Data와 Mixture-of-Flow
- Alterbute는 색, 재질을 바꿔도 같은 객체를 유지할까: VNE와 마스크 의존성
- TMD는 50-step 비디오 생성을 정말 4-step으로 줄일까: Backbone, Flow Head 구조
- VIBE 3.6B로 2K 이미지 편집이 가능한가: H100 4초와 24GB 조건 해석
- RoboVIP은 로봇 영상을 왜 텍스트 대신 참조 이미지로 바꾸나
- NextFlow는 1024 이미지를 왜 5초에 만드나: Next-Scale의 선택
- SpaceTimePilot은 카메라와 동작을 따로 바꿀 수 있나: τ와 CamxTime
- 이미지 생성 Step을 1에서 50까지 바꿔도 될까? Self-E의 Any-Step 학습
- 로봇 Action을 한 Token씩 만들지 않으면 나아질까? Dream-VL, Dream-VLA
- InsertAnywhere는 영상 속 객체 위치를 어떻게 고정할까? 4D Mask와 Diffusion
- TurboDiffusion 100~200배 가속은 어떻게 나왔나? Attention, rCM, W8A8 조건
- 비디오를 Pixel부터 만들지 않는 이유: SemanticGen의 Semantic→Latent 2단계
- Kling-Omni가 생성, 편집 모델을 하나로 합친 이유: Reference Video를 Prefix로 쓰는 구조
- Latent Bridge Matching의 1 NFE는 정말 한 번의 계산일까: 수식, 속도, 한계 해설
- MotionFollower는 GPU 메모리를 얼마나 줄였나: 42.6GB→9.8GB와 품질 지표 해석
- KV-Edit는 배경을 정말 100% 보존할까: Training-Free 편집과 O(1) 주장 점검
- DICEPTION 하나로 깊이, 법선, 분할을 다 잘할까: 벤치마크가 보여준 성능 차이
- PhotoDoodle은 30~50쌍으로 스타일을 배울까: 배경 보존 구조와 실행 코드 함정
- Sora 영상은 왜 물리 법칙을 틀리나: 시공간 패치와 DiT 원리
- HunyuanVideo 13B는 어떻게 영상을 만들까: 데이터, 3D VAE, 실행 전제
- Fooocus가 Stable Diffusion WebUI보다 쉬운 이유: Linux 설치부터 Preset 선택까지
- Diffusion 학습 코드는 왜 원본 이미지 대신 Noise를 맞출까?