영상생성 42
- AI 사이트 100개 총정리 — 글쓰기, 검색, 디자인, 영상, 음악, 코딩, 업무 자동화
- 영상통화 속 가족도 가짜일 수 있다: 사진과 목소리가 증거가 아닌 시대
- 알리바바 Wan 3.0 공개 베타 개시, 문서 입력으로 30초 AI 비디오 원컷 생성
- DramaClaw: 파편화된 AI 영상 제작을 하나로 통합하는 오픈소스 파이프라인
- OpenMontage로 AI 영상을 만들 때: 에이전트 파이프라인, 비용, 검수 기준
- 비디오 배경이 카메라와 함께 휘어진다면? VGGRPO의 잠재 4D 보상
- 5초 영상으로 120초를 만들 수 있을까? PackForcing의 4GB KV 조건
- 비디오를 16 FPS로 바로 이어 만들 수 있을까? ShotStream의 캐시 조건
- 화면 밖 자동차를 비디오 모델이 잊는다면? HyDRA의 Top-K 기억
- 사진 한 장에서 서랍의 축까지 찾을 수 있을까: MonoArt의 단계별 추론
- 카메라가 돌면 제품 뒷면이 무너진다면: 3DreamBooth의 1프레임 학습
- 3D 라벨 없이 장면의 앞뒤를 읽을 수 있을까: VEGA-3D의 대가
- 카메라가 돌아오면 방이 바뀌는 문제: MosaicMem의 3D 패치 기억
- 로봇 비디오가 물체를 뚫고 지나간다면? Kinema4D의 URDF, Pointmap 제어
- 멀티샷 영상의 카메라가 프롬프트를 무시한다면? ShotVerse의 3D 궤적
- 카메라가 돌면 인물이 달라지는 문제: WildActor의 전신 정체성 보존
- 생성 영상의 배경과 움직임이 무너진다면: DreamWorld의 결합 월드 모델링
- 냉장고 문을 열 때 손이 관통한다면: ArtHOI의 4D 재구성
- 두 플레이어가 본 세계를 동시에 맞출 수 있나: Minecraft 월드 모델 Solaris
- 영상, 오디오, 편집을 한 모델로 묶으면 뭐가 달라질까: SkyReels-V4
- AI 영상의 소리와 장면이 어긋난다면? JavisDiT++의 시간 정렬
- 여러 사람의 얼굴과 목소리가 섞인다면? DreamID-Omni의 이중 결속
- 로봇 진행률을 말로 묻지 않고 잴 수 있을까? TOPReward의 토큰 확률
- 손은 움직였는데 AI 영상 속 물체가 안 따라오면? Generated Reality의 2D, 3D 제어
- 로봇은 미래 픽셀까지 그려야 할까? FRAPPE의 다중 VFM 정렬
- DreamZero는 비디오와 행동을 함께 예측해 제로샷 정책이 될 수 있나
- 영상과 소리를 따로 만들면 왜 어긋날까: MOVA의 동시 생성 구조
- 화질 좋은 AI 영상이 물리 법칙은 틀리는 이유: RISE-Video 467개 Test
- 1분 AI 영상의 Character Drift, Teacher도 5초만 보면 왜 못 고칠까?
- 로봇이 미래 Frame을 맞히면 Action도 나아질까? LingBot-VA의 World Model
- 12시간 AI 영상은 정말 일관적인가? LoL의 Sink-Collapse와 RoPE Jitter
- 대화문만으로 장편 AI 영상을 만들 수 있을까: ScripterAgent와 VSA의 현실적 한계
- TMD는 50-step 비디오 생성을 정말 4-step으로 줄일까: Backbone, Flow Head 구조
- 비디오 데이터를 더 모아도 움직임이 나쁜 이유: Motive의 선별법
- 선형 어텐션은 왜 약해질까: MHLA의 토큰 레벨 멀티헤드
- RoboVIP은 로봇 영상을 왜 텍스트 대신 참조 이미지로 바꾸나
- 카메라가 돌아오면 배경이 바뀌는 AI 영상, Spatia는 3D Memory로 어떻게 막나
- TurboDiffusion 100~200배 가속은 어떻게 나왔나? Attention, rCM, W8A8 조건
- Kling-Omni가 생성, 편집 모델을 하나로 합친 이유: Reference Video를 Prefix로 쓰는 구조
- Sora 영상은 왜 물리 법칙을 틀리나: 시공간 패치와 DiT 원리
- Veo 2 프롬프트는 무엇을 써야 하나: 카메라, 동작, 4K 읽기
- HunyuanVideo 13B는 어떻게 영상을 만들까: 데이터, 3D VAE, 실행 전제