영상이해 11
- GameplayQA에서 MLLM이 무너지는 이유: 초당 1.22라벨, Self/Other/World
- 실시간 비디오 AI는 언제 먼저 말해야 할까? Proact-VL의 트리거 문제
- VLM의 잠재 추론은 정말 이미지를 쓰고 있나: CapImagine 연구가 던진 질문
- 비디오 추론 데이터 200만 개면 일반화할까? VBVR의 5개 능력과 함정
- OV-Encoder는 비디오 토큰을 80% 줄여도 더 정확할까: 3.1~25% Residual 선택의 맹점
- 긴 영상 요약이 대화, 카메라, 효과음을 놓친다면: TimeChat-Captioner
- 미로를 풀 때 프레임을 늘리면 왜 나아질까: Visual Test-Time Scaling
- VLM 추론 데이터 180만 개가 다 필요할까? MMFineReason의 7% 선별
- VideoAuto-R1은 어떻게 답변을 149토큰에서 44토큰으로 줄였나
- 인간 1인칭 영상이 로봇 학습에 바로 쓰이지 못하는 이유: PhysBrain E2E
- InternVideo는 생성, 판별 학습을 어떻게 합치나: MVM, VLC, CMA