아닙니다. 비디오 추론 데이터가 200만 개를 넘더라도 생성 규칙의 흔적을 외우거나 실제 영상과 다른 분포에 적응하면, 벤치마크 점수와 현실 일반화 사이에 간격이 남습니다.
VBVR 논문은 이 문제를 작은 정답형 데이터셋을 늘리는 데서 그치지 않고, 추론 능력을 200개 과제로 쪼개 2,015,000개 샘플을 생성하는 방식으로 다룹니다. 기존 비교 대상 아홉 데이터셋의 12,800개 샘플보다 약 세 자릿수 큰 규모입니다.
아닙니다. 비디오 추론 데이터가 200만 개를 넘더라도 생성 규칙의 흔적을 외우거나 실제 영상과 다른 분포에 적응하면, 벤치마크 점수와 현실 일반화 사이에 간격이 남습니다.
VBVR 논문은 이 문제를 작은 정답형 데이터셋을 늘리는 데서 그치지 않고, 추론 능력을 200개 과제로 쪼개 2,015,000개 샘플을 생성하는 방식으로 다룹니다. 기존 비교 대상 아홉 데이터셋의 12,800개 샘플보다 약 세 자릿수 큰 규모입니다.
VBVR은 비디오 추론을 하나의 정확도로 뭉치지 않고 다섯 영역으로 구분합니다.
이 구분은 모델의 평균 점수가 같아도 실패 성격이 다를 수 있음을 보여 줍니다. 객체를 찾는 문제에는 강하지만 상태 변화나 규칙 추론에는 약한 모델을 “비디오 이해가 된다”는 한 문장으로 설명하기 어렵기 때문입니다.
다섯 영역은 서로 완전히 독립된 칸이라기보다 실패를 해석하기 위한 좌표에 가깝습니다. 상태 변화를 풀려면 먼저 객체를 지각하고 시간 순서를 유지해야 하며, 추상 규칙 문제에도 공간 관계가 포함될 수 있습니다. 따라서 한 영역의 낮은 점수가 그 능력 하나만 부족하다는 뜻은 아니고, 선행 단계의 오류가 뒤 과제에 전달됐는지 함께 보아야 합니다.
과제 수가 많은 장점은 평균을 정교하게 만드는 데만 있지 않습니다. 같은 능력 안에서도 객체 수, 영상 길이, 방해 요소, 질문 표현을 바꿔 모델이 어느 조건부터 무너지는지 볼 수 있습니다. 제품 평가에서는 전체 200개를 동일하게 중요하게 취급하기보다 실제 사용 사례와 가까운 과제군을 먼저 고르고 다른 영역은 부작용 점검용으로 남기는 편이 낫습니다.
과제 이름이 Transformation이라고 해서 모델이 반드시 시간 변화를 풀었다고 볼 수는 없습니다. 정답이 마지막 프레임의 색이나 고정된 질문 문구만으로 예측 가능하면 시간 추론 없이도 맞힐 수 있습니다. 첫 프레임만, 마지막 프레임만, 프레임 순서를 섞은 입력을 주는 대조 실험으로 영상 전체가 실제로 필요한지 확인할 수 있습니다.
공간 과제도 객체 위치가 정답 라벨과 반복적으로 연결되면 지름길이 생깁니다. 렌더링 색과 위치를 바꾸고 질문 문구를 재작성했을 때 점수가 유지되는지 보면 모델이 생성기 규칙을 외웠는지 좁힐 수 있습니다. 이런 대조군은 높은 본 점수를 부정하기보다 그 점수가 측정한 능력의 범위를 분명히 합니다.
각 과제는 매개변수화된 생성기로 영상을 만들고, 같은 규칙에서 정답과 채점 기준을 자동으로 얻습니다. 사람이 200만 개 영상을 하나씩 라벨링하지 않아도 되며, 규칙 기반 정답이라 평가가 재현 가능합니다. 연구진은 Lambda 작업자로 생성을 병렬화하고 결과를 S3에 저장했습니다.
이 방식은 규모와 통제를 얻는 대신 생성기의 편향을 만듭니다. 배경, 움직임, 질문 문구에 반복 패턴이 있으면 모델이 실제 추론 대신 지름길을 배울 수 있습니다. 따라서 생성 규칙을 공유하는 학습, 평가 분할뿐 아니라, 보지 못한 규칙과 다른 렌더링을 이용한 평가가 중요합니다.
자동 정답의 신뢰도는 생성 코드가 의도한 상태와 렌더링된 영상이 실제로 일치하는지에 달려 있습니다. 객체가 가려지거나 프레임 밖으로 나갔는데 메타데이터상 존재한다고 기록되면 규칙 정답은 정확해도 시각적으로 답할 수 없는 샘플이 됩니다. 각 과제에서 무작위 표본을 사람이 보고 질문의 답이 영상만으로 결정되는지 확인해야 합니다.
대규모 데이터에서는 작은 생성 오류율도 많은 샘플로 늘어납니다. 생성 작업 실패, 중복 영상, 잘린 파일, 질문과 선택지 불일치를 자동 검사하고 과제별 제외 비율을 공개해야 분포를 이해할 수 있습니다. 생성기 버전을 바꿨다면 이전 샘플과 새 샘플을 같은 집합으로 섞기보다 어느 규칙과 렌더러에서 나왔는지 추적할 수 있게 남기는 편이 좋습니다.
무작위로 영상만 나누면 동일한 과제 템플릿과 매개변수 조합이 학습과 평가에 모두 들어갈 수 있습니다. 난수 시드가 달라도 배경, 움직임, 질문 구조가 같다면 모델은 규칙의 표면을 익혀 높은 점수를 얻을 수 있습니다. 템플릿, 객체 조합, 렌더링 스타일, 규칙 자체를 기준으로 겹치지 않는 분할을 따로 둘 필요가 있습니다.
난도를 한 축으로만 늘리는 것도 주의해야 합니다. 객체 수를 늘리면서 영상 길이와 가림까지 함께 늘리면 어느 조건이 실패를 만들었는지 알기 어렵습니다. 한 번에 한 요인을 바꾼 진단 분할과 여러 요인이 결합된 종합 분할을 나누면 모델 개선 방향을 찾기 쉽습니다.
학습하지 않은 생성기에서 점수가 떨어졌다고 곧 현실 일반화 실패를 증명하는 것은 아니지만, 같은 생성기 안의 점수만으로 현실 일반화를 주장할 수도 없습니다. 합성 규칙 외삽, 다른 합성 렌더러, 실제 영상 순서로 검증 단계를 쌓으면 어느 경계에서 이득이 사라지는지 설명할 수 있습니다.
연구는 GPT-4o, Gemini 1.5, LLaVA-Video, Video-LLaVA를 포함한 모델을 비교하고, 데이터와 모델 규모를 늘렸을 때 도메인 안팎의 성능 변화를 관찰합니다. 전반적으로 스케일이 커지면 점수는 올랐지만 능력별 속도는 같지 않았습니다.
지각 과제는 상대적으로 빠르게 개선된 반면, 시간에 따른 변환과 추상 규칙은 계속 어려운 영역으로 남았습니다. 이는 프레임에서 보이는 대상을 잘 말하는 능력과 여러 프레임을 연결해 원인을 추론하는 능력이 같지 않음을 보여 줍니다.
점수를 읽을 때는 전체 평균보다 다섯 영역의 편차를 먼저 봐야 합니다. 제품이 필요한 능력이 상태 변화라면 지각 점수로 채워진 높은 평균은 실제 품질을 과대평가할 수 있습니다.
스케일에 따른 상승도 학습 데이터 양, 모델 파라미터, 입력 프레임 수와 계산량을 구분해서 보아야 합니다. 더 큰 모델이 더 많은 프레임이나 높은 해상도를 받았다면 점수 차이에 추론 능력과 입력 정보량이 함께 섞입니다. 같은 입력 예산과 다른 입력 예산의 비교를 나누면 실제 배포 비용까지 판단하기 쉽습니다.
특히 Transformation과 Abstraction의 완만한 개선은 단순히 샘플을 더 넣는 방식의 한계를 찾는 단서가 됩니다. 오류를 영상 길이, 객체 수, 규칙의 조합성에 따라 나누고 어느 축에서 규모 증가가 멈추는지 보아야 합니다. 평균 추세만으로 “더 키우면 해결된다”고 외삽하지 않는 것이 중요합니다.
VBVR은 대규모로 능력을 분해해 실험하기 좋은 자료지만 실제 영상의 대체재는 아닙니다. 합성 장면의 물리, 카메라 움직임, 잡음은 현실과 다르고, 생성기의 시각적 흔적을 이용하는 Clever Hans 문제가 생길 수 있습니다. 200만 개를 모두 학습하고 평가하는 계산 비용도 작지 않습니다.
활용 순서는 다음이 적절합니다.
데이터와 과제 구성은 프로젝트 페이지에서 확인할 수 있습니다. VBVR의 가치는 “200만 개면 충분하다”는 답이 아니라, 비디오 추론을 세분해 어디에서 규모가 통하고 어디에서 통하지 않는지 측정할 수 있게 한 데 있습니다.
실제 제품으로 옮길 때는 먼저 사용자 질문을 다섯 능력과 과제 유형에 매핑합니다. 스포츠 영상의 규칙 판정, 제조 영상의 상태 변화, 교육 영상의 절차 이해처럼 같은 비디오 분석이라도 필요한 능력과 오류 비용이 다릅니다. VBVR에서 가까운 과제를 골라 후보 모델을 좁힌 뒤 현장 영상에서 시간 구간과 정답 근거를 사람이 검토해야 합니다.
모델이 틀린 경우에는 답만 기록하지 말고 어느 프레임을 봤는지, 시간 순서를 뒤집으면 답이 변하는지, 질문 표현을 바꿔도 같은 판단을 하는지 확인합니다. 이 오류 기록이 있어야 합성 학습 데이터를 더 넣을지, 프레임 샘플링을 바꿀지, 실제 영상 데이터를 보강할지 결정할 수 있습니다. 규모가 큰 벤치마크는 출발점을 넓히지만 제품의 정답 정의와 실패 조건까지 대신 정해 주지는 않습니다.
학습과 평가의 생성 규칙이 겹치는지 감시하는 것도 중요합니다. 객체 색, 배경, 카메라 경로만 바뀌고 사건 규칙이 같다면 모델은 추론보다 렌더링 흔적을 이용할 수 있습니다. 템플릿 계열 전체를 평가에서 분리하고, 다른 생성기나 실제 촬영 영상으로 같은 능력을 다시 묻는 대조 세트를 둬야 합니다. 데이터 수가 많아도 규칙 누출이 있으면 높은 점수는 새로운 상황의 일반화를 설명하지 못합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.