포스트

영상의 다음 사건을 맞히려면: Video-CoE가 시간 근거를 강제하는 법

Video-CoE는 비디오의 다음 사건을 바로 맞히게 하지 않고, 관측된 프레임의 사건과 시간을 먼저 연결한 뒤 미래를 예측하게 합니다. 이 중간 사슬은 설명을 길게 만드는 장식이 아니라 모델이 영상 근거를 실제로 사용했는지 검사하기 위한 훈련 구조입니다.

정답 하나로는 시간 추론을 확인할 수 없다

직접 예측은 답이 맞아도 장면을 이해한 것인지 흔한 상황을 추측한 것인지 구분하기 어렵습니다. Video-CoE는 프레임 사이의 사건을 시간 순서와 함께 쓰게 하여 원인, 변화, 결과의 연결을 드러냅니다. 보행자가 횡단보도에 접근하고 신호가 바뀌는 관측을 거쳐 차량 감속을 예측하는 식입니다.

기존 비디오 예측의 시간 정렬 문제

이 방식도 텍스트 사슬이 그럴듯하다고 자동으로 사실이 되는 것은 아닙니다. 각 사건이 실제 프레임 구간과 맞는지, 영상에 없던 객체를 새로 만들지, 최종 예측이 관측 정보에서 이어지는지를 별도로 검사해야 합니다.

사건의 크기는 어떻게 정할까

“사람이 움직인다”처럼 너무 큰 사건은 중요한 전환을 숨기고, 프레임마다 미세한 움직임을 하나씩 적으면 사슬이 길어져 오차와 비용이 늘어납니다. 목적에 맞는 최소 단위는 후속 예측을 바꾸는 상태 변화인지로 정할 수 있습니다. 보행자가 도로 가장자리에 멈춘 것과 실제로 진입한 것은 차량 감속 예측에 다른 의미가 있지만, 팔의 작은 흔들림은 그렇지 않을 수 있습니다.

데이터를 만들 때 사건 시작, 종료 기준, 동시에 일어난 사건의 표기와 장면 전환 처리를 먼저 고정해야 합니다. 같은 영상에 두 annotator나 두 생성 규칙을 적용해 사건 수와 경계가 크게 다르면 보상 모델도 안정적인 기준을 배우기 어렵습니다. 최종 답 정확도와 함께 사건 개수, 평균 길이와 시간 경계 오차를 기록해야 합니다.

CoE-SFT로 사건 사슬의 형식을 배운다

첫 단계인 CoE-SFT는 Qwen2.5-VL-72B를 교사 모델로 사용해 비디오, 미래 사건과 그 사이의 추론 사슬을 생성하고 작은 모델을 지도 학습하는 흐름입니다. 단순 질문, 정답 쌍보다 시간 구간과 중간 사건을 포함한 데이터를 만들어 모델이 출력 구조와 사건 연결 방식을 익히게 합니다.

CoE-SFT 구성

교사 모델이 잘못 본 장면은 학생 데이터에도 들어갈 수 있습니다. 따라서 생성 데이터의 타임스탬프 범위, 객체 존재, 사건 순서를 자동 규칙과 사람 표본 검사로 확인해야 합니다. 교사 규모가 크다는 사실은 합성 데이터의 정확성을 보장하지 않습니다.

교사 오류는 독립된 문장보다 사슬에서 더 위험합니다. 첫 사건에서 객체를 잘못 식별하면 이후 원인과 결과가 논리적으로 이어져도 모두 잘못된 대상으로 연결될 수 있습니다. 객체가 실제로 나타나는 프레임, 사건 시간 범위와 미래 정답을 각각 검사하고 한 항목이라도 실패한 합성 예시는 제외하는 편이 낫습니다. 그럴듯함을 기준으로 일괄 승인하면 학생은 시각 근거보다 교사의 서술 습관을 학습할 수 있습니다.

보상 지름길은 어떻게 발견할까

형식 보상이 강하면 모델은 요구한 태그와 타임스탬프를 빠짐없이 쓰면서 실제 영상 내용은 대충 채울 수 있습니다. 시간 정렬 보상이 느슨하면 넓은 구간을 반복해 점수를 얻을 수 있고, 답 보상이 지나치게 강하면 중간 사슬을 무시한 채 자주 나오는 미래를 맞힐 수 있습니다. 각 보상을 하나씩 끈 절제 실험과 보상별 오류 표가 필요한 이유입니다.

대조 시험으로 사건 순서를 섞거나 관련 프레임 일부를 가려 볼 수 있습니다. 중간 근거가 실제로 쓰인다면 사슬과 최종 답이 함께 나빠져야 합니다. 영상이 달라도 같은 상투적인 사슬을 반복하거나 타임스탬프만 바꿔 점수를 유지한다면 보상 해킹 가능성이 있습니다. 높은 총 보상보다 사람 검수에서 어떤 지름길이 남았는지를 보고 가중치를 조정해야 합니다.

CoE-GRPO는 세 종류의 보상을 묶는다

두 번째 단계는 GRPO를 이용해 사건 사슬을 강화합니다. 원문은 요구한 출력 형식을 지켰는지 보는 형식 보상, 사건과 타임스탬프가 맞는지 보는 정렬 보상, 최종 미래 사건이 정답과 맞는지 보는 답 보상을 설명합니다. 하나의 최종 점수만 최적화할 때 생기는 지름길을 줄이려는 설계입니다.

CoE-GRPO의 보상 구조

세 보상의 균형이 틀리면 모델이 사건을 지나치게 잘게 쪼개 형식 점수만 얻거나, 최종 답을 맞히면서 근거 시간을 대충 쓸 수 있습니다. 보상별 점수와 전체 점수를 함께 기록하고, 사건 사슬을 제거한 기준선 및 SFT만 적용한 모델과 비교해야 GRPO의 실제 기여를 알 수 있습니다.

가능한 미래가 여러 개일 때는 어떻게 답할까

관측 영상만으로 다음 사건이 하나로 결정되지 않는 상황이 많습니다. 횡단보도 앞에 선 사람이 건널 수도 있고 기다릴 수도 있습니다. 데이터가 하나의 정답만 허용하면 모델은 가능한 대안을 틀린 답으로 학습하고, 평가도 과도하게 단정적인 출력을 선호할 수 있습니다. 사건 사슬이 상세하더라도 미래의 불확실성 자체가 사라지는 것은 아닙니다.

운영 시험에서는 가능한 후보를 여러 개 허용할 수 있는지, 각 후보의 근거와 확신도를 어떻게 표현할지 정합니다. 안전 경보에서는 가장 가능성 높은 한 사건보다 위험하지만 가능한 사건을 놓치지 않는 것이 중요할 수 있습니다. 반대로 자동 라벨링에서는 후보가 너무 많으면 쓸모가 없습니다. 사용 목적에 따라 top-k 회수율, 잘못된 확신과 미탐을 따로 측정해야 합니다.

현재는 연구 파이프라인으로 봐야 한다

원문 작성 시점에는 코드와 모델이 “Coming Soon”으로 표시되어 있습니다. 따라서 이 글의 구조만으로 재현 가능한 학습 절차나 즉시 실행 가능한 7B 체크포인트가 제공된다고 말할 수 없습니다. 논문논문 페이지에서 공개 범위와 평가 조건을 확인해야 합니다.

사건 사슬을 매 요청마다 생성하면 직접 예측보다 출력 토큰과 지연이 늘고, GRPO 학습에는 비디오 처리와 보상 튜닝 비용이 듭니다. 실시간 경보보다 오프라인 영상 라벨링이나 후속 사건 분석부터 시험하고, 정확도뿐 아니라 잘못된 시간 근거와 처리 시간을 함께 재는 것이 안전합니다.

배포 여부는 어떤 순서로 결정할까

먼저 코드와 체크포인트의 공개 범위가 논문 설정을 재현하는지 확인합니다. 다음으로 같은 영상에서 직접 답변, CoE-SFT, CoE-GRPO를 비교하고 최종 사건 정확도, 시간 경계 오류, 환각 객체와 출력 길이를 함께 기록합니다. 마지막으로 자신의 하드웨어에서 전처리부터 전체 응답까지 걸린 시간을 재야 합니다. 논문 표의 모델 점수만으로 실시간성을 추정하면 안 됩니다.

근거 검토가 가치 있는 오프라인 분석에서는 추가 토큰이 허용될 수 있습니다. 수백 밀리초가 중요한 제어 루프에서는 긴 사슬이 병목이 될 수 있으므로 더 짧은 출력이나 직접 예측과의 라우팅을 검토해야 합니다. 사람 검토 없이 자동 행동으로 연결한다면 낮은 확신, 시간 근거 불일치와 미관측 객체가 나올 때 멈추는 규칙도 필요합니다.

오류표에는 무엇을 따로 남길까

최종 사건이 틀렸다는 한 열만으로는 개선 지점을 알기 어렵습니다. 관측 객체를 놓친 오류, 존재하지 않는 객체를 추가한 오류, 사건 순서를 뒤집은 오류, 시간 범위를 잘못 붙인 오류와 가능한 미래를 지나치게 단정한 오류를 나눕니다. 최종 답은 맞았지만 중간 시간 근거가 틀린 사례도 별도 범주로 두어야 합니다. 그래야 SFT 데이터, 정렬 보상과 답 보상 중 어디를 고칠지 판단할 수 있습니다.

예를 들어 차량이 멈춘다는 답이 맞더라도 모델이 실제 신호 변경보다 뒤의 프레임을 원인으로 적었다면 실시간 예측 근거로는 실패입니다. 반대로 관측 사건은 모두 맞았지만 여러 가능한 미래 중 다른 하나를 골랐다면 데이터의 단일 정답 설계를 다시 볼 문제입니다. 두 실패를 같은 오답으로 묶으면 보상을 더 세게 주는 잘못된 처방으로 이어질 수 있습니다.

표본 검수는 높은 점수 사례에도 필요합니다. 형식을 완벽히 지켜 자동 보상을 많이 받은 출력과 보상은 낮지만 사람이 이해할 수 있는 출력을 함께 읽습니다. 보상과 사람 판단이 계속 어긋나면 더 많은 RL을 돌리기 전에 평가 규칙을 고쳐야 합니다. 사건 사슬은 설명 가능성을 약속하는 장치가 아니라 검증할 중간 대상을 제공하는 장치라는 경계를 유지해야 합니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

사건 사슬이 길수록 미래 예측이 더 좋아지나요?

아닙니다. 실제 프레임 변화보다 사건을 지나치게 잘게 나누면 형식만 길어지고 오류가 누적되므로, 각 사건이 관측 구간과 최종 예측에 필요한지 확인해야 합니다.

Video-CoE의 중간 추론이 믿을 만한지는 어떻게 검사하나요?

사건별 시작, 종료 시각, 등장 객체와 순서를 원본 프레임에 다시 대조하고, 사슬을 제거하거나 섞었을 때 최종 답이 어떻게 변하는지 봐야 합니다.

현재 바로 서비스에 배포할 수 있나요?

원문 시점에는 코드와 모델이 공개 예정이므로 재현 가능성을 먼저 확인해야 하며, 공개 뒤에도 직접 예측 대비 정확도, 잘못된 시간 근거, 출력 토큰, 지연을 측정해야 합니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    11개 장 18 분읽는 시간