포스트

예쁜 영상이 물리까지 맞는지 어떻게 알까: Omni-WorldBench 평가법

Omni-WorldBench는 생성 영상의 화질만 보지 않고 행동 뒤 객체 상태가 원인과 결과에 맞게 변하는지 평가합니다. 로봇, 자율주행처럼 상호작용이 중요한 용도에는 유용하지만, MLLM이 채점자이므로 그 모델의 환각과 비용까지 평가 설계에 포함해야 합니다.

화질 점수로 놓치는 실패를 겨냥한다

VBench나 FVD 같은 기존 지표는 영상 품질과 텍스트 정렬을 비교하는 데 유용하지만, 컵을 밀었는데 손이 닿기 전에 움직이거나 공이 벽을 통과하는 인과 오류를 직접 설명하기 어렵습니다. Omni-WorldBench는 실내, 야외, 로보틱스, 자율주행과 게임 등 상호작용 시나리오를 Omni-WorldSuite로 구성합니다.

Omni-WorldBench 개요

Suite는 첫 프레임과 카메라 동작 단서가 있는 공개 데이터를 바탕으로 프롬프트를 만들고 사람 검증을 거치는 경로, 상호작용 원형에서 LLM, VLM으로 장면을 만들고 사람이 다듬는 경로를 함께 사용합니다. 자동 생성된 질문도 최종 평가 전에 사람이 확인한다는 점이 중요합니다.

AgenticScore는 상태 변화를 읽는다

Omni-Metrics는 MLLM 에이전트가 여러 프레임에서 상태 변화의 궤적을 추적하고, 행동과 결과의 인과 관계를 분석하도록 합니다. 원문은 효과가 지시에 맞는지, 시공간 인과가 이어지는지, 카메라를 움직여도 장면 관계가 유지되는지를 주요 기준으로 설명합니다. 이 판단을 AgenticScore와 실패 이유로 묶습니다.

상호작용 시나리오 예시

이 구조는 단일 픽셀 점수보다 사람이 이해하기 쉬운 오류 설명을 줄 수 있습니다. 반면 렌더링이 흐리거나 가림이 심하면 채점 MLLM이 실제 물리 오류와 시각 인식 실패를 구분하지 못할 수 있습니다. 같은 영상을 여러 평가 모델과 사람 표본에 보여 점수 일치도를 확인해야 합니다.

모델 평가자도 먼저 교정해야 한다

MLLM에게 정답 기준과 예시를 주고 안정적으로 같은 점수를 내는지 반복 시험합니다. 프레임 순서를 섞은 영상, 원인보다 결과가 먼저 나오는 영상, 카메라만 움직인 영상처럼 의도적으로 만든 실패 세트가 필요합니다. 평가자가 이런 오류를 놓치면 생성 모델 순위도 신뢰할 수 없습니다.

기존 화질 지표를 버리기보다 함께 써야 합니다. 상호작용은 맞지만 영상이 알아보기 어려운 결과와, 선명하지만 인과가 틀린 결과를 두 축으로 분리하면 종합 점수 하나가 가리는 정보를 줄일 수 있습니다. 사람 채점과 AgenticScore가 불일치한 사례는 별도 검토 대상으로 남깁니다.

용도에 따라 평가 비용을 배분한다

모든 프레임과 모든 체크포인트를 큰 MLLM으로 채점하면 호출 비용과 대기 시간이 커집니다. 먼저 저렴한 지표로 명백한 실패를 거르고, 대표 상호작용과 경계 사례만 Omni-Metrics로 보내며, 마지막 표본을 사람이 검토하는 계층형 평가가 현실적입니다. 원문에 나온 수백 달러와 수 시간이라는 비용은 예시 추정이므로 고정 단가로 쓰지 말고 실제 Suite 크기와 평가 모델로 측정해야 합니다.

논문 페이지에서 Suite 범위와 채점 절차를 확인한 뒤 자신의 제품 실패를 추가해야 합니다. 광고 영상처럼 물리 상호작용이 핵심이 아닌 서비스에는 과도할 수 있지만, 로봇 조작이나 충돌 장면을 만드는 모델에는 인과 오류를 별도 게이트로 두는 가치가 있습니다.

반사실 영상으로 평가자가 원인을 보는지 확인한다

상호작용 평가는 “영상이 자연스럽다”는 인상과 실제 원인, 결과를 분리해야 합니다. 같은 시작 프레임에서 행동 하나만 바꾼 영상 쌍을 만들면 평가자가 변화의 방향을 읽는지 볼 수 있습니다. 컵을 왼쪽으로 미는 조건과 오른쪽으로 미는 조건처럼 나머지 장면을 최대한 고정하고 결과만 달라지게 합니다. 두 영상에 비슷한 점수를 준다면 상태 변화를 충분히 사용하지 않은 것입니다.

시간 순서를 뒤집거나 원인 프레임을 제거한 대조군도 필요합니다. 결과는 그럴듯하지만 손이 닿기 전에 물체가 움직이는 영상, 충돌 직후가 아니라 충돌 전에 형태가 바뀌는 영상처럼 오류 유형을 의도적으로 넣습니다. 평가자가 어떤 오류를 놓치는지 표로 남기면 AgenticScore를 모든 상호작용에 같은 신뢰도로 쓰지 않고 약한 유형만 사람 채점으로 보낼 수 있습니다.

카메라 움직임은 별도 대조가 중요합니다. 관찰점이 바뀌어 객체가 화면에서 이동한 것과 객체 자체가 움직인 것을 혼동하면 상태 추적 점수가 왜곡됩니다. 동일한 장면에서 카메라만 이동한 버전과 객체만 이동한 버전을 짝지어 평가하고, 두 움직임을 설명하는 문장이 구분되는지 확인해야 합니다.

AgenticScore를 사람 점수에 어떻게 맞출까

먼저 제품에 중요한 실패를 포함한 작은 교정 세트를 사람이 독립적으로 채점합니다. 각 영상에는 단일 총점보다 지시 이행, 상태 보존, 접촉과 인과, 카메라 일관성, 가시 품질을 나눠 표시합니다. 같은 세트를 평가 MLLM에 여러 번 주고 점수 분산, 사람과의 불일치, 이유 설명의 일관성을 비교합니다. 반복할 때 순위가 크게 바뀌면 모델 간 작은 점수 차이를 실제 우열로 해석하기 어렵습니다.

평가 프롬프트에도 버전이 필요합니다. 기준 문구나 예시를 바꾸면 점수가 달라질 수 있으므로 생성 모델 버전과 함께 평가 모델, 프롬프트, 프레임 샘플링 규칙을 저장합니다. 새 평가자로 교체할 때는 과거 결과 일부를 다시 채점해 점수 이동을 확인하고, 이동이 크면 이전 리더보드와 직접 연결하지 않습니다.

사람과 MLLM이 불일치할 때는 평균을 내기보다 원인을 분류합니다. MLLM이 작은 접촉을 보지 못했는지, 사람이 모호한 지시를 다르게 해석했는지, 영상이 너무 흐려 판정 불가능한지 나눠야 합니다. 판정 불가능을 낮은 물리 점수와 섞지 않으면 생성 실패와 평가 입력 실패를 구분할 수 있습니다.

제품용 합격 기준은 어떻게 정할까

로봇 영상이라면 접촉 전 움직임, 객체 관통, 잡은 물체의 순간 이동처럼 허용할 수 없는 오류를 먼저 정합니다. 자동차 장면이라면 차선, 충돌, 보행자 상태처럼 안전과 가까운 항목을 평균 화질보다 높은 우선순위로 둡니다. 치명적 오류가 한 번이라도 나오면 평균 AgenticScore가 높아도 합격시키지 않는 게이트를 만들 수 있습니다.

평가 세트는 쉬운 장면만 많이 넣기보다 상호작용 길이, 가림, 객체 수, 카메라 변화로 층화합니다. 전체 평균이 올라도 긴 연쇄나 가려진 접촉에서 성능이 떨어지면 해당 제품 경로에는 사용할 수 없습니다. 모델 업데이트 전후에는 같은 시드와 프롬프트를 재생성해 어느 층에서 좋아지고 나빠졌는지 비교해야 회귀를 찾기 쉽습니다.

평가 비용은 세 단계로 관리할 수 있습니다. 먼저 실행 오류나 빈 영상을 규칙 기반으로 제외하고, 다음으로 저렴한 품질, 정렬 지표를 적용하며, 마지막에 상호작용이 있는 표본만 AgenticScore와 사람 검토로 보냅니다. 사람 검토 비율을 고정하기보다 MLLM의 불확실성, 평가자 간 불일치와 치명적 오류 후보에 집중하면 같은 예산으로 더 많은 위험 사례를 볼 수 있습니다.

어떤 경우에 Omni-WorldBench만으로 부족할까

Suite에 없는 도구, 물체 재질, 센서 조건과 제품 고유 행동은 별도 평가가 필요합니다. 생성 영상이 물리적으로 자연스러워 보여도 실제 로봇의 관절 한계나 자동차 제어 규칙을 만족한다는 뜻은 아닙니다. 영상 평가를 시뮬레이터 상태나 실제 센서 로그와 연결할 수 있다면 객체 위치, 속도, 접촉 시점을 외부 값으로 다시 확인해야 합니다.

또한 MLLM은 보이는 결과를 해석할 뿐 숨은 힘이나 정확한 물리 파라미터를 직접 측정하지 않습니다. 서로 다른 원인으로 비슷한 영상이 만들어질 수 있는 장면에서는 “그럴듯한 재현”과 “올바른 물리 모델”을 구분해야 합니다. 반사실 조건을 바꿨을 때 결과가 예상 방향으로 움직이는지까지 확인해야 월드 모델의 활용 범위를 넓힐 근거가 생깁니다.

결국 Omni-WorldBench는 단일 최종 점수를 받기 위한 도구보다 실패를 상태 변화와 인과의 언어로 분해하는 출발점입니다. 평가자 교정, 치명적 오류 게이트와 제품 고유 반례를 함께 유지할 때 화질 중심 순위가 놓치던 위험을 실제 의사결정에 반영할 수 있습니다.

평가 결과를 공개할 때는 점수만 남기지 말고 대표 실패 영상, 평가 질문, 선택한 프레임과 판정 이유를 함께 보존하는 편이 좋습니다. 그래야 모델 업데이트 뒤 같은 오류가 줄었는지 확인하고 평가자 변경으로 생긴 점수 차이를 재현할 수 있습니다. 영상 원본을 공유하기 어려운 경우에도 오류 유형과 상태 전이의 기대값을 구조화해 남겨야 합니다. 이 기록이 없으면 높은 종합 점수가 실제 물리 개선인지 채점 방식 변화인지 구분하기 어렵습니다. 같은 절차를 모델 버전마다 반복해야 장기 회귀도 찾을 수 있습니다.

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    9개 장 17 분읽는 시간