포스트

GameplayQA에서 MLLM이 무너지는 이유: 초당 1.22라벨, Self/Other/World

GameplayQA에서 MLLM이 어려워하는 이유는 객체를 못 알아봐서만이 아니라, 빠른 사건의 주체와 순서 및 여러 POV 사이의 관계를 동시에 맞혀야 하기 때문입니다. 이 벤치마크는 단일 정확도 순위를 고르는 도구보다 프레임 선택, 시간 정렬, 주체 귀인 중 어느 단계가 실패하는지 찾는 진단 도구로 쓰는 편이 유용합니다.

Self, Other, World를 섞으면 그럴듯한 오답이 된다

정지 이미지에서는 화면에 보이는 물체를 말하는 것만으로도 답처럼 보일 수 있습니다. 동적인 3D 환경에서는 내가 한 행동(Self), 다른 에이전트의 행동(Other), 환경에서 발생한 변화(World)를 구분해야 합니다. 총이 화면에 있다고 해서 내가 발사한 것은 아니며, 다른 시점에 보인 사건을 현재 시점의 행동으로 돌리면 안 됩니다.

Self, Other, World 구분

GameplayQA는 1인칭 POV와 동기화된 여러 영상을 사용해 이 귀인을 묻습니다. 라벨 밀도는 초당 1.22개로 소개됩니다. 듬성듬성한 클립 질문보다 상태 변화가 촘촘하므로, 몇 장만 골라 장면의 분위기로 답하는 전략이 더 쉽게 드러납니다.

다중 POV를 넣기 전에 시간축이 정말 같은지 확인한다

여러 영상이 있다고 해서 자동으로 같은 사건을 보여 주는 것은 아닙니다. 캡처 시작 시점이 조금 다르거나 한 영상에서 프레임이 누락되면, 동일한 시간 인덱스가 서로 다른 사건을 가리킬 수 있습니다. 모델이 다른 시점의 정보를 잘못 가져온 것처럼 보여도 실제 원인은 입력 동기화일 수 있습니다. 평가 파이프라인은 원본 타임스탬프와 프레임률, 잘라낸 클립의 시작, 끝 위치를 보존해야 합니다.

작은 검증 세트에서는 같은 사건이 각 POV에서 몇 번째 프레임에 나타나는지 사람이 표시해 보는 것이 좋습니다. 그 차이가 전 구간에서 일정하면 시작 오프셋을 의심할 수 있고, 뒤로 갈수록 커지면 프레임률이나 누락 문제일 가능성이 있습니다. 동기화 오차를 고치기 전과 후의 성능을 비교하면 모델 능력과 데이터 파이프라인 문제를 분리할 수 있습니다.

POV마다 보이는 정보도 다릅니다. 한 화면에서 가려진 주체가 다른 화면에는 보일 수 있지만, 다른 시점의 카메라가 정답을 직접 보여 준다는 보장은 없습니다. 입력을 합칠 때는 각 프레임이 어느 카메라와 시각에서 왔는지를 모델이 구분할 수 있게 순서와 표기를 일관되게 유지해야 합니다. 영상을 단순히 이어 붙이고 출처를 잃으면 cross-video distractor에 더 취약해질 수 있습니다.

L1부터 L3까지 무엇이 더 어려워지는가

벤치마크는 복잡도를 L1부터 L3로 나누고 총 15개 작업을 구성합니다. 단순 관찰에서 시간 관계, 여러 영상 사이의 추론으로 올라갈수록 한 프레임의 물체 인식만으로는 답할 수 없습니다.

GameplayQA 전체 구성

L1~L3 작업 분류

Temporal distractor는 실제로 있었지만 질문의 시점과 다른 사건을 오답으로 놓습니다. Cross-video distractor는 다른 POV에서 본 주체나 사건을 현재 영상의 답처럼 보이게 합니다. 이 오답들은 모델이 화면 속 단어를 찾았는지보다 누가 언제 무엇을 했는지 추적했는지를 시험합니다.

원문의 실험은 현재 MLLM이 특히 시간적, 교차 영상 조건에서 실패한다고 설명합니다. 다만 이 글에 모델별 수치표가 없으므로 특정 모델의 정확도나 순위를 임의로 덧붙일 수는 없습니다.

L1은 맞고 L2, L3에서만 틀린다면 기본 시각 인식보다 시간 관계나 시점 결합이 병목일 수 있습니다. 모든 수준에서 같은 객체를 놓친다면 더 복잡한 추론 모듈보다 입력 해상도와 프레임 선택을 먼저 확인해야 합니다. Self를 Other로 바꾸는 오류가 반복되면 답의 명사를 맞혔더라도 주체 귀인은 실패한 것입니다. 작업 수준과 오류 유형을 교차해 보면 총점 하나보다 구체적인 개선 가설을 만들 수 있습니다.

프레임을 늘리면 놓침과 비용이 함께 바뀐다

라벨이 촘촘한 영상에서 프레임을 성기게 뽑으면 짧은 행동을 통째로 놓칠 수 있습니다. 모든 프레임과 여러 POV를 넣으면 시각 토큰, VRAM과 지연이 빠르게 늘어납니다. GameplayQA는 이 교환을 드러내는 평가이지 해결해 주는 압축 알고리즘은 아닙니다.

평가할 때는 총 정확도 외에 다음을 분리해서 보십시오.

  • Self, Other, World 중 어느 주체를 자주 혼동하는가
  • 사건은 찾았지만 시간 순서를 틀리는가
  • 단일 POV는 맞고 교차 영상에서 틀리는가
  • 프레임 샘플링을 바꿀 때 어떤 작업이 먼저 무너지는가
  • 정답 하나에 사용한 시각 토큰과 지연은 얼마인가

이렇게 분해해야 모델 교체, 시간 인코딩 개선, 프레임 선택 또는 시점 정렬 중 어디에 투자할지 결정할 수 있습니다.

프레임 샘플링은 평균 간격보다 사건 창으로 비교한다

균일 샘플링은 구현이 쉽지만 짧은 사건이 샘플 사이에서 발생하면 완전히 사라집니다. 반대로 움직임이 큰 구간만 고르면 화면 변화가 적은 상태 확인을 놓칠 수 있습니다. 같은 토큰 예산 안에서 균일 샘플, 질문 주변의 조밀한 샘플, 움직임 기반 샘플을 나눠 비교하면 어떤 작업이 어떤 선택 방식에 의존하는지 알 수 있습니다.

비교할 때 프레임 수만 적으면 충분하지 않습니다. 영상마다 실제로 포함된 시간 범위, POV 수, 프레임 해상도와 시각 토큰 수를 함께 기록해야 합니다. 프레임 수를 늘린 설정이 더 높은 성능을 내더라도 입력 토큰과 지연이 두 배라면 제품 조건에서는 다른 결론이 나올 수 있습니다. 정확도 대비 비용 곡선을 그려야 무조건 많은 프레임을 넣는 선택을 피할 수 있습니다.

질문에 답한 뒤 근거 프레임이나 시간 구간도 남겨 보십시오. 정답은 맞았지만 근거가 사건과 무관하면 선택지의 언어 패턴으로 맞혔을 가능성이 있습니다. 반대로 근거 사건을 찾았는데 주체만 틀렸다면 영상 검색 단계보다 귀인 단계가 문제입니다. 근거 표시는 완전한 설명 가능성을 보장하지 않지만 오류 검토 시간을 줄여 줍니다.

벤치마크를 제품 능력으로 오해하지 않는다

GameplayQA 점수가 높아도 실제 게임을 안전하게 조작하거나 로봇을 제어할 수 있다는 뜻은 아닙니다. 이 데이터는 의사결정이 촘촘한 3D 가상 환경의 이해를 평가합니다. 행동 실행, 장기 계획, 지연된 피드백과 현실 센서 오류는 별도 문제입니다.

반대로 팀의 도메인으로 같은 밀도의 학습 데이터를 만들려 하면 라벨링 비용이 큽니다. 초당 1.22개 수준의 주석과 다중 영상 동기화를 유지해야 하기 때문입니다. 처음에는 파인튜닝 데이터로 복제하기보다 평가 분류 체계로 활용하는 편이 현실적입니다.

자체 데이터로 확장할 때는 같은 플레이 세션의 인접 클립이 학습과 평가에 나뉘지 않게 해야 합니다. 장면 배경, 지도와 플레이어 습관이 거의 같은 클립이 양쪽에 들어가면 모델이 사건을 추론하지 않고 익숙한 화면을 기억해도 점수가 높아질 수 있습니다. 세션이나 에피소드 단위로 분리하고, 가능하면 평가에는 보지 못한 지도, 주체 조합을 둡니다.

오답 선택지도 품질을 점검해야 합니다. 너무 터무니없는 선택지는 시각 입력 없이도 제거할 수 있고, 정답만 문장 길이나 표현이 다르면 언어 편향이 생깁니다. Temporal distractor와 cross-video distractor가 실제 영상에 등장하면서도 질문 조건에는 맞지 않는지 사람이 확인해야 합니다. 텍스트만 넣은 기준선이 높은 점수를 낸다면 영상 이해 평가로서 누수가 있는지 먼저 의심합니다.

우리 모델을 시험하는 최소 절차

먼저 동일한 영상에서 프레임 샘플 수만 바꿔 L1~L3와 distractor 종류별 결과를 기록합니다. 다음으로 POV 하나와 여러 POV를 비교해 동기화 입력이 실제로 도움을 주는지 확인합니다. 마지막에는 오답을 주체 혼동, 시간 혼동, 다른 영상 혼동으로 사람이 다시 분류합니다.

평가를 반복할 때는 디코딩 설정과 선택지 순서도 고정합니다. 같은 입력을 여러 번 물었을 때 답이 크게 달라지면 평균 정확도와 함께 일관성도 기록합니다. 선택지 순서를 바꿔 결과가 달라지는지, 영상 없이 질문만 줬을 때 무엇을 맞히는지도 간단한 대조군이 됩니다. 이 절차는 성능이 높아진 이유가 시간 이해 개선인지 프롬프트 우연인지 구분하는 데 도움이 됩니다.

작업별 오류 양상

모든 문제에 더 많은 프레임을 넣는 대신 실패 유형에 맞는 입력을 추가해야 합니다. GameplayQA의 가치는 “모델이 게임을 잘한다”는 단일 점수를 만드는 것이 아니라, 동적 환경에서 그럴듯한 환각이 생기는 위치를 좁혀 주는 데 있습니다.

도입 중단 기준도 명확히 둘 필요가 있습니다. 다중 POV를 추가해도 단일 POV보다 나아지지 않거나, 동기화를 교정한 뒤에도 cross-video 오류가 반복되면 더 많은 영상 투입만으로 해결되지 않을 수 있습니다. 토큰 예산을 크게 늘렸는데 L2, L3 개선이 미미하면 시간 표현이나 학습 방식이 병목일 가능성이 큽니다. 반대로 소수의 고밀도 사건 창에서만 좋아진다면 전체 영상을 비싸게 처리하기보다 사건 후보를 먼저 찾는 2단계 구조가 더 적합합니다.

자료:

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    8개 장 18 분읽는 시간