긴 영상 질문에 답할 때 전체를 한 번에 요약하면 짧게 등장한 물체나 사건 순서가 압축 과정에서 사라지므로, 질문과 관련된 구간을 먼저 찾고 그 부분만 자세히 보는 편이 정확합니다. LongVideoAgent는 이 과정을 Master, Grounding, Vision 세 역할로 나눈 프레임워크입니다.
긴 영상 QA에서 전체를 요약하면 왜 틀릴까? LongVideoAgent의 구간 검색
세 Agent는 계획, 검색, 확인을 나눠 맡는다
Master Agent는 질문을 해석하고 어떤 정보가 필요한지 계획합니다. Grounding Agent는 subtitle이나 미리 만든 description을 이용해 관련 timestamp를 찾습니다. Vision Agent는 선택된 구간의 고해상도 frame을 보고 색, 객체, 행동처럼 요약에서 빠지기 쉬운 세부 정보를 확인합니다.
예를 들어 “주인공이 두 번째로 방에 들어왔을 때 무엇을 들고 있었나”라는 질문이라면 전체 줄거리 요약만으로는 답하기 어렵습니다. 먼저 두 번째 입장 시점을 찾아야 하고, 그 주변 frame에서 손에 든 물체를 봐야 합니다. 역할 분리는 긴 context 전체를 고해상도로 넣는 비용을 줄이면서 질문별로 필요한 증거에 계산을 집중시킵니다.
그러나 agent 수가 많다고 자동으로 정확해지는 것은 아닙니다. Grounding이 첫 번째 입장 장면을 고르면 Vision은 잘못된 구간을 매우 자세히 분석하게 됩니다. Master의 최종 문장이 자연스러워도 증거가 틀릴 수 있다는 뜻입니다.
강화학습은 호출 횟수와 정답을 함께 다룬다
원문은 Master Agent가 불필요한 tool call을 줄이면서 정확한 답을 내도록 reinforcement learning을 적용합니다. reward에는 최종 정답, 간결성, 중간 추론 품질이 포함됩니다. 구체적인 최적화 방식은 PPO 또는 GRPO 계열 선택지로 서술돼 있어, 이 글만으로 하나의 정확한 재현 algorithm을 확정할 수는 없습니다.
보고된 결과에서는 학습 뒤 agent call이 약 30% 줄었습니다. 호출 수 감소는 latency와 비용에 유리하지만, 필요한 확인까지 생략하면 정확도가 떨어집니다. 따라서 평균 call 수만 최적화하지 말고 질문 유형별 최소 evidence 수와 실패율을 함께 측정해야 합니다.
LongTVQA 결과는 질문 유형별로 읽는다
평가는 LongTVQA와 LongTVQA+를 사용하고 여러 multimodal backbone을 비교합니다. 원문은 non-agent baseline보다 약 15~20% 높은 결과를 보고합니다. 이 값은 dataset, backbone, 영상 길이, 사용할 수 있는 subtitle과 description 조건에 묶여 있습니다.
실제 테스트에서는 질문을 시간 순서, 짧은 객체 확인, 원인, 결과, 전체 주제처럼 나누는 편이 좋습니다. 전체 주제 질문은 요약이 잘 맞을 수 있지만, 짧은 세부 질문은 grounding 품질이 좌우합니다. 같은 평균 점수라도 어느 유형에서 개선됐는지 모르면 도입 판단을 내리기 어렵습니다.
Agent trace는 디버깅에 도움이 됩니다. 어떤 query로 어느 timestamp를 골랐고 어떤 frame을 근거로 답했는지 기록하면 오류 지점을 찾을 수 있습니다. 다만 trace가 남는다는 사실이 reasoning의 진실성을 보장하지는 않습니다. 선택된 실제 frame과 답의 관계를 사람이 표본 검수해야 합니다.
검색 실패를 감지하는 복구 절차가 필요하다
가장 큰 한계는 오류 전파와 latency입니다. Grounding이 틀리면 뒤 단계가 모두 흔들리고, 여러 agent 호출은 single-pass 방식보다 느릴 수 있습니다. subtitle이 없거나 장면 설명이 부정확한 영상에서도 성능을 다시 봐야 합니다.
도입 시에는 첫 검색이 불확실하면 인접 구간을 넓혀 재검색하고, 서로 다른 후보 timestamp를 Vision이 비교하게 하는 복구 경로가 필요합니다. 최종 답에는 근거 구간을 함께 남겨 검수가 가능하게 해야 합니다. LongVideoAgent의 핵심은 “여러 모델이 토론하면 더 똑똑하다”가 아니라 긴 영상에서 질문 관련 증거를 찾는 비용과 세부 확인 비용을 분리한 것입니다.
최종 Answer에는 근거 계약이 필요하다
자연스러운 문장만 반환하면 Master가 실제 frame을 확인했는지 알 수 없습니다. 답과 함께 검색 query, 선택한 timestamp, 확인한 frame 범위, 답을 지지하는 관찰을 남기게 합니다. “영상에서 보였다” 같은 설명이 아니라 어느 구간에서 누가 무엇을 들고 있었는지 연결해야 합니다. 이 정보가 없거나 서로 모순되면 정답처럼 보여도 검수 대상으로 보냅니다.
| 질문 유형 | 필요한 근거 | 자주 생기는 검색 오류 |
|---|---|---|
| 사건 순서 | 여러 timestamp의 앞뒤 관계 | 첫 사건과 두 번째 사건 혼동 |
| 짧은 객체 | 해당 구간의 고해상도 frame | subtitle에 없는 물체를 놓침 |
| 원인, 결과 | 행동 전후 구간 | 시간상 가까운 장면을 원인으로 오인 |
| 전체 주제 | 넓은 구간의 반복 단서 | 한 장면을 전체 내용으로 일반화 |
근거 contract는 설명 가능성을 꾸미기 위한 문장이 아니라 오류 검출 장치입니다. 선택 timestamp가 질문보다 뒤에만 있거나 답에 등장한 물체가 frame에 없으면 검색 또는 vision 단계가 실패한 것입니다. 사람이 모든 답을 볼 수 없더라도 이런 구조적 모순은 자동으로 보류할 수 있습니다.
Agent별 평가는 오류 전파 위치를 찾는다
Grounding은 정답 구간이 후보 안에 들어오는 recall로, Vision은 올바른 구간을 받았을 때 세부 질문에 답하는 정확도로 봅니다. Master는 필요한 tool을 선택하고 증거를 최종 문장에 반영하는지 평가합니다. end-to-end 점수만 낮으면 어느 agent를 바꿔야 할지 알 수 없지만 세 지표를 나누면 병목이 드러납니다.
예를 들어 정답 timestamp가 후보에 있었는데 다른 구간을 최종 선택했다면 Master의 비교가 문제일 수 있습니다. 후보 자체에 정답 구간이 없다면 query 생성이나 description index를 봐야 합니다. 올바른 frame을 제공해도 색이나 객체를 틀리면 Vision backbone의 세부 인식 문제입니다. 강화학습 뒤 호출이 줄었을 때도 이 세 지표 중 하나가 떨어지지 않는지 확인합니다.
Latency Budget은 질문 난도별로 배분한다
모든 질문에 같은 호출 수를 허용할 필요는 없습니다. 전체 주제 질문은 요약으로 충분할 수 있지만, “두 번째로 등장한 물체”처럼 순서와 세부 정보를 함께 묻는 질문은 여러 검색 후보와 frame 확인이 필요합니다. Master가 질문 유형을 잘못 판단하면 쉬운 질문에 비용을 쓰거나 어려운 질문을 성급히 끝낼 수 있습니다.
운영 기록에는 subtitle 검색 시간, frame decoding, Vision 호출, Master 호출과 총 시간을 따로 남깁니다. 실패 뒤 인접 구간을 넓힐 때 얼마의 추가 비용으로 정답을 회복했는지도 봅니다. 최종 목표는 호출 수 최소화가 아니라 허용 시간 안에서 정답 구간을 찾고, 그 frame으로 확인한 답만 반환하는 것입니다.
Subtitle이 없는 영상은 별도 경로가 필요하다
Grounding이 subtitle과 미리 만든 description에 크게 의존하면 대사가 없거나 자막 품질이 낮은 영상에서 후보 구간을 찾지 못할 수 있습니다. 이런 입력은 일정 간격의 visual index, 장면 전환, 객체, 행동 description을 이용한 검색을 따로 평가해야 합니다. 자동 description이 실제 frame에 없는 사건을 적으면 검색 단계부터 잘못된 근거가 만들어지므로 index 생성 결과도 표본 검수합니다.
자막이 있는 영상에서도 질문이 시각적 세부만 묻는다면 text 검색어가 정답 구간을 직접 가리키지 않을 수 있습니다. 대사 주변만 보는 방식과 넓은 시간 window, visual index를 함께 쓰는 방식을 비교해 정답 timestamp recall을 측정합니다. 어떤 source에서 찾은 후보인지 기록하면 subtitle 검색과 visual 검색의 기여를 구분할 수 있습니다.
종료 조건은 답 없음까지 포함한다
영상에 근거가 없는데 호출을 반복하면 비용만 늘고 마지막에는 그럴듯한 추측을 만들 수 있습니다. 후보 구간을 넓혀도 관련 frame이 없거나 서로 다른 후보의 증거가 충돌하면 “확인할 수 없음”으로 끝나는 조건이 필요합니다. 이 답을 실패로만 세지 말고, 실제로 근거가 없는 질문에서 추측을 피한 비율로 별도 평가합니다.
최대 검색 범위와 호출 수를 정하고, 종료할 때까지 확인한 구간을 남깁니다. 사람이 이어서 검수할 경우 같은 영상을 처음부터 다시 볼 필요가 없어집니다. LongVideoAgent의 신뢰성은 맞는 답을 잘 쓰는 것뿐 아니라, 근거를 찾지 못했을 때 더 많은 agent 문장으로 빈자리를 채우지 않는 능력까지 포함합니다.
함께 읽으면 이해가 이어지는 글
- MA-EgoQA는 로봇 6대의 영상을 함께 이해할까: 7일 기억과 EgoMAS 검색 — 여섯 에이전트의 7일치 1인칭 영상에서 질문에 답하는 MA-EgoQA와, Agent별 검색, 공유 Memory를 쓰는 EgoMAS의 정확도, 연산 한계를 정리합니다.
- EVA는 긴 영상 토큰을 얼마나 줄일까: SFT, KTO, GRPO와 탐색 지연 — EVA가 긴 영상을 요약, 계획, 행동, 반성 루프로 탐색하는 방식을 살펴보고, 토큰 절감과 반복 추론 지연 사이의 실제 교환을 짚습니다.
- MMM은 1분 영상을 빠르고 선명하게 만들까: Global Mean, Local Mode의 경계 — MMM이 긴 영상의 전체 흐름과 짧은 영상의 세부 품질을 두 Head로 나누는 방식을 살펴보고, 슬라이딩 윈도 경계, 데이터, 속도 검증 과제를 정리합니다.
자주 묻는 질문
긴 영상을 먼저 전체 요약하면 왜 세부 질문에 약한가요?
요약 과정에서 잠깐 등장한 물체, 두 번째 사건, 정확한 순서가 사라질 수 있어 질문 관련 구간을 먼저 검색하고 해당 frame을 확인해야 합니다.
Agent 호출 수가 줄면 항상 좋아진 건가요?
아닙니다. 불필요한 호출은 줄여야 하지만 필요한 증거 확인까지 생략될 수 있으므로 질문 유형별 정답률과 근거 회수율을 함께 봐야 합니다.
Grounding이 틀린 구간을 찾으면 어떻게 복구하나요?
인접 구간을 넓히거나 여러 timestamp 후보를 검색해 Vision Agent가 비교하고, 최종 답에 선택한 근거 구간을 남기는 절차가 필요합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.