HopChain의 해법은 각 추론 단계가 이전 단계에서 찾은 시각 객체에 의존하도록 질문을 만들어, 모델이 긴 답변 중에도 이미지로 계속 돌아가게 하는 것입니다. 단일 홉 정답을 이어 붙이는 것이 아니라 중간 시각 단서가 틀리면 다음 단계도 풀 수 없는 데이터 구조가 핵심입니다.
VLM이 추론 중 이미지를 잊는다면: HopChain의 멀티홉 데이터 설계
네 단계로 검증 가능한 질문을 만든다
먼저 이미지 속 객체와 속성의 카테고리를 식별하고, 인스턴스 분할로 각 객체의 픽셀 마스크를 만듭니다. 그 결과를 바탕으로 앞 단계의 객체 집합을 다음 단계가 좁히는 질문 트리를 생성합니다. 마지막에는 모호한 서술보다 숫자처럼 자동 채점 가능한 정답이 나오도록 ground truth와 난도를 보정합니다.
예를 들어 원통형 물체를 찾고, 그중 금속 재질만 고른 뒤, 선택된 하나의 줄무늬 수를 묻는 흐름입니다. 두 번째 단계에서 대상을 잘못 고르면 세 번째 숫자를 맞히기 어려워집니다. RLVR은 최종 정답을 명확히 검증하면서도 모델이 여러 번 시각적으로 grounding하도록 훈련할 수 있습니다.
합성 파이프라인의 어느 단계부터 검수할까
첫 객체 카테고리가 틀리면 올바른 마스크를 만들 수 없고, 마스크가 두 인스턴스를 합치면 질문 체인의 숫자도 달라집니다. 마지막 답이 계산 가능하다는 사실은 앞 단계가 정확하다는 뜻이 아닙니다. 카테고리, 인스턴스 마스크, 질문 의존성, 최종 정답을 서로 다른 품질 게이트로 두어야 합니다.
표본 검수는 최종 문장만 읽지 않고 이미지 위에 마스크와 홉별 선택 객체를 다시 표시합니다. 작은 물체 누락, 가려진 인스턴스의 중복, 배경을 객체로 잡은 오류와 같은 유형을 기록합니다. 한 단계라도 실패하면 뒤 질문이 자연스러워 보여도 학습 항목에서 제외하거나 수정해야 합니다.
자동 규칙도 쓸 수 있습니다. 최종 숫자를 원본 인스턴스 집합에서 다시 계산하고, 각 홉의 후보가 이전 홉의 부분집합인지 확인하며, 답이 하나로 결정되지 않는 체인은 보류합니다. 다만 규칙이 같은 분할 오류를 공유하면 놓칠 수 있으므로 사람 검수와 독립된 모델 또는 주석을 일부 섞어 오염률을 추정합니다.
체인의 길이보다 논리적 종속성이 중요하다
긴 설명을 생성한다고 멀티홉 추론이 되는 것은 아닙니다. 각 홉이 같은 이미지를 독립적으로 묻거나 마지막 답을 언어 상식만으로 추측할 수 있다면 중간 단계를 건너뛸 수 있습니다. HopChain은 인스턴스 ID와 영역을 이어 주어 다음 질문의 대상을 이전 결과로 제한합니다.
데이터 검사에서는 첫 홉을 제거했을 때 마지막 질문이 여전히 풀리는지, 서로 다른 객체가 같은 표현으로 섞이지 않는지, 최종 숫자가 분할 마스크에서 다시 계산되는지 확인해야 합니다. 체인을 길게 만드는 것보다 우회할 수 없는 연결을 만드는 편이 중요합니다.
진짜 종속성은 어떤 대조 시험으로 확인할까
중간 홉의 대상 표현을 다른 객체로 바꾸거나 순서를 섞었을 때 마지막 정답도 달라져야 합니다. 이미지 없이 언어만 본 모델이 높은 정확도를 얻는다면 질문 표현이나 숫자 분포에서 지름길을 찾았을 수 있습니다. 같은 질문 형식에 객체 배치와 답 분포를 바꾼 대조 세트를 만들어 언어 편향을 확인합니다.
첫 홉을 가린 조건, 중간 마스크를 잘못 준 조건과 전체 체인을 비교하면 모델이 어느 단계의 시각 정보를 쓰는지 볼 수 있습니다. 최종 답만 채점하지 말고 각 홉에서 선택한 객체 ID와 영역을 기록합니다. 첫 두 홉이 틀렸는데 마지막 숫자를 우연히 맞힌 사례를 성공으로 세면 멀티홉 능력을 과대평가합니다.
홉 수를 늘릴 때는 필요한 정보가 추가되는지 봅니다. 같은 속성을 표현만 바꿔 반복하거나 이미 하나로 좁혀진 대상을 다시 묻는 홉은 길이만 늘립니다. 체인 길이별 정확도뿐 아니라 홉당 정보 감소와 오류 누적을 함께 측정해야 유용한 난도를 만들 수 있습니다.
보고된 성능은 절제 실험과 함께 읽는다
원문은 Qwen3.5-35B에서 매우 긴 추론 과제의 정확도가 최대 50포인트 올랐고, 24개 벤치마크 중 20개에서 개선됐다고 소개합니다. 또한 홉을 절반으로 줄이면 평균 정확도가 5~7점 떨어졌다고 설명합니다. 이는 해당 모델, 합성 데이터와 학습 설정에서 보고된 결과입니다.
모든 VLM과 업무에서 같은 폭을 기대하면 안 됩니다. 단일 홉, 절반 체인, 전체 체인을 같은 토큰 예산으로 비교하고, 처음 보는 데이터셋에서도 이득이 남는지 봐야 합니다. 최종 정확도 외에 어느 홉에서 객체를 놓쳤는지 오류 유형을 기록하면 실제 일반화인지 판단하기 쉽습니다.
RLVR이 보상 지름길을 만들지는 않을까
숫자 정답은 자동 채점하기 쉽지만 답 분포가 치우치면 모델이 이미지를 보지 않고 자주 나오는 수를 고를 수 있습니다. 체인이 길수록 특정 문구나 홉 수가 정답과 우연히 연관될 수도 있습니다. 이미지, 질문을 섞은 대조 입력과 균형 잡힌 숫자 분포로 이런 지름길을 확인해야 합니다.
최종 보상만 주면 모델이 중간 시각 근거를 잘못 써도 마지막 숫자가 맞으면 강화됩니다. 가능하다면 홉별 선택 객체를 검증하고, 불가능하면 잘못된 중간 사슬을 사람 표본으로 따로 측정합니다. 긴 설명을 생성한다는 사실을 근거 충실성으로 간주하지 않습니다.
같은 총 토큰과 학습 예산에서 단일 홉 데이터 증가, HopChain 데이터와 혼합 구성을 비교합니다. 전체 체인이 좋아도 단순히 더 많은 계산이나 더 긴 학습 때문일 수 있습니다. 홉을 절반으로 줄인 절제 외에 데이터 수와 업데이트 횟수를 맞춘 기준선이 있어야 구조의 효과를 구분할 수 있습니다.
데이터 생성기의 오류가 학습을 오염시킨다
인스턴스 분할이 물체를 빠뜨리거나 두 개를 합치면 이후 질문과 정답이 모두 논리적으로 보이면서 틀릴 수 있습니다. 카테고리 식별, 마스크, 질문 의존성, 수치 정답을 각각 표본 검수하고 한 단계라도 실패한 항목은 학습에서 제외해야 합니다. 합성량보다 체인의 신뢰도가 우선입니다.
긴 CoT와 35B 모델의 RLVR은 VRAM과 학습 비용을 늘립니다. 논문 페이지에서 모델과 평가 조건을 확인하고, 먼저 2~3홉의 작은 도메인 세트로 데이터 오염률과 실제 성능 이득을 재는 편이 안전합니다. HopChain은 환각을 완전히 없애는 장치가 아니라 시각 근거를 건너뛰기 어렵게 만드는 훈련 데이터 설계입니다.
일반화는 어떤 경계에서 시험할까
학습과 같은 카테고리지만 배경만 달라진 세트, 처음 보는 객체, 가림이 강한 장면과 분할기가 어려워하는 작은 대상을 나눕니다. 합성 질문의 문장 틀도 바꿔 모델이 특정 표현을 기억한 것인지 봅니다. 동일한 생성 파이프라인으로 만든 평가만 쓰면 같은 오류와 편향을 공유할 수 있으므로 독립 데이터가 필요합니다.
일반화 실패를 최종 정확도 하나로 묶지 않습니다. 첫 객체 식별, 중간 필터와 수치 계산 중 어디에서 성능이 떨어지는지 기록합니다. 새로운 도메인에서 분할 오류가 주원인이라면 RLVR을 더 돌리기보다 데이터 생성기의 시각 주석을 개선해야 합니다. 언어 표현 변화에만 약하다면 질문 다양성 문제일 수 있습니다.
작은 파일럿에서는 생성한 항목 중 사람이 검수한 오류율, 학습 GPU 시간, 홉별 정확도와 처음 보는 데이터의 이득을 한 표에 둡니다. 오염을 제거하는 비용이 성능 이득보다 크거나 단일 홉 기준선과 차이가 없다면 규모를 늘리지 않습니다. 반대로 중간 근거의 정확성과 독립 평가가 함께 좋아질 때 도메인과 홉 수를 단계적으로 확장합니다.
재현 기록에는 원본 이미지 ID, 분할기와 카테고리 버전, 각 홉의 후보 집합, 질문 생성 설정과 최종 정답 계산을 함께 남깁니다. 완성된 질문, 답만 보관하면 오류가 객체 식별에서 시작됐는지 문장 생성에서 생겼는지 알 수 없습니다. 데이터 생성기를 고친 뒤에는 과거 항목을 그대로 섞지 말고 어느 버전에서 만들어졌는지 구분해야 합니다.
학습 결과도 최종 체크포인트 하나만 비교하지 않습니다. 같은 데이터 순서와 시드에서 단일 홉, 전체 체인과 오염을 제거한 체인을 평가하면 데이터 품질의 효과를 볼 수 있습니다. 중간 홉 출력이 공개되지 않는 모델이라면 최소한 이미지 가림과 질문 순서 교란에 대한 민감도를 남겨 시각 근거 사용 여부를 간접 확인해야 합니다.
함께 읽으면 이해가 이어지는 글
- VLM이 카메라 이동과 객체 이동을 헷갈리는 이유: DSR Suite와 GSM — DSR Suite가 2D video에 camera pose, point cloud, mask, trajectory를 더해 동적 공간 질문을 만드는 과정과, GSM이 질문에 필요한 geometry만 고르는 이유를 설명합니다.
- 영상의 다음 사건을 맞히려면: Video-CoE가 시간 근거를 강제하는 법 — Video-CoE의 사건 사슬 SFT와 형식, 시간 정렬, 정답 보상 GRPO가 미래 예측을 어떻게 훈련하는지, 공개 코드와 지연 한계까지 짚습니다.
- MM-Zero의 ‘데이터 0’은 사실일까: Proposer, Coder, Solver와 합성 편향 — 외부 이미지 없이 Proposer, Coder, Solver가 코드 렌더링 문제를 만들고 GRPO로 학습하는 MM-Zero의 의미와, 실사 일반화, Sandbox, GPU 한계를 정리합니다.
자주 묻는 질문
질문을 길게 연결하면 모두 멀티홉 추론 데이터인가요?
아닙니다. 앞 홉의 시각적 결과가 다음 홉의 대상을 실제로 제한해야 하며, 중간 홉을 제거해도 마지막 답을 풀 수 있다면 독립 질문의 나열에 가깝습니다.
숫자 정답이면 합성 데이터가 자동으로 정확한가요?
아닙니다. 처음의 객체 식별이나 인스턴스 분할이 틀리면 이후 계산도 논리적으로 보이면서 잘못될 수 있어 각 단계와 최종 숫자를 원본 마스크에서 다시 검증해야 합니다.
HopChain의 보고 성능을 다른 VLM에도 기대해도 되나요?
해당 모델, 데이터, 학습 설정의 결과이므로 단일 홉, 절반 체인, 전체 체인을 같은 예산으로 다시 비교하고 처음 보는 도메인에서도 이득이 남는지 확인해야 합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.


