포스트

미로를 풀 때 프레임을 늘리면 왜 나아질까: Visual Test-Time Scaling

미로나 탱그램처럼 공간 상태가 계속 바뀌는 문제에서는 텍스트 설명만 늘리기보다 중간 프레임으로 현재 상태를 남기는 편이 도움이 될 수 있습니다. Thinking in Frames의 핵심은 완성 영상을 만드는 것이 아니라, 다음 행동을 결정할 시각적 작업 메모를 생성하는 데 있습니다. 프레임 예산을 늘리면 더 잘게 나눠 탐색할 수 있지만, 잘못 그린 상태도 다음 단계의 입력이 되므로 정확도와 비용이 함께 좋아진다고 가정해서는 안 됩니다.

프레임은 답이 아니라 작업 메모다

Thinking in Frames는 한 장의 입력에서 곧바로 결론을 내리지 않습니다. 모델이 이동이나 조립의 중간 상태를 프레임으로 만들고, 그 시각적 문맥을 다음 추론의 조건으로 사용합니다. 미로에서는 지나온 경로와 막힌 길을, 탱그램에서는 배치된 조각과 남은 공간을 외부화하는 셈입니다.

시각적 중간 상태를 이어 가는 추론 방식

이 방식의 장점은 문장으로 옮길 때 사라지기 쉬운 위치와 형태를 같은 표현 공간에 남긴다는 점입니다. 단, 생성된 프레임이 실제 상태를 잘못 그리면 다음 단계도 그 오류를 사실처럼 이어받습니다.

작동 흐름은 세 단계로 볼 수 있습니다. 먼저 입력 이미지와 과제 규칙에서 현재 상태를 읽습니다. 다음으로 이동하거나 조각을 놓은 뒤의 후보 상태를 프레임으로 만들고, 그 결과를 새 문맥으로 다시 모델에 넣습니다. 마지막으로 목표에 도달했는지 확인하거나 다음 후보를 선택합니다. 텍스트 CoT가 “어디로 움직였는지”를 문장으로 기록한다면 이 방식은 이동 뒤의 배치를 다시 그려 놓는 셈입니다.

이 차이는 좌표와 경계가 핵심일 때 커집니다. 미로에서 “오른쪽으로 갔다”는 문장만으로는 어느 갈림길의 오른쪽인지 놓치기 쉽지만, 경로가 표시된 프레임은 현재 위치와 방문 영역을 동시에 보여줄 수 있습니다. 탱그램도 “삼각형을 회전했다”는 설명보다 회전 뒤 남은 빈 공간을 보는 편이 다음 조각의 배치를 판단하기 쉽습니다. 반대로 프레임에 벽이 사라지거나 조각 크기가 바뀌면 시각 기록이 오히려 잘못된 확신을 강화합니다.

Visual Test-Time Scaling은 무엇을 늘리나

이 연구의 테스트타임 스케일링은 답변 문장의 길이가 아니라 생성하는 시각적 중간 단계의 수를 늘립니다. 프레임 예산을 나타내는 계수 κ를 키우면 모델이 더 세밀한 경로를 탐색하거나 조립 단계를 나눌 여지가 생깁니다.

프레임 예산을 늘렸을 때의 추론 흐름

그렇다고 프레임이 많을수록 항상 좋은 것은 아닙니다. 매 단계의 작은 위치 오류가 쌓일 수 있고, 동일한 상태를 반복 생성하며 계산량만 늘 수도 있습니다. 따라서 정확도와 함께 생성 프레임 수, 지연 시간, 첫 오류가 발생한 단계를 측정해야 합니다.

κ를 늘린다는 것은 한 번의 답에 쓸 수 있는 시각적 연산 예산을 늘린다는 뜻입니다. 쉬운 미로에서는 적은 단계로도 충분한데 모든 문제에 같은 큰 κ를 쓰면 중복 프레임이 늘어납니다. 어려운 문제에만 추가 예산을 주려면 먼저 낮은 예산으로 시도하고, 목표 미도달이나 규칙 위반이 감지된 사례만 확장하는 방식이 적합합니다. 이때 “모델이 자신 없어 보인다”는 주관적 신호보다 목표 도달 여부, 벽 통과 여부, 조각 중첩처럼 과제에서 계산할 수 있는 검사를 사용하는 편이 낫습니다.

비용 비교도 같은 출력 품질에서 해야 합니다. 프레임을 네 장 만든 모델과 한 장 만든 모델의 정확도만 비교하면 추가 생성 비용을 숨기게 됩니다. 문제 하나당 생성 프레임 수, 총 지연, 실패 후 재시도 횟수를 함께 기록하면 프레임 스케일링이 실제로 효율적인지 판단할 수 있습니다.

어떤 평가에서 효과를 보였나

연구는 Maze Navigation과 Tangram Puzzle을 사용해 시각적 문맥과 프레임 스케일링을 평가합니다. 학습 때와 다른 아이콘을 쓰는 조건도 포함해, 특정 모양을 외운 것인지 구조를 따라가는 것인지 살펴봅니다.

미로와 탱그램 평가 예시

학습 분포 밖 아이콘을 사용한 일반화 평가

결과는 시각적 중간 상태가 이 과제들에서 유용하다는 근거를 주지만, 곧바로 일반적인 물리 이해나 모든 비디오 추론 능력을 입증하지는 않습니다. 정해진 규칙과 명확한 시각 상태를 가진 퍼즐에서 얻은 성과라는 범위를 유지해야 합니다.

학습 때와 다른 아이콘을 사용한 평가는 모양 자체를 외웠는지와 이동 규칙을 배웠는지를 분리하려는 장치입니다. 그러나 아이콘 변화에 견딘 결과만으로 배경이 복잡하거나 관측 일부가 가려진 실제 영상까지 일반화됐다고 말할 수는 없습니다. 미로와 탱그램은 상태 전이가 명확하고 정답 검사가 가능한 반면, 현실 영상은 보이지 않는 원인과 불완전한 관측이 섞이기 때문입니다.

평가표에는 최종 정답 외에 중간 상태의 충실도를 넣을 필요가 있습니다. 최종 답은 맞았지만 중간 프레임이 규칙을 위반했다면 우연한 복구일 수 있습니다. 반대로 초반 프레임은 정확했는데 마지막 선택에서 실패했다면 시각 생성보다 탐색 정책이 문제일 수 있습니다. 첫 오류 위치를 나누면 어느 구성 요소를 개선해야 하는지 알 수 있습니다.

적용 여부는 이렇게 판단한다

중간 상태를 이미지로 표현할 수 있고, 각 단계가 이전 상태와 비교 가능하다면 시험할 가치가 있습니다. 반대로 핵심 정보가 보이지 않는 인과관계나 외부 지식이라면 프레임을 더 만드는 것만으로 해결되지 않습니다.

실험할 때는 고정된 프레임 예산으로 시작한 뒤, 난도가 높은 사례에만 예산을 늘리는 방식이 합리적입니다. 동시에 생성 프레임이 입력 규칙을 위반하는지 검사하는 검증기를 두어야 합니다. Thinking in Frames는 시각적 작업 공간을 제공하지만, 그 작업 공간의 정확성을 자동으로 보장하지는 않습니다.

도입 여부는 다음 질문으로 좁힐 수 있습니다.

  • 중간 상태를 이미지 한 장으로 명확히 표현할 수 있는가?
  • 상태 전이가 규칙을 지켰는지 자동 또는 사람 검토로 판정할 수 있는가?
  • 추가 프레임이 만드는 지연보다 오류 감소의 가치가 큰가?
  • 첫 잘못된 프레임을 발견했을 때 이전 상태로 되돌릴 수 있는가?

네 질문에 답하기 어렵다면 텍스트 추론, 검색, 외부 시뮬레이터가 더 적합할 수 있습니다. 반대로 상태가 시각적이고 검증 규칙이 분명하다면 작은 프레임 예산부터 실험할 근거가 있습니다.

가장 단순한 비교 실험은 같은 문제 집합에 프레임 예산을 단계별로 적용하는 것입니다. 각 설정에서 최종 성공률뿐 아니라 유효한 중간 프레임 비율, 첫 규칙 위반 단계, 문제당 지연을 기록합니다. 예산을 늘려도 유효 프레임 비율이 떨어지거나 같은 상태가 반복된다면 그 지점이 실용적인 상한입니다. 이처럼 Thinking in Frames는 “더 오래 생각하기”보다 “검사 가능한 시각 상태를 얼마나 정확하게 이어 가는가”로 평가해야 합니다.

프레임 예산을 늘렸을 때 무엇을 비교해야 할까?

같은 미로와 탱그램 문제를 두고 프레임 예산 $\kappa$만 바꾸면 계산량과 정확성의 관계를 분리할 수 있습니다. 최소 예산에서는 첫 계획과 최종 답만 남기고, 더 큰 예산에서는 중요한 분기와 수정 상태를 추가합니다. 각 설정에서 첫 잘못된 프레임의 위치, 잘못된 상태가 뒤 단계에서 복구됐는지, 전체 생성 시간을 함께 기록해야 합니다.

중간 프레임의 품질은 최종 답과 별도로 평가합니다. 미로에서는 현재 위치와 방문 경로가 앞 프레임에서 이어지는지, 탱그램에서는 이미 배치한 조각이 사라지거나 겹치지 않는지 확인할 수 있습니다. 최종 모양이 우연히 맞더라도 중간 상태가 모순되면 다른 문제에서 같은 추론을 재현하기 어렵습니다.

예산을 늘렸는데 비슷한 장면만 반복되거나 첫 오류가 그대로 복제된다면 test-time scaling의 한계에 도달한 것입니다. 반대로 추가 프레임이 대안 비교와 오류 수정으로 이어지고 정답 개선이 생성 비용을 상쇄한다면 더 큰 $\kappa$를 쓸 근거가 생깁니다. 상태 변화가 없거나 검증을 통과했을 때 멈추는 조건을 두면 불필요한 프레임을 줄일 수 있습니다.

프레임을 사람에게 보여 줄 목적도 정해야 합니다. 내부 계산 흔적을 모두 노출하면 검토 부담이 커질 수 있으므로, 선택한 상태와 버린 대안, 규칙 위반을 발견한 지점처럼 의사결정에 필요한 장면을 남기는 편이 낫습니다. 반대로 안전이나 교육처럼 과정 확인이 핵심이면 최종 답만 저장해서는 이 접근의 장점을 잃습니다.

문제 유형이 바뀌면 같은 예산을 그대로 재사용하지 않습니다. 미로의 한 이동과 탱그램의 한 조각 배치는 상태 변화의 크기가 다르므로 “프레임 한 장”의 정보량도 다릅니다. 문제별로 유효한 상태 전이 수와 검증 가능한 단위를 기준으로 예산을 다시 정해야 합니다.

평가 세트에는 답을 만들 수 없는 문제도 넣어, 모델이 그럴듯한 프레임을 계속 생성하지 않고 중단하는지 확인해야 합니다.

검증기는 생성 모델과 다른 방식으로 상태를 확인하는 편이 좋습니다. 같은 모델에게 “이 프레임이 맞는가”를 다시 묻기만 하면 처음의 시각 오류를 그대로 승인할 수 있습니다. 미로의 벽 충돌이나 탱그램의 조각 겹침처럼 계산 가능한 규칙은 별도 프로그램으로 검사하고, 규칙을 통과한 경우에만 다음 프레임으로 진행하면 오류 전파를 줄일 수 있습니다. 자동 검사가 불가능한 문제라면 중간 프레임의 신뢰도를 낮게 표시하고 최종 답과 함께 사람에게 검토 근거를 남겨야 합니다.

논문 페이지

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    6개 장 19 분읽는 시간