포스트

물리 문제에서 그림 한 줄을 놓치면? P1-VL의 시각, 논리 학습

올림피아드 물리 문제에서는 식을 잘 풀어도 그림의 방향, 길이, 연결 관계를 하나 놓치면 틀리며, P1-VL은 이 시각, 논리 간극을 학습 과정과 검증 에이전트로 줄이려는 모델입니다. 커리큘럼 강화학습으로 쉬운 관계부터 복합 조건까지 학습하고, PhysicsMinions가 풀이를 여러 역할로 점검합니다. 다만 벤치마크의 금메달 수는 특정 평가 결과이므로 개별 풀이의 도식 해석과 중간 계산을 다시 검증해야 합니다.

물리 도식의 어려움은 왜 OCR 다음에 시작될까?

도식의 문자와 숫자를 읽는 것만으로는 충분하지 않습니다. 화살표가 힘인지 속도인지, 두 선이 연결됐는지 교차했을 뿐인지, 기준축이 어느 방향인지가 식의 부호와 조건을 결정합니다. P1-VL은 시각 인식 결과를 물리적 관계와 이어서 추론하는 데 초점을 둡니다.

물리 도식의 시각 정보와 논리 추론을 잇는 문제 설정

따라서 성능을 볼 때 최종 답만 맞았는지보다, 그림에서 어떤 조건을 추출했고 그 조건이 식에 어떻게 들어갔는지 확인해야 합니다.

예를 들어 화살표를 읽었다는 사실만으로는 그것이 힘, 속도, 이동 방향 중 무엇인지 알 수 없습니다. 선의 교차도 실제 연결점인지 단순한 겹침인지에 따라 회로와 역학 조건이 달라질 수 있습니다. 시각 인식은 기호를 텍스트로 바꾸는 단계이고, 과학 추론은 그 기호가 물리 법칙에서 맡는 역할을 결정하는 단계입니다.

오류 분석도 두 단계로 나누는 편이 좋습니다. 도식의 표기 자체를 잘못 읽었다면 인식 오류이고, 표기는 맞게 읽었지만 잘못된 식에 넣었다면 관계 추론 오류입니다. 최종 답만 보면 두 원인이 섞이므로 어떤 학습이나 검증이 필요한지 판단하기 어렵습니다.

왜 쉬운 문제부터 난도를 올려 학습할까?

학습은 120만 개의 물리 문제와 설명을 바탕으로 난도를 점진적으로 높이는 커리큘럼 강화학습을 사용합니다. 처음부터 가장 복잡한 올림피아드 문제만 주기보다, 시각 요소와 기본 관계를 익힌 뒤 여러 조건이 결합된 문제로 이동합니다.

커리큘럼 학습과 모델 구성

두 모델 규모도 구분해야 합니다. P1-VL-235B-A22B는 전체 235B 중 22B가 활성화되는 MoE이고, 더 작은 P1-VL-30B-A3B는 전체 30B 중 3B가 활성화됩니다. 전체 파라미터와 한 번의 추론에 쓰는 활성 파라미터는 배포 비용을 판단할 때 서로 다른 지표입니다.

커리큘럼의 장점은 어려운 문제를 단순히 뒤로 미룬다는 데 있지 않습니다. 방향과 연결 같은 기본 관계를 먼저 익힌 뒤 여러 관계가 동시에 등장하는 문제로 확장하면, 어느 단계에서 오류가 늘어나는지 추적할 수 있습니다. 반면 쉬운 문제의 표현 방식이 어려운 문제와 너무 다르면 앞 단계의 학습이 그대로 이어지지 않을 수 있습니다.

120만 개라는 데이터 규모 역시 품질과 다양성을 대신하지는 않습니다. 같은 유형의 설명이 반복되거나 그림 없이 풀 수 있는 문제가 많다면 도식 추론 능력을 과대평가할 수 있습니다. 숫자나 배치를 바꾼 문제에서도 관계를 일관되게 읽는지 확인해야 학습된 원리를 판단할 수 있습니다.

모델 선택에서는 전체 용량, 활성량, 결과 품질을 함께 봐야 합니다. 235B와 30B라는 전체 수치만 비교하거나 22B와 3B라는 활성 수치만 비교하면 메모리와 추론 비용을 모두 설명하지 못합니다. 실제 환경에서는 같은 대표 문제로 풀이 품질과 처리 자원을 측정해야 합니다.

PhysicsMinions는 풀이의 어느 부분을 검증할까?

PhysicsMinions는 한 번의 답에 의존하지 않고 역할을 나눠 풀이를 점검하는 구조입니다. 문제 해석, 식 전개, 결과 검산처럼 서로 다른 관점의 출력을 비교하면 단일 모델이 놓친 부호나 조건을 발견할 기회가 생깁니다.

여러 에이전트가 풀이를 생성하고 점검하는 흐름

하지만 여러 에이전트가 같은 잘못된 그림 해석을 공유하면 합의도 틀릴 수 있습니다. 에이전트 수를 늘리는 것보다 독립적인 도식 판독과 단위, 경계조건 검사를 분리하는 것이 중요합니다.

역할 분담이 유효하려면 각 에이전트가 같은 문장을 반복하는 데 그치지 않아야 합니다. 한 역할은 도식에서 조건을 목록화하고, 다른 역할은 그 조건으로 식을 세우며, 또 다른 역할은 단위와 극한 상황을 확인하는 식으로 실패 원인을 나눌 수 있습니다. 여러 답의 다수결보다 서로 다른 검증 근거가 있는지가 중요합니다.

공통 오류를 줄이려면 처음 해석을 그대로 모든 역할에 전달하지 않는 방식도 생각해야 합니다. 적어도 핵심 방향과 연결 관계는 독립적으로 판독한 뒤 불일치가 있을 때 사람에게 넘기는 편이 낫습니다. 합의가 빠르다는 사실은 정확성의 근거가 아니며, 중요한 조건에서 의견이 갈리는 지점이 오히려 유용한 경고가 될 수 있습니다.

순위와 금메달 수는 어디까지 믿어야 할까?

HiPhO 평가 결과와 모델별 금메달 수

원문의 HiPhO 결과 그림은 12개 금메달 기준에서 기본 235B-A22B 모델을 Gemini-3-Pro(high), GPT-5.2(high)에 이어 3위로 제시합니다. PhysicsMinions를 붙인 구성은 2위, 30B-A3B 모델은 9개 금메달로 보고됩니다. 이는 해당 벤치마크와 평가 설정의 순위이지 모든 과학 추론에서의 일반 순위가 아닙니다.

실제 활용 전에는 답이 맞았던 문제도 그림을 가리거나 숫자를 바꿔 다시 풀게 해 암기 가능성을 확인해야 합니다. 풀이 중간의 단위, 부호, 극한 조건을 자동 검사하고 최종 판단은 사람이 검토해야 합니다. 특히 작은 표기 하나가 답을 바꾸는 문제에서는 높은 평균 점수가 개별 풀이의 신뢰성을 보장하지 않습니다.

비교표를 읽을 때는 기본 모델과 PhysicsMinions를 붙인 구성을 구분해야 합니다. 검증 에이전트를 추가한 결과는 모델 하나의 추론 능력뿐 아니라 여러 번의 생성과 점검에 든 계산까지 포함합니다. 운영 환경에서 같은 향상을 기대하려면 정확도와 함께 응답 시간, 호출 수, 검토 비용을 기록해야 합니다.

실전 시험 세트는 정답률만 집계하지 않는 편이 좋습니다. 도식 추출, 식 수립, 계산, 검산의 네 단계 중 첫 오류가 어디에서 생겼는지 표시하고, 숫자와 방향을 바꾼 변형에서도 같은 원리를 적용하는지 봅니다. 모델들이 같은 오답에 합의하거나 근거 없이 정답만 맞힌 경우는 별도 실패로 다뤄야 합니다.

P1-VL을 채점 보조나 학습 도구로 검토할 수는 있지만, 학생의 풀이를 자동으로 확정하는 용도에는 더 높은 설명 가능성과 오류 통제가 필요합니다. 도식이 선명하고 관계가 명시된 문제에서 반복적으로 중간 근거가 맞는다면 제한된 보조 역할부터 시험할 수 있습니다. 반대로 작은 표기 변화에 답이 크게 흔들리거나 검증 역할이 같은 오류를 복제한다면 평균 순위와 관계없이 적용을 보류해야 합니다.

도식 추론 능력은 어떤 변형 문제로 확인할까?

첫 번째 변형은 숫자만 바꾸고 도식 관계를 유지하는 것입니다. 계산 결과는 달라도 힘의 방향과 연결 조건을 읽는 과정은 같아야 합니다. 답이나 특정 수치 패턴에 의존했다면 중간 식이 새 값과 맞지 않을 수 있습니다.

두 번째는 좌우를 뒤집거나 기준축 방향을 바꾸는 변형입니다. 표면적 모양은 비슷하지만 부호와 방향 관계가 달라지므로 시각 조건을 실제 식에 반영하는지 확인할 수 있습니다. 세 번째는 문제에 필요 없는 표기 하나를 추가해 모델이 모든 화살표를 무조건 중요한 조건으로 취급하는지 보는 방식입니다.

검증 결과는 최종 정답, 추출한 도식 조건, 선택한 법칙, 단위와 경계조건으로 나눠 비교해야 합니다. 원문 문제는 맞고 작은 변형에서만 실패한다면 일반적인 물리 추론보다 벤치마크 표현에 맞춘 가능성을 의심할 수 있습니다. PhysicsMinions를 쓸 때도 각 역할이 변형된 조건을 독립적으로 읽었는지 확인해야 다수결 오답을 줄일 수 있습니다.

문제의 그림을 가리고 텍스트만 주는 대조 실험도 유용합니다. 성능이 거의 같다면 모델이 시각 정보를 실제로 쓰지 않거나 텍스트만으로 답을 추측했을 가능성이 있습니다. 반대로 그림만 바꾸고 설명을 유지했을 때 답과 중간 조건이 함께 바뀌어야 시각 근거의 영향을 확인할 수 있습니다.

풀이 설명은 길이보다 검산 가능성을 봅니다. 사용한 기호가 도식의 어느 요소인지, 단위가 일관되는지, 극한 상황에서 결과가 물리적으로 가능한지 확인할 수 있어야 합니다. 자연스러운 설명이 잘못된 첫 해석을 가리는 경우도 있으므로 문체 점수와 근거 정확도를 섞지 않는 편이 좋습니다.

교육용으로는 모델 답을 정답지 대신 오류 탐지 과제로 보여 주는 방식이 더 안전할 수 있습니다. 학생이나 교사가 도식 조건과 식을 비교하고 반례를 찾게 하면 높은 점수에 의존하지 않으면서 보조 도구의 장점을 쓸 수 있습니다. 자동 채점으로 확장하려면 문제 유형별 오답 비용을 별도로 검증해야 합니다.

모델이 답을 보류해야 하는 조건도 평가에 넣어야 합니다. 흐릿한 첨자, 잘린 화살표, 서로 모순되는 도식처럼 입력 자체가 불완전할 때 억지로 식을 세우면 자연스러운 오답이 만들어집니다. 도식에서 읽은 사실과 문제 문장에서 얻은 사실을 구분해 출력하게 하고 둘이 충돌하면 확인을 요청하도록 설계할 수 있습니다. 올림피아드 점수가 높더라도 불완전한 교육 자료에서 불확실성을 표현하지 못한다면 채점 자동화보다 풀이 검토 보조에 범위를 제한하는 편이 맞습니다.

논문 페이지

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    6개 장 18 분읽는 시간