포스트

Magma는 UI 클릭과 로봇 행동을 어떻게 한 모델로 배우나: SoM, ToM 구조와 한계

Magma의 핵심은 화면을 설명하는 모델과 행동을 고르는 모델을 따로 두지 않고, 텍스트, 좌표, action token을 한 멀티모달 모델에서 예측하는 것입니다. 다만 행동 토큰을 낸다는 사실과 웹이나 로봇을 안전하게 자율 실행한다는 것은 구분해야 합니다.

Magma 개요

논문과 구현은 논문, 프로젝트 페이지, GitHub 저장소에서 연결됩니다.

Magma의 통합은 화면 클릭과 로봇 제어가 같은 위험과 정밀도를 요구한다는 뜻이 아닙니다. SoM, ToM이 행동을 표현하는 공통 단서를 주더라도 각 환경의 좌표 오차, 시간 지연과 안전 중단을 따로 검증해야 합니다.

기존 Vision-Language 모델과 무엇이 다른가

일반적인 Vision-Language 모델은 이미지나 비디오를 보고 질문에 답하거나 장면을 설명하는 데 초점을 둡니다. Magma는 여기에 acting을 같은 출력 공간으로 넣습니다.

예를 들면 웹 화면에서는 버튼 위치를 찾고 클릭 좌표를 만들며, 모바일 UI에서는 다음 화면으로 이동할 동작을 고릅니다. 로봇 장면에서는 물체와 조작 위치를 보고 다음 행동을 예측합니다. 과거 프레임과 행동을 함께 사용해 시간의 흐름도 다룬다는 것이 원문의 “공간-시간적 추론”입니다.

Magma의 이해와 행동 범위

여기서 모델이 직접 브라우저나 로봇 모터를 움직이는 것은 아닙니다. 모델이 만든 좌표와 행동을 실제 환경 명령으로 바꾸고 실행 결과를 다시 입력하는 연결 계층이 필요합니다. 따라서 모델 성능과 실행 시스템의 권한, 오류 처리, 안전 장치는 별도 문제입니다.

시각 토큰에서 행동 토큰까지 이어지는 구조

원문에 소개된 Magma 구성은 세 부분입니다.

  • 비전 인코더: CLIP-ConvNeXt-XXL 기반으로 이미지와 비디오 프레임을 visual token으로 변환
  • 언어 모델: LLaMA-3 기반 8.6B 모델로 텍스트 맥락과 출력을 처리
  • 멀티모달 결합: 시각과 언어 정보를 합쳐 텍스트, 좌표, action token을 출력

Magma 모델 구성

Magma 토큰 흐름

이 설계가 하나의 작업 전용 헤드만 의미하는 것은 아닙니다. 같은 기반 모델이 장면 이해 질문과 UI 위치 지정, 로봇 행동 예측을 함께 학습하도록 데이터를 구성했다는 점이 중요합니다.

실제 적용에서는 출력 종류를 먼저 구분해야 합니다.

출력의미실행 전에 필요한 확인
텍스트장면 설명, 계획사실성과 작업 제약
좌표UI 또는 조작 지점화면 크기, 좌표계, 유효 영역
행동 토큰다음 조작환경이 지원하는 명령과 권한

좌표가 맞아도 대상 버튼이 비활성일 수 있고, 올바른 로봇 목표점도 충돌 없는 궤적을 보장하지는 않습니다. 멀티모달 표현과 실행 가능성 검사는 나눠야 합니다.

SoM과 ToM은 공간과 시간을 각각 표시한다

Set-of-Mark와 Trace-of-Mark

Magma가 행동 데이터를 학습하기 위해 사용하는 핵심 표시는 SoM과 ToM입니다.

Set-of-Mark: 지금 어디를 조작할 것인가

Set-of-Mark(SoM)는 UI의 버튼, 입력창 또는 로봇이 조작할 영역을 시각적으로 표시합니다. 모델이 자연어 지시와 화면 요소를 연결해 클릭이나 조작 지점을 선택하도록 돕습니다.

SoM의 장점은 후보 위치를 명시적으로 드러낸다는 것입니다. 반대로 표시가 빠지거나 잘못된 대상에 붙으면 모델이 선택할 후보 자체가 왜곡될 수 있습니다. 실제 UI가 바뀌었을 때 mark 생성 단계도 함께 검증해야 합니다.

Trace-of-Mark: 대상이 어떻게 움직였는가

Trace-of-Mark(ToM)는 비디오에서 물체의 이동 흔적을 표시해 시간에 따른 행동 패턴을 학습하게 합니다. 한 프레임의 위치만 보는 대신 이전 움직임과 다음 행동을 연결하는 방식입니다.

Magma의 행동 학습 예시

두 표시는 역할이 다릅니다. SoM은 현재 장면의 행동 가능 지점을 구조화하고, ToM은 프레임 사이의 변화를 구조화합니다. UI 클릭 과제와 로봇 연속 조작을 같은 “행동 데이터”라고 부르더라도 필요한 표시는 같지 않습니다.

학습 규모와 벤치마크는 과제별로 읽어야 한다

원문에 제시된 학습 데이터는 다음 규모입니다.

  • 웹 UI 스크린샷 270만 개
  • 로봇 조작 97만 에피소드, 약 940만 행동 샘플
  • 비디오 클립 약 2,500만 개
  • GPT-4V, LLaVA 기반 멀티모달 데이터 120만 개

학습 방식으로는 self-supervised learning, next-token prediction, 행동 최적화를 위한 reinforcement learning이 소개됩니다. 여러 데이터가 같은 양으로 같은 목적에 쓰였다고 해석해서는 안 됩니다. UI의 정적 요소 선택, 로봇의 연속 행동, 비디오의 시간 이해는 서로 다른 신호를 제공합니다.

벤치마크 표도 과제별로 나눠 읽어야 합니다.

과제비교 모델비교 점수Magma-8B
Mind2Web 웹 UIGPT-4V + OmniParser57.7%67.3%
AITW 모바일 UIGPT-4V + OmniParser59.3%67.3%
Google RobotOpenVLA31.7%52.3%
BridgeOpenVLA14.5%35.4%

이 결과는 Magma가 해당 벤치마크에서 비교 모델보다 높은 점수를 냈다는 뜻입니다. UI 점수와 로봇 점수의 척도가 같다는 뜻도 아니고, 모든 웹사이트나 모든 로봇에서 동일한 성공률이 나온다는 뜻도 아닙니다. 기존 글의 “10~20% 성능 향상”처럼 서로 다른 과제의 차이를 하나의 범용 향상률로 합치면 정보가 줄어듭니다.

실제 에이전트로 쓸 때 확인할 것

Magma가 잘 맞는 후보는 화면 이해와 좌표 행동이 함께 필요한 UI 자동화, 시각 피드백으로 다음 조작을 정하는 로봇 연구, 영상에서 행동 흐름을 학습하는 과제입니다. 반면 의료 영상 진단처럼 원문에 벤치마크나 실행 구조가 제시되지 않은 분야까지 같은 성능을 기대할 근거는 이 글에 없습니다.

적용 전에는 다음 질문이 필요합니다.

  1. 모델 출력이 텍스트, 좌표, 행동 중 무엇인가?
  2. 좌표계와 화면, 카메라 해상도를 어떻게 맞추는가?
  3. 실행 실패 뒤 새 화면이나 로봇 상태를 어떻게 다시 관찰하는가?
  4. 로그인, 삭제, 결제나 물리적 충돌처럼 위험한 행동을 어디서 차단하는가?
  5. Mind2Web, AITW 또는 로봇 벤치마크가 실제 환경과 얼마나 비슷한가?

Magma가 보여주는 방향은 분명합니다. 멀티모달 모델을 “보고 말하는 모델”에서 “보고 다음 행동을 제안하는 모델”로 넓힙니다. 하지만 유용한 에이전트가 되려면 그 제안을 실제 시스템이 검증하고 제한하며, 실행 결과를 다시 관찰하는 폐루프가 함께 있어야 합니다.

SoM은 “무엇을 누를까”를 좌표 문제로 바꾼다

UI 화면에 번호나 표식을 붙이면 모델은 자연어로 요소를 묘사하는 대신 표식과 행동을 연결할 수 있습니다. 그러나 작은 icon, 겹친 box, scroll 뒤 새 layout에서는 표식이 잘못 붙을 수 있습니다. 원본 요소와 SoM box의 위치를 비교하고, 같은 label이 여러 개일 때 주변 문맥을 구분하는지 확인해야 합니다.

로봇 장면에서도 물체 중심을 표시하는 것과 실제 grasp point를 찾는 것은 다릅니다. 화면상 좌표가 맞아도 depth와 접근 방향이 틀리면 행동은 실패합니다. SoM 기반 grounding 점수와 실제 trajectory 성공률을 분리해 보는 이유입니다.

ToM은 결과뿐 아니라 움직임 경로를 학습한다

Trace-of-Mark는 시간에 따른 위치나 행동 흔적을 표시해 한 frame의 목표점만으로 알기 어려운 motion을 제공합니다. trajectory가 부드럽게 보이는지보다 장애물을 피하고 목표 상태에 도달했는지를 확인해야 합니다. 사람 시연의 느린 움직임과 로봇의 제어 주기가 다르면 그대로 모방할 때 지연이 생길 수 있습니다.

평가에서는 시작, 중간, 끝 위치, 경로 길이, 충돌, 완료 시간을 기록합니다. UI는 클릭 뒤 예상 화면, 로봇은 센서로 확인한 실제 상태가 목표와 맞는지를 봅니다. 모델이 action token을 올바르게 생성했어도 실행기가 좌표계를 잘못 변환하면 실패하므로 perception, planning, execution을 따로 로그로 남깁니다.

통합 모델의 이득을 검증하는 비교

UI 전용 모델, 로봇 전용 모델, Magma 계열 통합 모델을 같은 과제에서 비교합니다. 공통 pretraining이 적은 task data에서 전이를 돕는지, 반대로 한 domain의 표현이 다른 domain의 정확도를 떨어뜨리는지 봅니다. 평균 점수보다 domain별 최저 성능과 새 interface, 새 robot에서의 적응량이 중요합니다.

실제 배포에서는 write, purchase, delete 같은 UI 행동과 물리적 충돌 가능성이 있는 로봇 행동에 승인과 중단 조건을 둡니다. Magma가 행동을 생성할 수 있다는 사실은 실행 권한을 무제한으로 줘도 된다는 뜻이 아닙니다. 통합의 가치는 여러 행동 데이터를 한 형식에서 배우는 데 있고 안전 책임은 환경별 제어층에 남습니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

SoM과 ToM은 무엇이 다른가요?

SoM은 화면, 장면의 요소를 표식으로 지정해 공간 grounding을 돕고, ToM은 시간에 따른 행동 경로와 변화를 표현합니다.

UI 클릭 성능이 좋으면 로봇 제어도 안전한가요?

아닙니다. 로봇은 depth, 접촉, 지연과 충돌을 추가로 다뤄야 하므로 실제 trajectory와 안전 중단을 별도로 평가해야 합니다.

통합 모델을 평가할 때 평균 점수만 보면 되나요?

domain별 정확도와 새 환경 전이, 좌표, trajectory 오류, 실행 뒤 상태를 나눠 봐야 한 domain의 이득이 다른 실패를 가리지 않습니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    10개 장 17 분읽는 시간