Magma의 핵심은 화면을 설명하는 모델과 행동을 고르는 모델을 따로 두지 않고, 텍스트, 좌표, action token을 한 멀티모달 모델에서 예측하는 것입니다. 다만 행동 토큰을 낸다는 사실과 웹이나 로봇을 안전하게 자율 실행한다는 것은 구분해야 합니다.
논문과 구현은 논문, 프로젝트 페이지, GitHub 저장소에서 연결됩니다.
Magma의 통합은 화면 클릭과 로봇 제어가 같은 위험과 정밀도를 요구한다는 뜻이 아닙니다. SoM, ToM이 행동을 표현하는 공통 단서를 주더라도 각 환경의 좌표 오차, 시간 지연과 안전 중단을 따로 검증해야 합니다.





