버튼 이름과 DOM 구조가 바뀌는 화면에서는 MolmoWeb의 시각 접근이 유리할 수 있지만, 결정론적인 웹 자동화에서 DOM을 완전히 버릴 이유는 없습니다. 픽셀은 실제로 보이는 상태를 알려 주고, DOM은 정확한 값과 빠른 조작을 제공하므로 작업에 따라 선택하거나 함께 써야 합니다.
AI2의 MolmoWeb 저장소는 Molmo 2 기반 8B 시각 언어 모델이 브라우저 스크린샷을 보고 행동하도록 설계됐습니다. 입력은 화면 이미지와 URL, 페이지 제목, 최근 행동 이력입니다. 숨겨진 노드까지 읽는 대신 사람이 보는 좌표를 예측해 클릭하거나 입력합니다.