포스트

CUA-Suite의 600만 프레임이 GUI Agent를 고칠까: 30fps, 궤적, 샘플링 비용

CUA-Suite의 600만 프레임은 GUI 에이전트가 놓치던 연속 행동을 학습할 재료지만, 프레임을 많이 넣는 것만으로 전문 앱 조작이 해결되지는 않습니다.

스크린샷 사이에 사라진 행동을 기록한다

스크린샷 몇 장과 클릭 좌표만 있으면 드래그 과정, 메뉴가 열리는 순간, 커서가 목표를 찾는 경로가 사라집니다. VideoCUA는 87개 전문 애플리케이션에서 전문가가 수행한 55시간의 작업을 30fps로 기록해 약 600만 프레임을 구성합니다. 키프레임, 바운딩 박스와 상호작용 로그가 같은 궤적에 붙습니다.

CUA-Suite 수집과 주석 구조

이 밀도는 결과 화면만 맞히는 모델과 과정을 따라가는 모델을 구분하게 해 줍니다. 클릭 직전의 커서 이동과 패널 전환을 보면 무엇을 목표로 했는지 추정할 단서도 늘어납니다. 그러나 모든 30fps 프레임이 같은 정보량을 가진 것은 아닙니다. 정지 화면이 대부분인 구간을 전부 토큰화하면 학습 비용만 커질 수 있습니다.

VideoCUA와 GroundCUA의 역할은 다르다

VideoCUA가 시간에 따른 행동 시연이라면 GroundCUA는 화면의 조작 대상을 찾는 데이터입니다. 원문은 GroundCUA에 360만 개의 UI 요소가 포함된다고 설명합니다. 에이전트는 “레이어 패널을 열라”는 지시를 행동으로 바꾸기 전에 어떤 영역이 그 패널인지 화면에서 찾아야 합니다.

ScaleCUA는 200만 장의 이미지를 20시간 미만에 모은 비교 대상으로 제시됩니다. 빠른 자동 수집은 범위를 넓히는 데 유리하고, 전문가 검증 비디오는 행동의 연속성과 품질을 제공하는 데 유리합니다. 규모 숫자만 비교하기보다 데이터가 가르치는 능력이 grounding인지, 연속 제어인지 구분해야 합니다.

원문에 나온 JSON은 공개 스키마를 그대로 복사한 것이 아니라 한 샘플이 가질 법한 키프레임, 바운딩 박스, 행동 로그를 설명하는 예시입니다. 실제 로더를 작성하려면 배포 파일의 필드명, 좌표 기준, 프레임 번호와 누락값 규칙을 별도로 확인해야 합니다.

30fps를 그대로 넣기 전에 샘플링한다

학습이나 평가에서 첫 선택은 프레임 수입니다. 균일하게 간격을 두면 짧은 클릭이나 메뉴 전환을 놓칠 수 있고, 모든 프레임을 넣으면 I/O, VRAM, 컨텍스트가 급증합니다. 상호작용 로그 주변은 촘촘히, 변화가 없는 구간은 성기게 뽑는 전략을 비교할 필요가 있습니다.

다음 세 지표를 함께 보십시오.

  • 목표 UI 요소를 올바르게 찾은 비율
  • 클릭, 드래그, 키 입력의 순서가 맞은 비율
  • 작업 성공까지 사용한 프레임과 행동 수

최종 성공률만 보면 잘못된 패널을 여러 번 헤맨 뒤 우연히 성공한 궤적이 좋은 사례로 남을 수 있습니다. 반대로 좌표 오차 하나로 실패했지만 계획은 맞았던 사례는 학습 가치가 있을 수 있습니다.

전문 앱에서 실패하는 이유를 분류한다

원문은 기존 에이전트가 전문 애플리케이션 작업의 60% 이상에서 실패한다고 보고합니다. 이 수치를 모든 환경의 보편적 실패율로 읽기보다, 실패 화면이 어떤 종류의 혼동을 보여 주는지 보는 편이 유용합니다.

Krita의 패널 혼동 사례

그림 편집기나 CAD 도구는 비슷한 아이콘, 중첩 패널, 트리와 툴바가 동시에 나타납니다. 실패를 “모델이 약함”으로 묶지 말고 UI grounding 오류, 행동 순서 오류, 상태 변화 미인식, 복구 실패로 나누면 필요한 데이터가 달라집니다.

도입 전에는 팀이 자동화하려는 앱과 작업을 먼저 좁혀야 합니다. 87개 앱 전체를 따라 하기보다 대표 작업 20~30개에서 프레임 샘플링, 좌표 변환과 성공 판정을 재현해 보십시오. CUA-Suite는 완성된 데스크톱 자동화 제품이 아니라 학습, 평가용 데이터 자원이며, 실제 실행에는 안전한 샌드박스와 작업별 권한 제한이 별도로 필요합니다.

변화 중심 샘플링은 어떻게 비교할까

세 기준선을 만들 수 있습니다. 일정 간격으로 뽑는 균일 샘플링, 상호작용 로그 주변을 촘촘히 뽑는 방식, 화면 차이가 커질 때만 프레임을 추가하는 방식입니다. 같은 토큰 예산에서 짧은 메뉴 열기와 드래그 경로를 얼마나 보존하는지 비교하면 30fps 전체 입력 없이도 필요한 순간을 찾을 수 있습니다.

화면 차이만 쓰면 커서가 멈춘 채 단축키로 상태가 바뀌거나 작은 체크박스가 변한 순간을 놓칠 수 있습니다. 반대로 영상 압축 노이즈와 애니메이션은 중요한 사건이 아닌데도 프레임을 많이 뽑게 합니다. 마우스, 키보드 이벤트, UI 영역 변화와 시간 간격을 함께 사용하는 규칙이 필요한 이유입니다.

샘플링 평가는 최종 성공뿐 아니라 클릭 직전 목표가 보였는지, 드래그 시작, 끝과 중간 경로가 남았는지, 상태 변화 직후 확인 프레임이 포함됐는지를 봅니다. 중요한 사건을 놓친 비율과 입력 토큰 감소를 같은 표에 두어야 비용 절감이 학습 신호 손실보다 큰지 판단할 수 있습니다.

좌표는 화면 크기와 패널 변화에 어떻게 맞출까

바운딩 박스가 절대 픽셀인지 정규화 좌표인지, 캡처 화면에 창 테두리와 운영체제 배율이 포함되는지 확인해야 합니다. 같은 UI도 해상도, DPI, 창 크기와 도구 패널 배치가 달라지면 좌표가 변합니다. 실제 로더의 좌표 기준을 확인하지 않고 학습하면 화면 요소를 맞게 인식해도 다른 환경에서 잘못 클릭할 수 있습니다.

평가에서는 동일 작업을 여러 해상도와 창 크기로 반복합니다. 아이콘 위치만 바뀐 경우와 레이아웃 자체가 재배치된 경우를 나누고, 요소를 찾은 뒤 실제 클릭 가능한 내부 지점을 선택하는지 봅니다. 박스 중심이 안전하지 않은 슬라이더, 트리, 드롭다운은 요소 종류별 행동 규칙이 필요할 수 있습니다.

클릭 결과도 확인해야 합니다. 좌표가 박스 안에 들어갔다는 이유만으로 성공 처리하지 말고 의도한 패널이 열렸거나 값이 바뀌었는지 다음 상태를 봅니다. 가려진 요소나 비활성 버튼을 클릭했을 때 에이전트가 같은 위치를 반복하지 않고 다시 관찰하는지가 복구 능력입니다.

성공 궤적만 따라 하면 무엇을 놓칠까

전문가 시연은 효율적인 경로를 보여 주지만 실패 뒤 되돌아오는 방법은 적게 포함할 수 있습니다. 배포 환경에서는 창이 늦게 열리거나 팝업이 끼고, 예상한 파일이 없을 수 있습니다. 정상 궤적 학습과 별도로 잘못된 패널, 빈 검색 결과, 권한 오류에서 안전하게 멈추거나 복구하는 평가를 만들어야 합니다.

실패를 주입할 때 목표를 몰래 바꾸지 않습니다. 같은 작업에서 한 요소만 이동하거나 모달 하나를 추가해 첫 계획이 실패하도록 만들고, 다시 관찰, 취소, 대체 경로 중 어떤 행동을 하는지 기록합니다. 최종 성공까지 행동 수가 크게 늘거나 같은 클릭을 반복하면 평균 성공률이 높아도 운영 비용이 큽니다.

사람 시연에도 불필요한 망설임이나 개인 단축키 습관이 들어갈 수 있습니다. 모든 중간 행동을 정답으로 복제하기보다 목표 상태에 필요한 행동과 탐색 행동을 구분합니다. 여러 전문가가 같은 작업을 다른 합법적 순서로 수행할 수 있으므로 하나의 궤적과 다르다는 이유만으로 실패로 채점하지 않는 편이 좋습니다.

학습과 평가 누출은 어떻게 막을까

연속 비디오의 인접 프레임을 무작위로 나누면 거의 같은 화면이 학습과 평가에 들어갑니다. 작업 세션이나 완전한 궤적 단위로 분할하고, 가능하면 앱 버전, 문서, 프로젝트까지 분리해야 합니다. 화면 템플릿을 외운 모델과 새로운 상태에서 행동을 계획하는 모델을 구분하려면 보지 못한 작업과 레이아웃이 필요합니다.

GroundCUA 요소 라벨과 VideoCUA 궤적이 같은 화면을 공유하는 경우도 확인합니다. Grounding 학습에서 본 정확한 화면이 평가 궤적에 나오면 전문 앱 일반화보다 이미지 기억을 측정할 수 있습니다. 스크린샷 해시와 UI 구조 유사도를 사용해 중복 후보를 찾고 사람 표본으로 확인할 수 있습니다.

평가 결과는 앱 평균 하나로 합치지 않습니다. 앱을 처음 보는 조건, 익숙한 앱의 새 작업, 같은 작업의 새 레이아웃으로 나눕니다. 어느 축에서 데이터 추가가 도움이 되는지 알아야 더 많은 프레임을 수집할지 행동 다양성을 늘릴지 결정할 수 있습니다.

실제 에이전트에는 어떤 안전 게이트가 필요할까

첫 배포는 읽기 전용 탐색, 화면 설명과 클릭 후보 제안부터 시작합니다. 파일 삭제, 결제, 메시지 발송과 권한 변경은 사용자 승인 전에는 실행하지 않고 대상, 효과를 화면과 구조화된 상태에서 다시 확인합니다. 샌드박스에서 학습한 좌표 정책을 실제 개인 데스크톱에 바로 연결하면 예상하지 못한 창에 입력할 수 있습니다.

작업마다 허용 앱, 창, 파일 경로와 네트워크 목적지를 제한합니다. 화면에 다른 사용자의 메시지나 비밀 값이 나타날 수 있으므로 학습, 로그 저장 시 마스킹과 보존 기간도 정해야 합니다. 에이전트가 화면 속 문장을 시스템 지시로 오인하는 프롬프트 인젝션 시험도 포함합니다.

행동 상한과 중단 조건을 둡니다. 같은 요소 반복 클릭, 예상하지 못한 앱 전환, 권한 대화상자, 목표와 다른 파일 선택이 발생하면 즉시 멈추고 사람에게 현재 화면과 행동 기록을 보여 줍니다. 작업 성공을 주장해도 최종 상태를 독립적으로 확인할 수 없으면 완료로 처리하지 않습니다.

파일럿에서 어떤 지표를 남길까

대표 작업마다 UI grounding 정확도, 첫 행동 성공, 전체 작업 성공, 행동 수, 재관찰과 복구 횟수를 기록합니다. 모델 추론 시간뿐 아니라 프레임 인코딩, 화면 캡처와 앱 응답 대기를 포함한 종단 시간을 봅니다. 사람이 같은 작업을 수행한 경로와 비교하면 에이전트의 불필요한 탐색을 찾을 수 있습니다.

오류는 목표 요소 미탐지, 좌표 변환, 잘못된 행동 종류, 상태 변화 미인식, 계획, 복구 실패로 분류합니다. Grounding 오류가 대부분이면 더 긴 비디오보다 UI 라벨과 해상도 변형이 필요하고, 상태 변화 오류라면 이벤트 주변 프레임을 보강해야 합니다.

제한된 앱과 작업에서 안전 게이트를 지키며 성공률과 검토 시간이 개선될 때 범위를 넓힙니다. 데이터셋의 앱 수와 프레임 수는 출발점일 뿐, 우리 환경의 좌표, 권한, 복구가 검증되지 않으면 실제 자동화 준비를 의미하지 않습니다.

Original Paper Link

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    11개 장 20 분읽는 시간