공간 출력이 안전한 action이 되려면 무엇이 더 필요할까?
Point, box, trajectory가 영상의 물체와 맞는지 먼저 확인하고, 그다음 로봇 좌표계로 변환했을 때의 위치 오차를 잽니다. 카메라 calibration이 조금만 틀려도 이미지의 정확한 point가 실제 공간에서는 물체 밖을 가리킬 수 있습니다. 관절 한계, 충돌, 속도 제한을 별도 controller에서 검사하고 모델 출력이 위반되면 중단해야 합니다.
시험 장면에는 물체가 가려진 경우, 학습에 없던 카메라 각도, 미끄러운 표면과 움직이는 사람을 포함합니다. 모델이 자연어로 확신 있게 계획을 설명해도 trajectory가 장애물을 통과하면 행동을 허용하지 않습니다. 센서 입력이 끊기거나 모델 응답이 control deadline을 넘었을 때 안전 자세로 전환하는 실패 정책도 성능 시험과 같은 수준으로 검증해야 합니다.
모델 선택은 평균 벤치마크가 아니라 임무 실패 비용에 맞춥니다. 단순한 물체 지시와 낮은 속도의 정리 작업에서는 2B dense가 충분할 수 있고, 복잡한 다중 장면 계획에서만 더 큰 모델이 값을 할 수 있습니다. 30B-A3B가 정확도를 높여도 전체 weight memory 때문에 배치 장비가 커지고 지연 꼬리가 늘면 edge robot에는 맞지 않을 수 있습니다. 과제별 성공률, 종단 지연, 안전 controller 개입률을 함께 비교해야 크기 선택이 가능합니다.
Original Paper Link