사람과 Agent의 협업 이득을 따로 잰다
Agent가 issue를 완전히 해결하지 못해도 관련 file과 실패 test, 가능한 원인을 정확히 좁히면 사람의 시작 시간을 줄일 수 있습니다. 이를 완전 해결, 유효한 부분 결과, 무효 결과로 나누고 후속 개발자가 완료하는 데 걸린 시간을 기록합니다. 이 측정은 0점 처리된 시도가 실제로는 도움이 됐는지 보여 줍니다.
반대로 test만 통과했지만 이해하기 어려운 patch, 기존 abstraction을 우회한 코드, 유지보수 비용을 키운 변경은 금액 점수에 드러나지 않을 수 있습니다. reviewer는 정확성, 변경 최소성, 코드 규칙, test 적절성, 보안 영향을 같은 rubric으로 채점해야 합니다.
실제 도입에서는 과제 가격보다 시간 예산과 권한을 제한합니다. Agent가 무한 재시도하거나 network에서 solution을 복사하지 못하게 하고, 사용한 명령과 외부 접근을 로그로 남깁니다. 평가 조건이 통제돼야 모델, prompt, tool 변화의 효과를 비교할 수 있습니다.
리뷰 결과에 확신도도 남깁니다. test가 부족해 판단하기 어려운 과제와 명백히 틀린 patch를 같은 실패로 묶으면 test infrastructure 개선 기회를 놓칩니다. 불확실한 결과를 스스로 표시하고 필요한 추가 검증을 제안하는지도 실제 협업 품질의 일부입니다.