운영에서는 어디에 보상 모델을 둘까
모든 생성 단계마다 평가하면 비용이 크므로 최종 후보만 검사하거나 저비용 규칙을 먼저 통과한 결과에 적용할 수 있습니다. 고위험 편집은 원본과 결과를 FIRM에 넣고, 낮은 위험의 창작 생성은 표본 평가로 제한하는 식으로 라우팅할 수 있습니다. 실패 결과를 재생성할 때 최대 횟수와 비용 상한을 둡니다.
로그에는 생성 모델, 프롬프트, 원본, 결과 식별자, FIRM 점수와 최종 사람 판정을 연결합니다. 승인된 결과 중 실제 오류와 거부됐지만 사람이 통과시킨 사례를 모아 임계값을 다시 보정합니다. 평가기를 추가하는 목적은 점수 하나를 더 만드는 것이 아니라 실패를 더 일찍 발견하는 것입니다.
보상 모델이 일시적으로 실패하거나 시간 제한을 넘긴 경우의 기본 동작도 정해야 합니다. 고위험 편집을 평가 없이 통과시키기보다 보류하거나 사람 검토로 보내고, 낮은 위험의 창작 요청은 명시된 정책에 따라 재시도할 수 있습니다. 평가 실패와 생성 실패를 같은 오류로 합치지 말고 모델, 입력 크기, 처리 시간을 남겨 운영 병목을 찾습니다.
배포 전에는 보상 모델을 사용하지 않은 기준선, 결과 필터링에만 쓴 구성, 강화학습에 사용한 구성을 구분합니다. 필터링 이득과 학습 자체의 변화를 섞으면 추가 단계가 어디에서 효과를 냈는지 알기 어렵습니다. 같은 생성 후보 수와 사람 평가 예산으로 비교해야 비용 대비 가치가 선명해집니다.