UniT는 같은 수의 test-time image를 쓸 때 Best-of-N 후보를 독립적으로 뽑는 것보다 이전 결과를 검증하고 순차 수정하는 방식이 복합 지시를 더 잘 만족했다고 보고합니다. 다만 한 라운드마다 다시 생성, 검증해야 하므로 3.6회 학습 궤적에서 4.7회 추론으로 늘어난 능력은 품질 향상과 함께 지연, 과편집 위험도 키웁니다.
같은 이미지 예산에서 parallel sampling과 sequential CoT refinement를 비교한 UniT.



