UniTok은 이미지 생성 품질에서는 표의 비교 모델보다 낮은 rFID 0.38을 기록했지만, 이미지 이해 정확도 78.6은 SigLIP 80.5와 ViTamin 81.2보다 낮습니다. 따라서 생성과 이해를 모두 최고로 만든 토크나이저라기보다, 두 기능을 한 discrete visual token 체계로 함께 쓰려는 절충안으로 보는 편이 정확합니다.
UniTok의 목표는 생성과 이해에서 각각 최고인 두 토크나이저를 동시에 이기는 것보다 하나의 discrete token 체계로 두 경로를 운영하는 데 있습니다. 따라서 개별 최고 점수뿐 아니라 통합으로 줄어드는 모델, 데이터 변환 비용을 함께 봐야 합니다.






