보고된 점수보다 평가 조건을 함께 읽습니다
원문은 multimodal chatbot 평가에서 GPT-4 대비 85.1% 수준, ScienceQA에서 LLaVA 단독 90.92%, LLaVA와 GPT-4를 결합한 구성에서 92.53%를 보고합니다. Instruction tuning이 없을 때 큰 성능 저하가 있었다는 결과도 visual instruction data의 중요성을 뒷받침합니다.
하지만 GPT-4 대비 비율과 ScienceQA accuracy는 서로 다른 평가이며, 후속 LLaVA version이나 임의 image task의 현재 성능을 보장하지 않습니다. 특히 LLaVA+GPT-4 결과를 LLaVA 단독 model 점수처럼 비교하면 안 됩니다.
실제로 model을 검토할 때는 세 종류의 질문을 나눕니다. Image에 직접 보이는 사실, 여러 단서를 결합하는 추론, image만으로 알 수 없는 질문입니다. 마지막 유형에서 model이 모른다고 말하는지 확인해야 대화 유창성과 시각 grounding을 구분할 수 있습니다.
LLaVA의 핵심 교훈은 linear projection 하나가 모든 문제를 해결했다는 것이 아닙니다. Image-text representation을 먼저 맞추고, 다양한 instruction으로 language model을 조정하는 순서를 분리한 것이며, 더 다양한 video, 3D data와 강한 연결 구조는 원문에서도 이후 과제로 남아 있습니다.