Multi-scale과 YOLO9000을 해석할 때의 한계
YOLOv2는 학습 중 10 batch마다 입력 크기를 320부터 608 사이로 바꿔 하나의 네트워크가 속도와 정확도 요구에 따라 여러 해상도에서 동작하도록 학습합니다. 낮은 해상도는 빠르고 높은 해상도는 더 정확하다는 선택지가 생깁니다. 보고된 FPS는 당시 환경의 결과이므로 현재 runtime의 latency 대신 사용할 수 없습니다.
YOLO9000은 COCO 탐지 데이터와 ImageNet 분류 데이터를 WordTree 계층으로 결합해 9천 개가 넘는 class를 다룹니다. 탐지 데이터가 없는 class는 분류 이미지로 학습하고, COCO는 더 자주 sampling했습니다. 156개 공통 class에서 16 mAP, 전체에서 19.7 mAP를 보고했으며 동물에는 강하고 의류처럼 fine-grained label에는 약했습니다.
결론적으로 anchor 도입을 평가할 때 mAP 하나만 보지 말고 recall, localization, class별 precision을 함께 봐야 합니다. 후보가 늘어난 뒤 direct location, 데이터 맞춤 anchor, passthrough까지 연결돼야 YOLOv2의 개선이 완성됩니다.