배포 도구보다 먼저 결정할 체크리스트
TensorFlow Lite와 TensorFlow Micro, TensorFlow.js, XLA, PyTorch JIT와 TorchScript는 모델을 대상 런타임에 맞추는 도구입니다. GPU, TPU, Edge TPU, Jetson 같은 하드웨어 선택도 최종 성능을 바꿉니다. 하지만 변환 도구를 먼저 정하면 지원되지 않는 연산이나 예상 밖의 메모리 사용 때문에 모델 설계를 되돌릴 수 있습니다.
실무 순서는 다음처럼 잡을 수 있습니다. 기준 모델을 실제 장치에서 측정하고, 재학습 가능 여부를 정한 뒤, 저장 공간이 병목이면 quantization을 먼저 시험합니다. 일반 가속기에서 지연시간이 병목이면 structured pruning이나 효율적 architecture를 검토하고, 작은 모델을 다시 학습할 데이터와 teacher가 있으면 distillation을 비교합니다. 마지막에 변환된 모델의 정확도와 실제 지연시간을 다시 측정합니다.
경량화는 “작게 만든 뒤 정확도를 확인하는” 단선 작업이 아닙니다. 모델을 키워 품질을 확보한 뒤 줄이는 전략과, 작은 모델을 줄이면서 보완하는 전략 모두 가능합니다. 중요한 한계는 논문의 압축률이나 FLOPs 감소가 내 서비스의 체감 속도를 대신 증명하지 않는다는 점입니다.