DeepGEMM은 H100, H800 같은 NVIDIA Hopper GPU에서 FP8 행렬 곱셈을 돌릴 때 검토할 라이브러리이며, 모든 GPU나 모든 행렬 크기에서 2.7배 빨라진다는 뜻은 아닙니다. 공개된 최대 수치는 특정 GEMM 크기에서 CUTLASS와 비교한 결과이므로 자신의 모델 모양과 정밀도 요구를 함께 확인해야 합니다.
DeepGEMM의 높은 처리량은 모든 행렬 크기와 GPU에서 자동으로 나오는 값이 아닙니다. 실제 모델이 사용하는 M, N, K shape, dtype, 정렬 조건과 커널 준비 비용을 포함해 기존 GEMM과 비교해야 합니다.

