5배와 AUP는 평가 환경을 붙여 읽는다
원문은 H100에서 Qwen-2.5-7B 대비 5배, 기존 diffusion LLM 대비 10배 속도와 10개 벤치마크 중 9개 최고 AUP를 제시합니다. AUP는 parallelism 아래의 정확도를 함께 보려는 지표입니다. 배치 크기, 출력 길이, 모델과 품질 조건이 다른 운영 요청에 그대로 적용할 수 없습니다.
논문과 체크포인트를 시험할 때는 tokens per second만 아니라 task accuracy, TTFT, p95 지연, refresh 횟수와 최대 VRAM을 기록해야 합니다. 창작, 코드, 수학은 entropy 분포가 달라 별도 threshold가 필요할 수 있습니다.
공정한 비교에서는 parameter 규모, precision, quantization, prompt, output 길이, sampling과 batch를 고정합니다. AR 기준선도 같은 kernel, hardware에서 충분히 warm-up하고 지원되는 optimization을 사용합니다. Diffusion 출력은 “token 생성 순서”가 다르므로 streaming UX의 첫 유효 text 시점과 전체 완료 시점을 따로 잽니다. throughput이 높아도 사용자가 첫 글자를 오래 기다리면 chat 체감은 나빠질 수 있습니다.
정확도는 perplexity 하나가 아니라 업무별 exact match, code test, judge와 human sample을 사용합니다. 같은 품질 지점을 찾은 뒤 TTFT, time per output token에 해당하는 진행 속도, p50, p95 latency, request/s, peak VRAM과 energy, GPU-second를 비교합니다. OOM, timeout, 잘못된 종료를 제외한 평균만 보고하지 않습니다.