추론최적화 4 Diffusion LLM이 Qwen보다 5배 빠를까? d3LLM 병렬 디코딩의 조건 2026/05/04 예·아니오 VQA에 VLM 전체 레이어가 필요할까? Super Neuron 조기 종료 2026/03/17 BitNet b1.58은 GPU 없이도 빠를까? 3값 가중치와 전용 커널의 조건 2026/03/16 긴 AI 영상이 뒤로 갈수록 무너질 때: TokenTrim의 추론 토큰 가지치기 2026/02/12