MoE 7
- OpenMythos 770M이 1.3B를 이길까: 16회 Recurrent Depth와 TTFT
- VLM은 텍스트 모델부터 학습해야 할까? Transfusion 공동 사전학습의 대안
- DeepSeek-R1은 정말 600만 달러로 o1급 추론을 만들었을까? 비용과 구조 분리
- DeepSeek-V3는 671B인데 왜 토큰당 37B만 쓰나: MLA·MoE·MTP
- RynnBrain 30B-A3B는 로봇에 충분히 가벼울까: 3B 활성 파라미터와 제어 지연
- 영상과 소리를 따로 만들면 왜 어긋날까: MOVA의 동시 생성 구조
- DeepGEMM은 언제 2.7배 빠른가: H100·FP8·MoE 도입 전 확인할 조건