MLOps 18
- OpenAI 프론티어 API 제로 데이터 보존 발표, Private Safety Processing으로 기업 보안 강화
- oMLX: 애플 실리콘에서 AI 코딩 에이전트 속도를 극대화하는 MLX 추론 서버
- DeepSeek-V4-Flash-0731 출시: 100만 토큰당 $0.14로 V4-Pro 넘은 에이전트 성능
- Unsloth: 단 한 대의 GPU로 대형 언어 모델을 5배 빠르게 학습시키는 파이썬 가속 라이브러리
- OpenAI, GPT-5.6 API 가격 최대 80% 인하… 개발자 및 기업 비용 부담 대폭 감소
- vLLM PagedAttention은 KV 캐시를 어떻게 관리할까: 처리량, 지연, OOM 검증법
- 내 GPU에 맞는 LLM은 어떻게 고를까: whichllm 숫자 검증법
- 로컬 LLM은 클라우드보다 쌀까: VRAM, 전력, 운영비 계산
- vLLM과 FSDP를 함께 쓰면 LLM RL의 OOM이 사라질까? veRL의 조건
- 오픈소스 LLM이 GPT API보다 싸질까: vLLM, PagedAttention, TCO 계산
- 멀티모달 에이전트가 같은 실수를 반복한다면? XSkill의 경험, 스킬 메모리
- InternVL-U 4B가 14B를 이길까: 이해, 생성 분리와 실제 VRAM 조건
- DeepSeek Engram이 VRAM을 DRAM으로 옮길까: O(1) N-gram 조회와 PCIe 병목
- 카파시의 Autoresearch는 무엇을 자동화하나: 반복 실험의 범위와 한계
- AI 규제 문서가 흩어져 있다면? AI Atlas Nexus로 리스크 연결하는 법
- 사진 위치 500m 정확도가 8.0%에서 22.1%로 오른 이유: Thinking with Map
- AI 모델 API가 뜬다고 배포가 끝난 게 아니다: 프로덕션 전 5개 Gate
- Replicate 모델 배포 전 꼭 계산할 것: Cold Start와 Cog setup, predict 분리