Qwen 40
- Nvidia Nemotron 3.5 Lightning과 NeMo Switchyard: 에이전트 모델 라우팅 판단법
- 알리바바 Wan 3.0 공개 베타 개시, 문서 입력으로 30초 AI 비디오 원컷 생성
- Qwen3.8-Max 2.4조 파라미터 MoE: 95B 활성 구조와 오픈 웨이트 계획
- open-code-review: 2만 명의 개발자가 검증한 알리바바의 하이브리드 AI 코드 리뷰 시스템
- Qwen Code: 코드베이스 메모리와 MCP로 터미널에 구현한 완전 무료 AI 에이전트
- TinyZero는 정말 30달러로 추론 모델을 만들까? 가능한 문제의 조건
- Diffusion LLM이 Qwen보다 5배 빠를까? d3LLM 병렬 디코딩의 조건
- free-claude-code는 정말 무료일까: 8082 Proxy, Tool Parser, VRAM 비용
- ml-intern에 H100 300회 루프를 맡겨도 될까: 170K Compaction과 비용 상한
- VLM이 추론 중 이미지를 잊는다면: HopChain의 멀티홉 데이터 설계
- 영상의 다음 사건을 맞히려면: Video-CoE가 시간 근거를 강제하는 법
- Qwen-Agent로 함수 호출, RAG, WebUI를 묶기 전 확인할 것
- 사용자 피드백을 계속 학습하면 AI가 정말 나아질까? OpenClaw-RL의 위험
- TradingAgents-CN으로 자동매매해도 될까: Bull, Bear 토론과 리스크 관리의 착시
- 이미지에 없는 물체를 말할 때: NoLan의 언어 사전확률 억제
- 물을 채우고 금속을 구부리는 편집은 왜 어려울까: PhysicEdit
- AI 생성 코드를 호스트 밖에서 실행하려면: Alibaba OpenSandbox 점검법
- 이미지 한 장이 5턴 뒤 답변을 바꿀 수 있을까? VMI 공격이 노리는 기억
- Voicebox는 ElevenLabs를 로컬로 대체할까: Qwen3-TTS 설치, GPU, 동의 체크
- 3B 모델이 600턴 도구 사용을 버틸까: Nanbeige4.1의 Turn-level 지도와 누적 오류
- ERL은 추론 때 성찰하지 않고도 Sokoban 81%를 얻을까: 자기증류의 비용과 함정
- OV-Encoder는 비디오 토큰을 80% 줄여도 더 정확할까: 3.1~25% Residual 선택의 맹점
- 이미지를 다시 자르지 않고 작은 글씨를 읽을까: ZwZ Single-pass와 Zooming Gap
- 5B 이미지 모델이 80B보다 낫다는 말은 어디까지 사실일까: DeepGen 1.0
- 긴 영상 요약이 대화, 카메라, 효과음을 놓친다면: TimeChat-Captioner
- GUI 에이전트는 클릭 전에 다음 화면을 예측할 수 있나: Code2World
- Teacher의 CoT를 못 봐도 Agent를 학습할 수 있을까? π-Distill의 PI
- RLVR 답변이 알고리즘에 따라 길어지거나 무너지는 이유: LUSPO
- MPRM 학습 데이터 10%가 100%보다 나았던 이유: BIS 선택 기준
- 영상, 음성 Token을 똑같이 줄이면 왜 안 될까? OmniSIFT의 비대칭 압축
- 긴 추론을 이미지로 저장하면 왜 빨라질까? VTC-R1의 Optical Memory
- VLM 추론 데이터 180만 개가 다 필요할까? MMFineReason의 7% 선별
- VIBE 3.6B로 2K 이미지 편집이 가능한가: H100 4초와 24GB 조건 해석
- STEP3-VL-10B가 200B 모델보다 효율적일까: PaCoRe 성능과 추론 비용 점검
- 왜 VLM은 일부 토큰에서 더 취약할까: EGA의 엔트로피 공격
- VLM이 카메라 이동과 객체 이동을 헷갈리는 이유: DSR Suite와 GSM
- 온디바이스 VLM은 모든 이미지를 고해상도로 봐야 할까? HyperVL의 VRC 판단
- Spark-TTS: 인공지능이 당신의 목소리를 만드는 방법
- olmOCR: 비전-언어 모델로 PDF 문서의 한계를 뛰어넘다
- VideoLLaMA 3는 중복 프레임을 어떻게 줄일까: AVT, DiffFP