멀티모달 70
- OpenRouter에 등장한 스텔스 AI 모델 OX Alpha 무료 공개, 100만 토큰과 DeepSWE 80% 성능 분석
- LiveKit Agents: 초저지연 실시간 음성 AI 에이전트를 위한 오픈소스 프레임워크
- Claude Code로 영상을 대화하듯 편집하는 Video Use의 원리와 실전 활용법
- Ego-lite: AI 에이전트와 화면을 다투지 않고 완벽하게 병렬로 일하는 브라우저
- 9router로 AI 코딩 쿼터를 넘겨도 될까: 프록시, 폴백의 함정
- Skyvern이 XPath 유지보수를 줄여도 되는 곳: 속도, 승인, 실패 기준
- Graphify는 코드 Context 재탐색을 줄일까? AST Graph, 추론 Edge, Drift
- 이미지, 오디오를 모두 다음 토큰으로 만들면 더 단순할까? LongCat-Next의 비용
- 비디오 편집에서 대상만 바꾸고 움직임은 지키려면: SAMA의 분리 학습
- 예, 아니오 VQA에 VLM 전체 레이어가 필요할까? Super Neuron 조기 종료
- 멀티모달 에이전트가 같은 실수를 반복한다면? XSkill의 경험, 스킬 메모리
- 멀티샷 영상의 카메라가 프롬프트를 무시한다면? ShotVerse의 3D 궤적
- MA-EgoQA는 로봇 6대의 영상을 함께 이해할까: 7일 기억과 EgoMAS 검색
- 15B Phi-4 Vision은 왜 UI, 수식 추론을 노리나: 동적 해상도와 모드 토큰
- 멀티모달 에이전트가 25번 도구를 써도 답을 찾을까: AgentVista
- LiDAR, RGB-D, CAD를 한 3D 인코더로 처리할 수 있을까? Utonia의 범위
- 이미지를 생성하면 멀티모달 문제를 더 잘 풀까? UniG2U-Bench의 반례
- RAG 파이프라인이 너무 복잡하다면? Unbody GraphQL 도입 전 확인할 것
- Bytebot은 Selenium을 대체할까: 1~3초 클릭 지연과 전체 데스크톱 권한
- BettaFish는 에이전트 토론으로 여론 왜곡을 줄일까: 5개 역할과 크롤링 편향
- MarkItDown만으로 RAG 전처리가 끝날까: PDF 읽기 순서, 표, VLM 비용 점검
- 10초 학습으로 5분 영상의 소리를 만들 수 있나: MMHNet 길이 일반화
- 이미지에 없는 물체를 말할 때: NoLan의 언어 사전확률 억제
- 물을 채우고 금속을 구부리는 편집은 왜 어려울까: PhysicEdit
- 로봇이 미래 영상을 만들지 않고도 다음 행동을 고를 수 있나: World Guidance
- VLANeXt의 12가지 VLA 설계 레시피는 어떻게 검증해야 할까
- 로봇 진행률을 말로 묻지 않고 잴 수 있을까? TOPReward의 토큰 확률
- 모바일에서 이미지 이해와 생성을 한 모델로 돌릴 수 있을까? Mobile-O의 조건
- 이미지 한 장이 5턴 뒤 답변을 바꿀 수 있을까? VMI 공격이 노리는 기억
- next-ai-draw-io는 실무 다이어그램에 쓸 만할까: 설치, 검증 가이드
- 검색 결과가 최신이어도 믿어야 할까? MMA의 출처, 시간, 충돌 점수
- UA-VLS의 불확실성 점수는 의료 판단을 안전하게 할까: SEU Loss와 Dice 3~5% 향상
- RynnBrain 30B-A3B는 로봇에 충분히 가벼울까: 3B 활성 파라미터와 제어 지연
- UniT는 Best-of-N보다 순차 편집이 나을까: 3.6회 학습, 4.7회 추론의 비용
- OV-Encoder는 비디오 토큰을 80% 줄여도 더 정확할까: 3.1~25% Residual 선택의 맹점
- 이미지를 다시 자르지 않고 작은 글씨를 읽을까: ZwZ Single-pass와 Zooming Gap
- MedXIAOHE는 의료 멀티모달 모델을 어떻게 학습하나: 구조와 검증 한계
- 그림을 지우지 않고 토끼를 코끼리로 바꿀 수 있을까: Stroke of Surprise의 Prefix, Delta 최적화
- 차트, 흐름도를 바로 읽지 말고 다시 그리면 나아질까: Thinking with Drafting
- 긴 영상 배경음악이 장면 감정을 놓칠 때: NarraScore의 이중 제어
- 5B 이미지 모델이 80B보다 낫다는 말은 어디까지 사실일까: DeepGen 1.0
- RD-VLA는 로봇의 추론 깊이를 어떻게 조절하나: 잠재 반복과 정지 조건
- RLVR 답변이 알고리즘에 따라 길어지거나 무너지는 이유: LUSPO
- Green-VLA의 5단계 Curriculum은 무엇을 더하나? R2 RL과 OOD 검증
- AI 논문 그림, 한 번에 생성하면 왜 틀릴까? PaperBanana의 4단계 검수
- 긴 추론을 이미지로 저장하면 왜 빨라질까? VTC-R1의 Optical Memory
- VLM 추론 데이터 180만 개가 다 필요할까? MMFineReason의 7% 선별
- Youtu-VL은 객체 검출 헤드를 없앨 수 있을까: Vision-as-Target과 NTP-M 구조
- Think3D는 가려진 물체를 실제로 볼 수 있을까: 3D CoT와 재구성 오류의 한계
- STEP3-VL-10B가 200B 모델보다 효율적일까: PaCoRe 성능과 추론 비용 점검
- 위성 사진만 보고 학교와 병원을 구분할 수 있을까: SocioReasoner
- 비디오 검색 에이전트가 더 자율적이면 왜 더 틀릴까: VideoDR
- 왜 VLM은 일부 토큰에서 더 취약할까: EGA의 엔트로피 공격
- InsertAnywhere는 영상 속 객체 위치를 어떻게 고정할까? 4D Mask와 Diffusion
- VLM이 카메라 이동과 객체 이동을 헷갈리는 이유: DSR Suite와 GSM
- 긴 영상 QA에서 전체를 요약하면 왜 틀릴까? LongVideoAgent의 구간 검색
- Kling-Omni가 생성, 편집 모델을 하나로 합친 이유: Reference Video를 Prefix로 쓰는 구조
- AI ASMR 진짜, 가짜 판별, VLM 정확도가 56%에 그친 이유: 워터마크 편향
- Gemini 3 기능, 비용, 한계 읽는 법: 벤치마크와 실무 검증 기준
- Gemma 3 로컬 실행, 1B와 4B 중 무엇을 고를까? 이미지, Context, VRAM 기준
- UniTok은 이미지 생성과 이해를 둘 다 잘할까: rFID 0.38과 정확도 78.6의 의미
- olmOCR: 비전-언어 모델로 PDF 문서의 한계를 뛰어넘다
- Sa2VA는 문장으로 비디오 객체를 어떻게 찾나: SAM-2, LLaVA와 [SEG] 토큰 연결
- Magma는 UI 클릭과 로봇 행동을 어떻게 한 모델로 배우나: SoM, ToM 구조와 한계
- Reasoning LLM은 정말 인간처럼 생각할까: System 1, 2와 추론 성능을 구분하는 법
- OmniParser: GUI 자동화를 위한 순수 비전 기반 에이전트
- MILS 톺아보기
- AI 에이전트, 멀티모달, 설명가능 AI, 무엇부터 도입해야 할까?
- LLaVA는 Image Token을 LLM에 어떻게 연결할까? Linear Projection과 2단계 학습
- StyleGAN Blending에서 눈이 네 개 생기는 이유: 얼굴 정렬부터 Pix2PixHD까지