문서AI 32
- Claude for Legal이 법률 환각을 끝낼까: 출처, 권한, 승인 설계
- WeKnora가 표, 수식 PDF RAG에 맞을까: 파싱, Hybrid Retrieval 검증
- RAG 답이 틀릴 때 LLM보다 PDF를 먼저 의심해야 하는 이유: RAGFlow
- DOM이 바뀌어도 웹 자동화가 살아남을까? MolmoWeb의 화면 기반 접근
- MinerU-Diffusion은 OCR을 3.2배 빠르게 할까: Threshold, VRAM의 교환
- Open WebUI만 설치하면 사내 AI가 완성될까: 로컬 추론, RAG, RBAC의 경계
- 복잡한 PDF는 OCR 모델 하나로 충분할까? Qianfan-OCR의 Layout-as-Thought
- 이미지 이해와 생성이 서로 방해한다면? Cheers의 의미, 디테일 토큰 분리
- 시각 토큰을 줄였더니 환각이 늘었다면: AgilePruner의 선택 기준
- 15B Phi-4 Vision은 왜 UI, 수식 추론을 노리나: 동적 해상도와 모드 토큰
- 이미지를 생성하면 멀티모달 문제를 더 잘 풀까? UniG2U-Bench의 반례
- BettaFish는 에이전트 토론으로 여론 왜곡을 줄일까: 5개 역할과 크롤링 편향
- MarkItDown만으로 RAG 전처리가 끝날까: PDF 읽기 순서, 표, VLM 비용 점검
- 이미지에 없는 물체를 말할 때: NoLan의 언어 사전확률 억제
- OV-Encoder는 비디오 토큰을 80% 줄여도 더 정확할까: 3.1~25% Residual 선택의 맹점
- 차트, 흐름도를 바로 읽지 말고 다시 그리면 나아질까: Thinking with Drafting
- 물리 문제에서 그림 한 줄을 놓치면? P1-VL의 시각, 논리 학습
- MPRM 학습 데이터 10%가 100%보다 나았던 이유: BIS 선택 기준
- 코드를 이미지로 읽으면 Token은 줄지만 정확할까? CodeOCR의 8배 압축
- 긴 추론을 이미지로 저장하면 왜 빨라질까? VTC-R1의 Optical Memory
- VLM 추론 데이터 180만 개가 다 필요할까? MMFineReason의 7% 선별
- 차트 OCR은 글자만 맞으면 될까? OCRVerse의 문서, 웹, 수치 보상 분리
- Youtu-VL은 객체 검출 헤드를 없앨 수 있을까: Vision-as-Target과 NTP-M 구조
- 7B AdaReasoner가 GPT-5를 이겼다는 말은 맞을까: Tool-GRPO +24.9% 읽는 법
- 비디오 검색 에이전트가 더 자율적이면 왜 더 틀릴까: VideoDR
- 사진 위치 500m 정확도가 8.0%에서 22.1%로 오른 이유: Thinking with Map
- 온디바이스 VLM은 모든 이미지를 고해상도로 봐야 할까? HyperVL의 VRC 판단
- olmOCR: 비전-언어 모델로 PDF 문서의 한계를 뛰어넘다
- OmniParser: GUI 자동화를 위한 순수 비전 기반 에이전트
- VideoLLaMA 3는 중복 프레임을 어떻게 줄일까: AVT, DiffFP
- MoAI는 왜 외부 CV 모델 4개를 붙이나: Compressor와 Mixer
- Python 영상 OCR, EasyOCR과 Tesseract 중 무엇을 쓸까? 프레임 코드 비교