Paper 55
- DiffuSeq는 왜 입력 문장에 Noise를 넣지 않을까? Partial Noising과 MBR
- Latent Bridge Matching의 1 NFE는 정말 한 번의 계산일까: 수식, 속도, 한계 해설
- YOLOE: 모든 객체를 실시간으로 탐지 & 분할하는 혁신 기술
- MotionFollower는 GPU 메모리를 얼마나 줄였나: 42.6GB→9.8GB와 품질 지표 해석
- Spark-TTS: 인공지능이 당신의 목소리를 만드는 방법
- KV-Edit는 배경을 정말 100% 보존할까: Training-Free 편집과 O(1) 주장 점검
- OASIS의 100만 AI 에이전트가 실제 여론을 예측할까: 소셜 시뮬레이션의 용도와 한계
- UniTok은 이미지 생성과 이해를 둘 다 잘할까: rFID 0.38과 정확도 78.6의 의미
- olmOCR: 비전-언어 모델로 PDF 문서의 한계를 뛰어넘다
- Sa2VA는 문장으로 비디오 객체를 어떻게 찾나: SAM-2, LLaVA와 [SEG] 토큰 연결
- DICEPTION 하나로 깊이, 법선, 분할을 다 잘할까: 벤치마크가 보여준 성능 차이
- PhotoDoodle은 30~50쌍으로 스타일을 배울까: 배경 보존 구조와 실행 코드 함정
- Magma는 UI 클릭과 로봇 행동을 어떻게 한 모델로 배우나: SoM, ToM 구조와 한계
- Reasoning LLM은 정말 인간처럼 생각할까: System 1, 2와 추론 성능을 구분하는 법
- RailSem19 데이터셋으로 철도 객체 탐지를 바로 학습해도 될까: 라벨 2종과 클래스 불균형
- DeepGEMM은 언제 2.7배 빠른가: H100, FP8, MoE 도입 전 확인할 조건
- BiRefNet: 고해상도 이미지 세분화를 위한 최첨단 AI 모델
- SWE-Lancer에서 AI는 100만 달러 중 얼마를 벌었나: $403K의 의미
- OmniParser: GUI 자동화를 위한 순수 비전 기반 에이전트
- RAG가 엉뚱한 문서를 찾는다면? RAFT의 Distractor 학습법
- Sora 영상은 왜 물리 법칙을 틀리나: 시공간 패치와 DiT 원리
- Data Formulator 2로 차트를 반복 수정하는 법: Shelf, Threads, AI 변환
- InternVideo는 생성, 판별 학습을 어떻게 합치나: MVM, VLC, CMA
- Soft Teacher는 라벨 1%에서 왜 강했나: Pseudo Label 신뢰도 설계
- HunyuanVideo 13B는 어떻게 영상을 만들까: 데이터, 3D VAE, 실행 전제
- MILS 톺아보기
- MoAI는 왜 외부 CV 모델 4개를 붙이나: Compressor와 Mixer
- DEIM은 DETR 학습을 왜 줄이나: Dense O2O와 MAL
- LLaVA는 Image Token을 LLM에 어떻게 연결할까? Linear Projection과 2단계 학습
- 도로 위험물 데이터가 없을 때: HazardNet이 합성 장애물을 아무 곳에나 놓지 않은 이유
- Diffusion 학습 코드는 왜 원본 이미지 대신 Noise를 맞출까?
- StyleGAN 얼굴 편집에서 머리카락이 붙어 움직이는 이유: v1, v2, v3 변화
- StyleGAN Blending에서 눈이 네 개 생기는 이유: 얼굴 정렬부터 Pix2PixHD까지
- 모델 경량화, Pruning, Quantization, Distillation 중 무엇부터 해야 할까?
- 얼굴 인식이 자꾸 틀리는 이유: 검출, 정렬, FaceNet Triplet Loss 점검
- Saliency Map은 무엇을 설명하나: 입력 gradient 시각화와 해석의 한계
- Grad-CAM은 CAM과 무엇이 다른가: GAP 없이 CNN 판단 영역 찾기
- CAM 히트맵이 엉뚱한 곳을 보는 이유: GAP 구조와 구현 체크리스트
- EfficientDet은 왜 빠른가: BiFPN 가중치 융합과 복합 스케일링 핵심
- EfficientDet 전에 보는 EfficientNet Compound Scaling: 세 축을 함께 키우는 이유
- Deformable Convolution은 Offset을 어디에 더하나: DCN 수식 해설
- CornerNet은 Anchor 없이 박스를 어떻게 묶나: Heatmap, Embedding, Offset
- AutoAugment 정책은 무엇을 검색하나: 연산, 확률, 크기 30개 결정
- FPN의 Top-down, Lateral Connection은 멀티스케일 특징을 어떻게 살리나
- FSAF는 Anchor 없이 어떤 FPN 레벨을 고르나
- MMDetection 구조 읽는 법: Backbone, Neck, Head와 테스트 명령 연결
- SSD는 왜 8,732개 Default Box를 쓰나: 멀티스케일 구조 계산
- Xception과 MobileNet은 Depthwise Separable Convolution을 어떻게 다르게 쓰나
- Deep SORT의 코사인 거리는 어디에 쓰일까: Feature Gallery와 추적 코드 흐름
- CenterNet은 Anchor와 NMS 없이 어떻게 물체를 찾을까: 중심점, 크기, Offset 해설
- SORT가 빠른 대신 ID를 놓치는 이유: Kalman Filter와 Hungarian 매칭
- YOLOv2는 recall을 어떻게 올렸나: Anchor Box, 좌표 제약, Multi-Scale의 역할
- YOLOv1은 왜 빠르지만 작은 물체에 약할까: 7×7 Grid와 Loss 해설
- 사람을 한 명씩 찾지 않고 군중을 세는 법: MCNN과 Density Map
- 짝지은 이미지 없이 스타일을 바꾸려면: CycleGAN 손실함수와 구현 핵심