파인튜닝 59
- FluidVoice: 구독료 없이 Mac에서 작동하는 온디바이스 AI 음성 받아쓰기 구축기
- open-code-review: 2만 명의 개발자가 검증한 알리바바의 하이브리드 AI 코드 리뷰 시스템
- Kronos: 금융 캔들스틱 데이터를 언어로 이해하는 파운데이션 모델 심층 분석
- ayghri/i-have-adhd: AI 코딩 에이전트의 불필요한 수다를 멈추고 즉각적인 행동을 끌어내는 법
- KTransformers: 24GB 단일 GPU와 시스템 메모리로 600B급 MoE 모델을 구동하는 이기종 추론 기술
- TinyZero는 정말 30달러로 추론 모델을 만들까? 가능한 문제의 조건
- Diffusion LLM이 Qwen보다 5배 빠를까? d3LLM 병렬 디코딩의 조건
- Hyperframes로 HTML 영상을 만들면 재현 가능할까: 프레임, 폰트, FFmpeg 검사
- 비디오 배경이 카메라와 함께 휘어진다면? VGGRPO의 잠재 4D 보상
- 기존 AI 에이전트 코드를 안 고치고 RL을 붙일 수 있을까? Agent Lightning의 범위
- AVControl은 LoRA 하나로 Audio, Video 제어를 끝낼까: Parallel Canvas 비용
- GameplayQA에서 MLLM이 무너지는 이유: 초당 1.22라벨, Self/Other/World
- UI-Voyager 4B의 81%가 앱 자동화에 충분할까: GRSD와 SSIM Fork
- 카메라가 돌면 제품 뒷면이 무너진다면: 3DreamBooth의 1프레임 학습
- 카메라가 돌아오면 방이 바뀌는 문제: MosaicMem의 3D 패치 기억
- Heretic는 LLM 거부 방향을 어떻게 바꾸나: 절제, 품질, 안전 검증
- 멀티모달 에이전트가 같은 실수를 반복한다면? XSkill의 경험, 스킬 메모리
- 스마트폰 피드백만으로 로봇 정책을 고칠 수 있나: RoboPocket
- LiDAR, RGB-D, CAD를 한 3D 인코더로 처리할 수 있을까? Utonia의 범위
- 이미지 생성 모델이 너무 많다면? Diffusion-GPT 라우터의 선택 기준
- 100달러로 ChatGPT를 처음부터 학습할 수 있을까? NanoChat의 비용 조건
- 로봇 진행률을 말로 묻지 않고 잴 수 있을까? TOPReward의 토큰 확률
- 예시 이미지의 변화만 다른 사진에 옮길 수 있을까? LoRWeB의 LoRA Basis
- 이미지 한 장이 5턴 뒤 답변을 바꿀 수 있을까? VMI 공격이 노리는 기억
- 이미지를 다시 자르지 않고 작은 글씨를 읽을까: ZwZ Single-pass와 Zooming Gap
- 긴 영상 배경음악이 장면 감정을 놓칠 때: NarraScore의 이중 제어
- 긴 영상 요약이 대화, 카메라, 효과음을 놓친다면: TimeChat-Captioner
- GUI 에이전트는 클릭 전에 다음 화면을 예측할 수 있나: Code2World
- RD-VLA는 로봇의 추론 깊이를 어떻게 조절하나: 잠재 반복과 정지 조건
- Lean Proof Repair는 Compiler Feedback으로 얼마나 나아질까? APRIL 검증법
- Green-VLA의 5단계 Curriculum은 무엇을 더하나? R2 RL과 OOD 검증
- LingBot-VLA의 261 samples/s는 로봇 제어 속도일까: 2만 시간 데이터와 130회 전이
- TwinBrainVLA는 지능을 보존하며 20Hz 제어할까: Frozen VLM과 Action Expert의 대가
- RAE가 VAE보다 빨리 수렴할까: 1152차원 표현 공간의 이득과 비용
- HERMES는 TTFT를 왜 10배 줄였나: Streaming Video KV Cache의 계층화와 손실
- Being-H0.5는 다른 로봇 사이에서 무엇을 공유하나? Human Data와 Mixture-of-Flow
- TMD는 50-step 비디오 생성을 정말 4-step으로 줄일까: Backbone, Flow Head 구조
- STEP3-VL-10B가 200B 모델보다 효율적일까: PaCoRe 성능과 추론 비용 점검
- 비디오 데이터를 더 모아도 움직임이 나쁜 이유: Motive의 선별법
- 게임 영상 4만 시간에 버튼 라벨은 어떻게 붙였나: NitroGen의 답
- 로봇이 목표까지의 중간 장면을 상상하면 왜 나아질까? Act2Goal의 MSTH
- 로봇 Action을 한 Token씩 만들지 않으면 나아질까? Dream-VL, Dream-VLA
- TurboDiffusion 100~200배 가속은 어떻게 나왔나? Attention, rCM, W8A8 조건
- NEPA는 왜 다음 Pixel 대신 Embedding을 예측할까? Causal Mask와 Stop-Gradient
- KV-Edit는 배경을 정말 100% 보존할까: Training-Free 편집과 O(1) 주장 점검
- UniTok은 이미지 생성과 이해를 둘 다 잘할까: rFID 0.38과 정확도 78.6의 의미
- DICEPTION 하나로 깊이, 법선, 분할을 다 잘할까: 벤치마크가 보여준 성능 차이
- PhotoDoodle은 30~50쌍으로 스타일을 배울까: 배경 보존 구조와 실행 코드 함정
- Reasoning LLM은 정말 인간처럼 생각할까: System 1, 2와 추론 성능을 구분하는 법
- VideoLLaMA 3는 중복 프레임을 어떻게 줄일까: AVT, DiffFP
- Grok 3 벤치마크는 정말 압도적일까: AIME, GPQA 수치 읽기
- RAG가 엉뚱한 문서를 찾는다면? RAFT의 Distractor 학습법
- MILS 톺아보기
- LLaVA는 Image Token을 LLM에 어떻게 연결할까? Linear Projection과 2단계 학습
- DeepSeek는 왜 모든 Expert를 쓰지 않을까? MoE 효율 구조와 모델 선택법
- Darknet BatchNorm은 학습과 추론에서 왜 다른 Mean을 쓸까?
- 모델 경량화, Pruning, Quantization, Distillation 중 무엇부터 해야 할까?
- YOLOv2는 recall을 어떻게 올렸나: Anchor Box, 좌표 제약, Multi-Scale의 역할
- 사람을 한 명씩 찾지 않고 군중을 세는 법: MCNN과 Density Map