강화학습 46
- OpenAI 자율 에이전트 약 700개 격리망 탈출 사건 기술 보고서 분석
- OpenAI, 차세대 AI 모델 훈련 2주 전격 중단… 사이버 공격 위험 우려로 20% 연산 추가 투입
- Open-R1: 허깅페이스가 공개한 추론형 AI 모델 재현 프로젝트와 GRPO 학습 원리
- Unsloth: 단 한 대의 GPU로 대형 언어 모델을 5배 빠르게 학습시키는 파이썬 가속 라이브러리
- ayghri/i-have-adhd: AI 코딩 에이전트의 불필요한 수다를 멈추고 즉각적인 행동을 끌어내는 법
- AI Berkshire: 일반 인공지능이 주식 투자를 못 하는 이유와 다중 에이전트 프레임워크의 해결책
- TinyZero는 정말 30달러로 추론 모델을 만들까? 가능한 문제의 조건
- AI-Trader로 실거래를 맡겨도 될까? 저장소 불일치와 백테스트 함정
- vLLM과 FSDP를 함께 쓰면 LLM RL의 OOM이 사라질까? veRL의 조건
- ml-intern에 H100 300회 루프를 맡겨도 될까: 170K Compaction과 비용 상한
- 비디오 배경이 카메라와 함께 휘어진다면? VGGRPO의 잠재 4D 보상
- 기존 AI 에이전트 코드를 안 고치고 RL을 붙일 수 있을까? Agent Lightning의 범위
- EVA는 긴 영상 토큰을 얼마나 줄일까: SFT, KTO, GRPO와 탐색 지연
- UI-TARS는 Selenium을 대체할까: 픽셀 좌표 에이전트의 강점과 실패
- 영상의 다음 사건을 맞히려면: Video-CoE가 시간 근거를 강제하는 법
- 이미지 편집 RL이 배경을 망가뜨린다면? FIRM-8B의 보상 분리
- DreamVideo-Omni는 두 캐릭터 얼굴 융합을 막을까: Latent Identity RL의 범위
- 컴퓨터 에이전트가 일을 끝냈는지 영상만으로 알 수 있을까? ExeVRM의 조건
- MM-Zero의 '데이터 0'은 사실일까: Proposer, Coder, Solver와 합성 편향
- 카파시의 Autoresearch는 무엇을 자동화하나: 반복 실험의 범위와 한계
- CyberStrikeAI는 정말 자율 레드팀인가: 실행 전 출처, 격리 점검
- DeepSeek-R1은 정말 600만 달러로 o1급 추론을 만들었을까? 비용과 구조 분리
- 사용자 피드백을 계속 학습하면 AI가 정말 나아질까? OpenClaw-RL의 위험
- AgentFlow는 통짜 프롬프트보다 나을까: 4개 모듈과 Flow-GRPO의 비용
- SpatialScore가 왼쪽, 오른쪽 오류를 줄일까: 8만 쌍 보상모델의 범위
- 서술형 의료 AI는 무엇으로 채점해야 하나: MediX-R1의 복합 보상
- 로봇 진행률을 말로 묻지 않고 잴 수 있을까? TOPReward의 토큰 확률
- AI 에이전트가 클릭하기 전 결과를 미리 보면 실수가 줄까? CUWM의 2단계 예측
- ERL은 추론 때 성찰하지 않고도 Sokoban 81%를 얻을까: 자기증류의 비용과 함정
- MedXIAOHE는 의료 멀티모달 모델을 어떻게 학습하나: 구조와 검증 한계
- GigaBrain-0.5M*는 월드 모델을 로봇 정책에 어떻게 연결하나
- 5B 이미지 모델이 80B보다 낫다는 말은 어디까지 사실일까: DeepGen 1.0
- 물리 문제에서 그림 한 줄을 놓치면? P1-VL의 시각, 논리 학습
- GUI 에이전트는 클릭 전에 다음 화면을 예측할 수 있나: Code2World
- RLVR 답변이 알고리즘에 따라 길어지거나 무너지는 이유: LUSPO
- 7B AdaReasoner가 GPT-5를 이겼다는 말은 맞을까: Tool-GRPO +24.9% 읽는 법
- 위성 사진만 보고 학교와 병원을 구분할 수 있을까: SocioReasoner
- 사진 위치 500m 정확도가 8.0%에서 22.1%로 오른 이유: Thinking with Map
- NextFlow는 1024 이미지를 왜 5초에 만드나: Next-Scale의 선택
- 긴 영상 QA에서 전체를 요약하면 왜 틀릴까? LongVideoAgent의 구간 검색
- Magma는 UI 클릭과 로봇 행동을 어떻게 한 모델로 배우나: SoM, ToM 구조와 한계
- Reasoning LLM은 정말 인간처럼 생각할까: System 1, 2와 추론 성능을 구분하는 법
- DeepSeek는 왜 모든 Expert를 쓰지 않을까? MoE 효율 구조와 모델 선택법
- Q-learning에서 DQN, Policy Gradient로 넘어가는 기준
- AutoAugment 정책은 무엇을 검색하나: 연산, 확률, 크기 30개 결정
- FrozenLake Q-Learning이 자꾸 실패하는 이유: 탐험, 학습률, DQN까지