로보틱스 67
- Anthropic, Claude와 실물 로봇 연결하는 Model Hardware Standard 리서치 프리뷰 공개
- lingbot-map: 단일 카메라로 1만 프레임의 3D 공간을 실시간으로 그려내는 원리
- 메타의 1만 3천 개 앱을 지탱하는 AI 네이티브 디자인 시스템: Astryx 원리와 활용법
- CSS 셀렉터가 바뀌어도 크롤러가 살아남을까? Scrapling Adaptive의 한계
- 비디오 배경이 카메라와 함께 휘어진다면? VGGRPO의 잠재 4D 보상
- 5초 영상으로 120초를 만들 수 있을까? PackForcing의 4GB KV 조건
- 화면 밖 자동차를 비디오 모델이 잊는다면? HyDRA의 Top-K 기억
- GameplayQA에서 MLLM이 무너지는 이유: 초당 1.22라벨, Self/Other/World
- WildWorld 1억8천만 프레임이 월드 모델을 만들까: 450개 Action과 게임 편향
- 예쁜 영상이 물리까지 맞는지 어떻게 알까: Omni-WorldBench 평가법
- 사진 한 장에서 서랍의 축까지 찾을 수 있을까: MonoArt의 단계별 추론
- 3D 라벨 없이 장면의 앞뒤를 읽을 수 있을까: VEGA-3D의 대가
- 웹 스크래핑에 Chrome이 너무 무겁다면? Lightpanda가 맞는 작업
- 로봇 비디오가 물체를 뚫고 지나간다면? Kinema4D의 URDF, Pointmap 제어
- MA-EgoQA는 로봇 6대의 영상을 함께 이해할까: 7일 기억과 EgoMAS 검색
- LoGeR가 19,000프레임 3D 재구성을 버틸까: TTT, SWA 메모리의 대가
- 로봇 메모리는 무엇을 기억해야 하나: RoboMME 16개 과제의 답
- 냉장고 문을 열 때 손이 관통한다면: ArtHOI의 4D 재구성
- 스마트폰 피드백만으로 로봇 정책을 고칠 수 있나: RoboPocket
- VLM은 텍스트 모델부터 학습해야 할까? Transfusion 공동 사전학습의 대안
- LiDAR, RGB-D, CAD를 한 3D 인코더로 처리할 수 있을까? Utonia의 범위
- 이미지를 생성하면 멀티모달 문제를 더 잘 풀까? UniG2U-Bench의 반례
- 카메라 자세 없이 실내 3D 객체를 찾을 수 있을까? VGGT-Det의 조건
- BettaFish는 에이전트 토론으로 여론 왜곡을 줄일까: 5개 역할과 크롤링 편향
- 카메라 없이 WiFi CSI로 자세를 읽을 수 있나: WiFi-DensePose의 조건
- 로봇이 미래 영상을 만들지 않고도 다음 행동을 고를 수 있나: World Guidance
- VLANeXt의 12가지 VLA 설계 레시피는 어떻게 검증해야 할까
- 로봇 진행률을 말로 묻지 않고 잴 수 있을까? TOPReward의 토큰 확률
- 로봇은 미래 픽셀까지 그려야 할까? FRAPPE의 다중 VFM 정렬
- ZeroClaw는 RAM 5MB로 무엇을 실행하나: Rust 런타임 검증 기준
- DreamZero는 비디오와 행동을 함께 예측해 제로샷 정책이 될 수 있나
- RynnBrain 30B-A3B는 로봇에 충분히 가벼울까: 3B 활성 파라미터와 제어 지연
- 사진 수만 장에서 나중에 다시 만난 사람을 찾을까: DeepImageSearch의 검색 비용과 오류 전파
- 실물 시행착오 없이 로봇 정책을 개선할 수 있나: RISE의 상상 롤아웃
- GigaBrain-0.5M*는 월드 모델을 로봇 정책에 어떻게 연결하나
- RD-VLA는 로봇의 추론 깊이를 어떻게 조절하나: 잠재 반복과 정지 조건
- 인간 영상 4만 4천 시간은 로봇 행동이 될 수 있나: DreamDojo
- 화질 좋은 AI 영상이 물리 법칙은 틀리는 이유: RISE-Video 467개 Test
- Green-VLA의 5단계 Curriculum은 무엇을 더하나? R2 RL과 OOD 검증
- 로봇이 미래 Frame을 맞히면 Action도 나아질까? LingBot-VA의 World Model
- DynamicVLA는 0.4B로 움직이는 물체를 80% 잡을까: 20Hz Action Streaming 검증
- LingBot-World의 16 FPS는 실시간 월드 모델을 뜻할까: 1초 지연과 장기 기억 점검
- LingBot-VLA의 261 samples/s는 로봇 제어 속도일까: 2만 시간 데이터와 130회 전이
- TwinBrainVLA는 지능을 보존하며 20Hz 제어할까: Frozen VLM과 Action Expert의 대가
- BayesianVLA는 왜 로봇이 언어를 무시하는 문제를 줄이나: PMI 수식과 11.3%p
- HERMES는 TTFT를 왜 10배 줄였나: Streaming Video KV Cache의 계층화와 손실
- Think3D는 가려진 물체를 실제로 볼 수 있을까: 3D CoT와 재구성 오류의 한계
- Being-H0.5는 다른 로봇 사이에서 무엇을 공유하나? Human Data와 Mixture-of-Flow
- STEP3-VL-10B가 200B 모델보다 효율적일까: PaCoRe 성능과 추론 비용 점검
- RoboVIP은 로봇 영상을 왜 텍스트 대신 참조 이미지로 바꾸나
- 게임 영상 4만 시간에 버튼 라벨은 어떻게 붙였나: NitroGen의 답
- 로봇은 언제 되물어야 하나: VL-LN Bench의 질문 비용과 성공률
- GR-Dexter는 양손 42-DoF를 어떻게 다루나: 데이터, 가림, 제어
- 로봇이 목표까지의 중간 장면을 상상하면 왜 나아질까? Act2Goal의 MSTH
- 로봇 Action을 한 Token씩 만들지 않으면 나아질까? Dream-VL, Dream-VLA
- InsertAnywhere는 영상 속 객체 위치를 어떻게 고정할까? 4D Mask와 Diffusion
- VLM이 카메라 이동과 객체 이동을 헷갈리는 이유: DSR Suite와 GSM
- 인간 1인칭 영상이 로봇 학습에 바로 쓰이지 못하는 이유: PhysBrain E2E
- NEPA는 왜 다음 Pixel 대신 Embedding을 예측할까? Causal Mask와 Stop-Gradient
- Latent Bridge Matching의 1 NFE는 정말 한 번의 계산일까: 수식, 속도, 한계 해설
- AI 에이전트와 챗봇은 무엇이 다른가: 도구 실행, 메모리, 권한까지 만드는 순서
- YOLOE: 모든 객체를 실시간으로 탐지 & 분할하는 혁신 기술
- DICEPTION 하나로 깊이, 법선, 분할을 다 잘할까: 벤치마크가 보여준 성능 차이
- Magma는 UI 클릭과 로봇 행동을 어떻게 한 모델로 배우나: SoM, ToM 구조와 한계
- Q-learning에서 DQN, Policy Gradient로 넘어가는 기준
- ROS 토픽 통신이 안 보일 때: Publisher, Subscriber 확인 순서
- Google Assistant 로봇, IFTTT 대신 샘플 코드를 수정한 이유