영상과 소리를 따로 만들면 왜 어긋날까: MOVA의 동시 생성 구조
MOVA가 영상과 오디오를 같은 시간축에서 생성하는 원리, 32B MoE 중 18B를 활성화하는 의미와 동기화 평가, 도입 판단 기준을 정리합니다.
MOVA가 영상과 오디오를 같은 시간축에서 생성하는 원리, 32B MoE 중 18B를 활성화하는 의미와 동기화 평가, 도입 판단 기준을 정리합니다.
Shannon이 소스 분석부터 실제 익스플로잇 검증까지 수행하는 구조를 살펴보고, 도입 전에 필요한 권한 통제, 격리, 결과 재검증 기준을 정리합니다.
Thinking in Frames가 중간 상태를 이미지로 남겨 미로, 탱그램을 푸는 원리와 프레임 예산을 늘릴 때 생기는 정확도, 지연, 오류 누적을 설명합니다.
DreamDojo가 4만 4천 시간 human video에서 latent action을 배우고 약 500시간 robot data로 제어에 연결하는 원리, 10.81 FPS와 embodiment, drift, 안전 검증법을 설명합니다.
Claude Code 같은 terminal coding agent에 repository를 맡길 때 file, shell, Git 권한을 제한하고 CLAUDE.md, diff, test, secret, rollback으로 결과를 검증하는 기준을 설명합니다.
SIO가 복잡한 목표를 decision tree의 작은 선택으로 분해하고 답을 global instruction에 누적하는 원리, 54%, 70% 결과의 범위와 option bias, interaction cost를 설명합니다.
π-Distill이 성공 trajectory의 tool, argument 같은 privileged information을 training-only condition으로 쓰는 원리, shared policy, OPSD, PI leakage, privacy와 비용 검증법을 설명합니다.
RISE-Video가 467개 prompt, 8개 category로 video generator의 암시적 상식, 물리, 시간 인과를 평가하는 방식, LMM judge 편향과 simulation 적용 전 failure test를 설명합니다.
APRIL이 26만 Lean proof repair tuple과 compiler feedback으로 오류 진단, 수정을 학습하는 원리, synthetic perturbation의 범위, compile 검증, latency, 보안 조건을 설명합니다.
LUSPO가 RLVR objective의 sequence-length gradient 편향을 normalization해 GRPO의 장문화와 GSPO의 collapse를 줄이는 원리, length bucket, reasoning quality, token 비용 검증법을 설명합니다.