Holi-Spatial은 3D 라벨 생성의 사람 손을 크게 줄일 수 있지만, 자동 생성된 마스크, 박스, QA의 오차까지 없애지는 못합니다.
Paper ID 2603.07660은 날것의 비디오에서 기하와 의미 정보를 단계적으로 만들고, 이를 Holi-Spatial-4M이라는 대규모 공간 데이터로 구성합니다. “자동화”의 의미는 라벨마다 사람이 직접 상자를 그리지 않는다는 것이지, 입력 영상 선별과 품질 감사까지 필요 없다는 뜻은 아닙니다.
Holi-Spatial은 3D 라벨 생성의 사람 손을 크게 줄일 수 있지만, 자동 생성된 마스크, 박스, QA의 오차까지 없애지는 못합니다.
Paper ID 2603.07660은 날것의 비디오에서 기하와 의미 정보를 단계적으로 만들고, 이를 Holi-Spatial-4M이라는 대규모 공간 데이터로 구성합니다. “자동화”의 의미는 라벨마다 사람이 직접 상자를 그리지 않는다는 것이지, 입력 영상 선별과 품질 감사까지 필요 없다는 뜻은 아닙니다.
원문에 제시된 구성은 약 1만 2천 개의 3D Gaussian Splatting Scene, 130만 개의 2D Mask, 32만 개의 3D Bounding Box, 120만 개의 공간 QA 쌍입니다. 서로 다른 수준의 데이터가 한 파이프라인에서 연결된다는 점이 중요합니다.
| 산출물 | 담당하는 정보 | 주요 오류 |
|---|---|---|
| 3DGS Scene | 장면의 기하와 시점 | 카메라 Pose, Depth 오류 |
| 2D Mask | 프레임별 객체 영역 | 가림, 경계, 클래스 오류 |
| 3D Box | 공간 속 객체 위치 | 잘못된 역투영과 병합 |
| 공간 QA | 객체 관계 질문과 답 | LLM 해석, 문장 오류 |
규모는 일반화를 돕는 재료이지만 자동 라벨의 같은 오류가 대량 반복될 수도 있습니다. 데이터 개수와 유효한 정답 개수를 구분해야 합니다.
첫 단계에서는 비디오의 카메라 Pose를 SfM으로 추정하고 3DGS를 최적화해 장면과 Depth 정보를 만듭니다. 3DGS는 Gaussian 표현으로 빠른 렌더링과 여러 시점의 기하를 제공하는 기반입니다.
두 번째 단계에서는 VLM과 SAM 계열 모델이 2D Frame의 Mask와 Caption을 만들고, Depth와 Camera Pose로 이를 3D 공간에 역투영합니다. 여러 시점에서 관찰한 마스크를 합쳐 객체 Instance와 3D Bounding Box를 구성합니다.
마지막 단계에서는 Box 위치와 겹침 같은 기하 관계를 계산하고, LLM이 이를 자연어 관계와 공간 QA로 바꿉니다. 앞 단계의 오차가 뒤 단계로 전파되는 직렬 구조이므로 최종 QA만 샘플링해서 보는 것으로는 원인을 찾기 어렵습니다.
Mask가 잘 맞아도 Box가 다른 객체와 합쳐질 수 있고, 기하 관계가 맞아도 LLM이 질문을 모호하게 쓸 수 있습니다. 단계별 표본 검사가 필요합니다.
AI가 만든 라벨로 AI를 학습할 때는 생성 모델의 편향이 학습 모델로 옮겨갈 수 있습니다. 소량의 사람 검수 세트는 비용 낭비가 아니라 자동 파이프라인의 오차를 측정하는 기준입니다.
1만 2천 Scene마다 3DGS를 최적화하고, 프레임 단위로 SAM, VLM을 실행하며, 역투영과 LLM QA 생성까지 수행하면 연산량이 큽니다. 수작업 시간이 줄어도 GPU 시간, 저장 공간, 실패 재처리와 모델 호출 비용이 생깁니다.
새 공장이나 실내 환경에 적용할 때도 영상만 넣으면 즉시 완성 데이터가 나오는 것은 아닙니다. 카메라 움직임, 조명, 가림, 동적 객체가 기존 데이터와 다르면 SfM과 병합 규칙을 다시 조정해야 합니다. 개인정보가 포함된 비디오라면 저장과 모델 전송 범위도 별도 요구 사항입니다.
공간 VLM을 학습하려는 팀은 공개된 Holi-Spatial-4M 일부를 기존 데이터와 함께 시험할 수 있습니다. 먼저 자신의 질문 유형과 장면에서 라벨 오류율과 다운스트림 성능 변화를 측정해야 합니다. 데이터셋 이름이나 규모만으로 도메인 적합성을 판단하지 않습니다.
파이프라인 자체 구축은 대표 영상 수십 개로 시작해 Scene당 GPU 시간, 단계별 실패율, 사람 검수 시간을 계산한 뒤 확대하는 편이 안전합니다. Holi-Spatial의 의미는 “라벨링 노가다의 끝”보다 비디오에서 3D 공간 학습 데이터를 대량 생산하는 경로를 제시했다는 데 있습니다.
최종 공간 QA가 틀렸을 때 질문 생성 모델만 고치면 원인을 놓칠 수 있습니다. 카메라 자세가 어긋나 깊이가 틀렸고, 그 결과 마스크가 잘못된 위치로 역투영돼 박스 관계가 바뀌었을 수 있습니다. 각 산출물에 입력 장면과 이전 단계의 식별자를 연결해야 오류를 거슬러 올라갈 수 있습니다.
검수 표본에서는 먼저 카메라와 깊이, 다음으로 프레임별 마스크, 다중 시점 인스턴스 병합, 3D 박스, 관계 계산, 자연어 QA 순서로 확인합니다. 앞 단계가 틀린 표본과 앞 단계는 맞지만 뒤 단계만 틀린 표본을 분리하면 어떤 모듈을 개선해야 할지 알 수 있습니다. 최종 정답률 하나만으로는 파이프라인의 병목을 찾기 어렵습니다.
SfM과 정적인 장면 표현은 여러 프레임에서 같은 구조를 관찰한다는 가정에 기대는 경우가 많습니다. 사람이나 차량이 크게 움직이면 카메라 이동과 물체 이동을 혼동하거나 한 물체가 여러 위치에 중복될 수 있습니다. 반사면, 투명 물체, 질감이 적은 벽도 자세와 깊이 추정을 어렵게 만듭니다.
영상 선별 단계에서 카메라 흔들림, 동적 영역 비율, 흐림, 조명 변화와 재구성 실패 신호를 기록하는 것이 좋습니다. 어려운 장면을 모두 버리면 데이터가 깨끗해지는 대신 실제 환경의 중요한 실패가 사라질 수 있습니다. 학습용으로 제외한 장면도 별도 평가 세트에 남겨 모델이 어디까지 일반화하는지 확인해야 합니다.
박스의 중심과 크기, 좌표계를 기준으로 왼쪽, 오른쪽, 위, 아래, 포함과 겹침 같은 관계를 결정론적으로 다시 계산할 수 있습니다. 생성된 QA의 답이 이 계산과 일치하는지 검사하면 언어 모델 단계의 오류를 일부 자동으로 찾을 수 있습니다. 카메라 기준 관계와 세계 좌표 기준 관계를 섞지 않도록 질문마다 좌표계를 명시해야 합니다.
“가깝다”처럼 임계값에 따라 달라지는 표현은 경계 사례를 따로 봅니다. 두 박스가 거의 맞닿거나 가림 때문에 크기가 불확실할 때 단정적인 답을 만들지 않도록 규칙을 정할 수 있습니다. 질문 문장은 자연스러워도 두 대상의 이름이 같은 인스턴스를 가리키는지 확인해야 합니다.
무작위 표본만 보면 드문 실패를 놓칠 수 있습니다. 전체에서 무작위로 뽑은 표본과 재구성 점수가 낮은 장면, 동적 객체가 많은 장면, 드문 클래스처럼 위험 기반 표본을 함께 사용합니다. 단계별 오류율과 오류 유형을 기록하고 파이프라인 설정이 바뀔 때 같은 기준으로 다시 측정합니다.
라벨 하나의 정확도뿐 아니라 장면 단위의 상관도 봐야 합니다. 한 장면에서 카메라 오류가 나면 수백 개 마스크와 QA가 동시에 틀릴 수 있으므로 항목 수 기준 오류율이 실제 독립 표본 수를 과대평가할 수 있습니다. 장면별 통과율과 항목별 통과율을 함께 보고 오류 묶음을 제거하거나 다시 처리합니다.
공개 데이터의 장면, 질문 분포가 실제 적용 환경과 다르면 규모가 커도 도움이 제한될 수 있습니다. 먼저 공개 데이터만, 자체 데이터만, 두 데이터를 섞은 조건을 같은 평가 세트에서 비교합니다. 개선이 특정 장면 유형에만 나타나는지와 자체 데이터 성능이 오히려 내려가는지도 확인해야 합니다.
데이터 라이선스와 영상 속 사람, 시설의 개인정보 처리 조건도 검토합니다. 외부 VLM이나 LLM을 라벨 생성에 쓰면 원본 프레임이 어디로 전송되고 얼마나 보관되는지 확인해야 합니다. 모델 성능과 별개로 데이터 계보, 삭제 요청, 재생성 가능한 설정을 남겨야 대규모 자동 라벨을 운영할 수 있습니다.
아닙니다. SfM, 3DGS, 마스크, 역투영과 QA 생성의 오류가 다음 단계로 전파될 수 있으므로 사람이 판정한 표본으로 단계별 오차를 측정해야 합니다.
아닙니다. 약 1만 2천 3DGS 장면과 2D 마스크, 3D 박스, 공간 QA 등 서로 다른 종류의 산출물을 합친 규모이므로 항목별 수와 품질을 구분해 읽어야 합니다.
대표 영상 수십 개에서 카메라 추정, 마스크 병합, 박스와 QA의 단계별 실패율, 장면당 GPU 시간과 사람 검수 시간을 먼저 측정한 뒤 확대하는 편이 안전합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.