MA-EgoQA는 여섯 에이전트의 1인칭 영상을 함께 묻는 문제를 정의하지만, EgoMAS도 아직 운영 의사결정을 맡길 만큼 정확하다는 결과는 아닙니다.
MA-EgoQA 프로젝트는 한 질문이 여섯 개의 Egocentric Video와 7일에 걸친 사건을 참조하는 환경을 평가합니다. 한 Camera의 객체를 맞히는 수준을 넘어 어느 Agent가 무엇을 봤고, 서로의 행동이 시간과 공간에서 어떻게 이어졌는지 물어봅니다. 베이스라인 EgoMAS는 모든 Frame을 한 Context에 넣지 않고 Agent별 검색과 System-level Shared Memory로 범위를 줄입니다.

