미래 질문을 모르는 eviction을 어떻게 시험할까
평가 query를 cache 선택 전에 공개하면 attention importance가 특정 질문에 유리하게 작동할 수 있습니다. 실제 stream처럼 eviction이 끝난 뒤 질문을 제시하고, 같은 video에 현재 사건, 오래된 사건, 짧은 예외 사건을 묻는 세 묶음을 준비해야 미래-query blind 성능을 볼 수 있습니다.
예를 들어 사람이 방에 들어와 잠깐 key를 table에 두었다가 가방으로 옮긴 stream을 생각할 수 있습니다. 마지막 frame만 묻는 질문은 local cache로 답할 수 있지만 “key를 처음 둔 곳”은 짧은 과거 event가 global memory에 남아야 합니다. 두 질문의 평균 정확도만 내면 첫 질문이 두 번째 실패를 가릴 수 있으므로 event age별 recall을 따로 표시해야 합니다.
Memory budget도 고정합니다. Full history, sliding window, uniform sampling, HERMES가 서로 다른 token 수를 쓴다면 policy가 좋아서인지 budget이 커서인지 구분할 수 없습니다. 같은 token 수에서 local/global 배분 비율을 바꾸고, scene cut, 정적 장면, 빠른 motion별로 어느 계층이 포화되는지 기록하면 cache 설계의 실제 민감도를 알 수 있습니다.
총비용은 다음처럼 나눠 보는 편이 명확합니다.
1
2
3
| stream 총비용 = frame ingest + importance scoring + cache update
query 총비용 = 압축 KV attention + answer decoding
운영 총비용 = stream 총비용 + 모든 query 총비용
|
질문이 거의 없는 camera라면 query TTFT 절감보다 지속적인 ingest 비용이 클 수 있습니다. 반대로 하나의 stream에 질문이 자주 들어오면 미리 만든 KV를 여러 번 재사용해 이득이 커질 수 있습니다. 따라서 video 길이만이 아니라 stream당 query 수까지 같게 맞춘 비교가 필요합니다.
HERMES의 핵심은 모든 frame을 기억하는 것이 아니라 미래에 유용할 것 같은 token을 계층별로 선택하는 것입니다. 빠른 첫 응답이 가치 있는지는 무엇을 버렸는지, stream-time 계산을 포함한 총 비용이 얼마인지, 오래된 중요 event를 얼마나 자주 놓치는지까지 측정해야 판단할 수 있습니다.