Disk KV Cache가 해결하는 것은 세션 전환이다
긴 대화에서는 과거 토큰의 key와 value를 보관하는 KV 캐시가 커집니다. 원문은 한 개의 활성 세션만 메모리에 두고 다른 세션의 KV 캐시를 SSD에 직렬화했다가 복원하는 구조를 설명합니다. 돌아온 세션의 앞부분을 다시 계산하지 않아도 된다는 것이 핵심입니다.
이 방식이 모델 가중치를 작게 만들거나 한 세션의 추론 속도를 자동으로 높이는 것은 아닙니다. 캐시 크기, 저장, 복원 시간, 동시 세션 수와 SSD 쓰기량을 함께 재야 합니다. 개인 대화 내용이 캐시 파일에 남을 수 있으므로 저장 경로, 권한과 삭제 시점도 정해야 합니다.
cache file에는 model, tokenizer, prompt prefix, dtype, shape, session과 format version을 넣어야 잘못된 binary를 복원하지 않습니다. Write 중 process가 죽으면 partial file을 다음 실행이 읽지 않도록 temporary file과 atomic rename, checksum을 사용합니다. Model upgrade, context parameter가 바뀌면 기존 cache를 invalidate합니다. 같은 session을 두 process가 동시에 열 때 lock과 conflict 정책도 필요합니다.
보안상 KV는 원문 token을 직접 저장하지 않아도 대화에서 파생된 민감 artifact입니다. 사용자별 directory와 file permission, encryption 요구, retention, explicit delete를 정합니다. Crash dump, backup과 Time Machine에 들어가는지도 확인합니다. SSD endurance는 session당 write byte와 하루 전환 수로 계산하고 cache quota, eviction을 둡니다.