DeepSeek Engram은 정적 N-gram 메모리를 DRAM 쪽으로 분리할 수 있지만, 모델 가중치와 동적 컨텍스트까지 VRAM에서 없애 주는 기술은 아닙니다.
Engram의 아이디어는 자주 반복되는 정적 패턴을 모든 신경망 층에서 다시 계산하지 말고 결정론적인 주소로 조회하자는 것입니다. Attention, MoE가 문맥과 추론을 처리하는 동안 별도 N-gram 임베딩 테이블이 기억 역할을 맡습니다. 이 분리는 HBM 사용을 줄일 여지가 있지만, 호스트 메모리 조회가 실제 생성 지연에 미치는 영향을 함께 봐야 합니다.