KV 캐시 아키텍처
기술 개요
LLM 추론의 병목인 KV 캐시를 체계적으로 관리하는 아키텍처. 신원 기반 캐시 디렉터리, 계층 오프로드, P2P 프리픽스 공유를 포함합니다.
도입 배경
긴 컨텍스트와 반복 대화가 일상화된 서비스에서 KV 캐시 관리가 곧 비용·지연의 상한선을 정합니다. 캐시를 다루지 못하는 팀은 더 큰 GPU로 문제를 덮습니다.
구현 및 검증
신원(identity) 게이트가 있는 캐시 디렉터리로, 누구의 캐시가 어디 저장돼 있는지를 추적하고 접근 권한을 강제합니다.
GPU → CPU → 디스크 계층 오프로드로 working set을 확장합니다. 핫 캐시는 GPU에, 웜 캐시는 CPU/디스크에 두어 메모리 한계를 우회합니다.
P2P 프리픽스 공유로 동일 프리픽스(긴 시스템 프롬프트 등)의 재계산을 제거합니다.
검증 근거
아키텍처신원 게이트 캐시 디렉터리 — 캐시 소유권·접근권 강제
아키텍처GPU→CPU→디스크 계층 오프로드 working-set 확장
아키텍처P2P prefix sharing — 동일 프리픽스 재계산 제거