TL;DR
- 에이전트형 워크로드의 대규모 언어 모델(LLM) 접두사 캐시에서는 활성 세션의 규칙적인 요청 간격이 재사용을 좌우해, 14개 퇴거 알고리즘 중 정교한 정책도 LRU보다 큰 이점을 보이지 않음.
- 두 회사의 실제 운영 추적 데이터를 HBM 제약 환경과 대규모 메모리 풀 환경에서 분석함.
- Belady 알고리즘과의 성능 격차가 크지만, 기존 캐시용 정교한 정책은 LRU보다 효과가 미미함.
- 세션 메모리 사용량의 헤비테일 분포와 시퀀스 길이에 따른 캐시 미스 비용 변동을 분석하기 위해 컴퓨트 절감 비율과 두 가지 오프라인 오라클을 도입함.
- 효과적인 관리는 LRU 기반에 단발성 접두사의 빠른 강등, 고비용 미스를 고려한 컴퓨트 인지 부분 퇴거, 용량에 따른 퇴거 단위 조정을 선택적으로 결합하는 방식임.
연구 배경과 평가
- 장시간 실행되는 LLM 애플리케이션은 점점 길어지는 문맥을 반복해서 전송하므로, 프리필 비용을 줄이는 접두사 캐싱이 중요함.
- 에이전트형 워크로드에서 접두사 캐시가 어떻게 동작하는지는 충분히 파악되지 않은 상태임.
- 두 회사의 실제 운영 추적 데이터를 바탕으로 14개 퇴거 알고리즘을 HBM 용량이 제한된 환경과 대규모 메모리 풀 환경에서 평가함.
- 정교한 퇴거 정책은 Belady 알고리즘과 큰 성능 격차를 보이며, 기존 캐시를 위해 설계된 정책도 LRU보다 이점이 거의 없음.
접두사 캐시의 특성과 관리 방안
- 활성 세션의 규칙적인 요청 간격이 접두사 재사용을 지배하므로, 최근 사용 여부가 일반적인 캐시보다 특히 좋은 재사용 예측 지표임.
- 접두사 캐시에는 세션별 메모리 사용량의 헤비테일 분포와, 시퀀스가 길어질수록 어텐션 연산량이 증가해 캐시 미스 비용이 크게 달라지는 문제가 있음.
- 이러한 효과를 정량화하기 위해 컴퓨트 절감 비율과 두 가지 오프라인 오라클을 제시함.
- 관리 정책은 LRU를 기반으로 삼고, 단발성 접두사를 빠르게 강등하며, 비용이 큰 미스에 컴퓨트 인지 부분 퇴거를 적용하고, 캐시 용량에 맞춰 퇴거 단위를 조정하는 방식임.
- 향후 연구를 지원하기 위해 추적 데이터와 시뮬레이터를 공개할 예정임.
- 논문: arXiv:2609.28870
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요