Davis Wertheimer와 공동 저자들은 KV 캐시를 입력에 따라 가지치기하는 트랜스포머 아키텍처 Universal Attention을 제안했다. 논문 초록에 따르면 자연어와 합성 과제에서 10배 압축을 달성하면서 다운스트림 성능을 높였고, 길이 16k 조건에서는 25배 압축과 긴 문맥 일반화 성능을 보였다.
기존의 감쇠 기반 KV 캐시 제거 방식은 표현력이 제한돼 슬라이딩 윈도우와 비슷한 패턴으로 퇴화하는 문제가 있다고 연구진은 설명한다. Universal Attention은 RoPE 위치 임베딩과 Softmax 어텐션을 유지하면서 여러 감쇠 메커니즘을 결합한다. 이 결합 감쇠 메커니즘은 어텐션 계산에 덜 기여하는 토큰을 적응적으로 제거하는 기준으로 작동하며, 종단 간 학습이 가능하다고 초록은 주장한다.
결과는 논문 초록에 요약된 실험 주장이다. 초록에는 비교 기준의 세부 설정이나 압축률 측정 방식이 제시되지 않아, 구체적인 적용 조건은 논문 본문에서 확인해야 한다. 논문 PDF · HTML 본문 · arXiv 초록 · DOI
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요