!원문 캡처 · news.ycombinator.com

ALHR(Adaptive Learnable Hierarchical Routing)은 정적 이진 트리와 학습 가능한 함수를 이용해 질의마다 읽는 키의 수를 줄이는 희소 어텐션 시스템이다. 제안자는 1단계 학습에서 밀집 교사 모델을 사용한다고 밝혔으며, 전체 규모 테스트는 아직 완료되지 않았다고 덧붙였다.

1024토큰 MQAR 테스트에서 밀집 방식은 질의당 평균 512개 키를 읽었고, ALHR은 30개를 읽었다. Top-1 정확도는 각각 94.9%와 92.1%였다. 제안자가 제시한 KV 압축률은 밀집 방식이 1배(전체의 100% 읽기), ALHR이 35.3배(2.83% 읽기)다.

피크 VRAM은 밀집 방식이 57MB로 입력 길이에 따라 제곱으로 증가하고, ALHR은 422MB로 선형 증가한다고 설명했다. ALHR의 캐시 압축률은 100%로 제시됐다. 실제 로그와 테스트에 사용한 Kaggle 셀은 저장소의 logs 폴더에 있다고 한다.

제안자에 따르면 학습 비용은 여전히 제곱으로 증가하지만 추론은 NlogN이 될 수 있다. 이 추론 복잡도는 저장소의 로그에 나타난 내용이며, 전체 규모 테스트는 아직 끝나지 않았다. 저장소 링크는 게시물 댓글에 있다고만 언급돼 있어 자료에는 URL이 포함되지 않았다.