TL;DR

  • 장문맥 추론에서 KV 캐시 정책을 사용하는 희소 어텐션 모델을 미세 조정하는 방법을 제시하며, 단일 Nvidia A100 40GB에서도 실행되고 정확 어텐션으로 학습한 모델보다 나은 성능을 내는 경우가 있음.
  • 제안 방법은 모든 KV 캐시 정책에 적용 가능함.
  • 모델이 KV 캐시 정책과 함께 적응하도록 학습함.
  • 실험에서 주요 정책으로 사용한 H2O 희소 어텐션의 효율적 구현과 전용 스케일드 닷 프로덕트 어텐션(scaled dot product attention) 커널 지원을 제공함.
  • 장문맥 추론과 미세 조정을 위한 오픈소스 라이브러리 KeysAndValues가 논문에서 다룬 모든 방법의 사용하기 쉽고 성능이 높은 코드를 제공함.

초록

  • 기존 연구 다수는 과도한 하드웨어 예산 없이 트랜스포머 언어 모델의 장문맥 추론을 가능하게 하기 위해 희소 어텐션 기반 키-값(KV) 캐시 선택 및 압축을 다룸.
  • 새로운 희소 어텐션 모델 미세 조정 방법은 모든 KV 캐시 정책에서 작동하며, 적정 수준의 하드웨어 예산으로 실행 가능함. 예를 들어 40GB 메모리를 갖춘 단일 Nvidia A100 GPU에서 실행됨.
  • 이 방법은 모델과 정책이 함께 적응하도록 하며, 정확 어텐션(시퀀스 병렬 처리)으로 학습한 모델보다 성능이 더 높은 경우가 많음.
  • 실험에서 주요 정책인 H2O 희소 어텐션의 효율적 구현과 전용 스케일드 닷 프로덕트 어텐션 커널 지원을 제공함.
  • 새로운 오픈소스 장문맥 추론·미세 조정 라이브러리 KeysAndValues는 논문에서 다룬 모든 방법의 사용하기 쉽고 성능이 높은 코드를 제공함.
  • 논문 DOI: https://doi.org/10.48550/arXiv.2608.19920