원문 캡처 · arxiv.org
원문 캡처 · arxiv.org

CAVEWOMAN 연구는 대규모 언어 모델(LLM)의 입력과 출력을 각각 줄였을 때 비용과 정확도가 어떻게 달라지는지 비교했다. 8개 모델을 5개 데이터셋에서 5단계 압축률로 평가한 결과, 출력 압축은 대체로 비용을 낮췄지만 입력 압축은 모델의 응답이 길어져 비용이 증가했다.

연구진은 각 생성 결과를 과제 정확도, 실제 항목별 비용, 압축하지 않은 기준 응답과의 텍스트 일치도라는 세 기준으로 평가하는 2채널 프로토콜 CAVEWOMAN을 제시했다. 두 채널은 같은 평가 항목에서 측정했다.

출력 압축은 API 모델에서 모델별 실제 비용을 1.4~2.4배 줄였고, 가장 좋은 경우에는 최대 3배 절감했다. 공개 요금 기준으로는 오픈 웨이트 모델 4개 모두에서 비용이 줄었다. 반면 입력 압축은 5개 벤치마크 평균 순비용을 약 1.15배 높였다. 가장 비용이 많이 증가한 데이터셋에서는 1.8배, 더 강하게 압축했을 때는 2.7배까지 올랐다. 연구진은 정확도가 떨어지는 동시에 모델이 더 긴 응답으로 이를 보상하기 때문이라고 설명했다.

비추론 모델에서는 입력을 압축했을 때 생성 결과의 표면 텍스트가 모델의 비압축 기준 응답과 달라지는 현상도 관찰됐다. 생성 결과 가운데 대략 절반은 정답이었지만, 그 텍스트가 모델 자신의 기준 응답이 함의하는 내용을 더는 담지 않았다. 이 차이는 길이를 통제한 재평가, 다중 비교 보정, 상호보완적인 의미 측정 방법을 이용한 재현에서도 유지됐다.

연구에는 모라요 대니얼 아데예미(Morayo Danielle Adeyemi), 라이언 A. 로시(Ryan A. Rossi), 프랑크 데르농쿠르(Franck Dernoncourt)가 참여했다. 논문과 코드·데이터를 공개했다.