TL;DR

  • LaTense(Latent Sense)가 대형 언어 모델(LLM)의 활성화 조정에서 발생하는 텍스트 반복과 추론 붕괴를 동적으로 완화하며, 세 가지 모델 계열에서 반복률 0.00%를 달성함.
  • 기존 정적 개입은 훈련 없이 LLM을 제어하지만 치명적인 텍스트 반복과 추론 붕괴를 유발할 수 있음.
  • LaTense는 은닉 상태와 추론 벡터의 국소적 기하학적 정렬에 따라 개입 강도를 조절하는 방식임.
  • 코사인 패널티 1 - cos(h, v)와 노름 비례 스케일링 ‖h‖/‖v‖을 적용해 추론 궤적을 안정화하는 복원력으로 작동함.
  • Llama 3.1 8B Instruct, Gemma 2 9B IT, Qwen-2.5-7B-Instruct에서 평가한 결과, 과제 유형에 따른 조정 성능의 한계는 존재하지만 샘플링 기준선보다 토큰 계산량을 4.6배 줄임.