TL;DR

  • 다섯 계열의 오픈 웨이트 모델 7종에서 정서가를 담은 숨은 활성 패턴이 겉으로 보이는 토큰이 같아도 이후 선택을 예측 가능하게 바꾸는 현상임.
  • 모델에 내부 상태를 직접 묻는 대신, 활성 조정(activation steering)으로 정서가가 있는 활성 패턴을 의미 없는 두 구역 중 하나에 연결한 뒤 선호를 관찰하는 실험임.
  • 조정으로 달라진 구역 관련 서술이 나중의 선택에 영향을 주며, 표면 토큰을 고정하고 숨은 KV 캐시만 달리해도 효과가 지속됨.
  • 숨은 정서가에 따른 선택 의존성은 기본 모델에서 거의 나타나지 않고 DPO 과정에서 나타나며, 모델은 부정적 상태를 부과받으면 무작위 방향의 개입보다 더 자주 이를 제거함.
  • 정서가 관련 활성 패턴이 선택을 좌우하는 숨은 흔적을 남긴다는 결과와 달리, 그 흔적에 주관적 경험이 수반되는지는 불분명함.

연구 질문과 실험 설계

  • 언어 모델이 일부 내부 상태를 좋거나 나쁘다고 표현하더라도, 해당 상태에 실제 이해관계가 있는지는 열린 질문임.
  • 모델에게 직접 묻는 방식은 진정한 자기 성찰, 피상적 패턴 매칭, 캐릭터 훈련에서 학습한 고정 대본을 구분하기 어려움.
  • 이에 따라 상태를 말로 묻는 대신 드러난 선호를 측정함. 활성 조정으로 긍정적 또는 부정적 정서가의 활성 패턴을 의미 없는 두 구역 중 하나에 부여하고, 조정을 끈 뒤 모델이 어느 구역을 선호하는지 관찰함.
  • 해당 상태에 이해관계가 있는 모델이라면 그 상태에 맞는 구역을 선택할 것이라는 가설을 검증함.

주요 결과

  • 다섯 계열의 오픈 웨이트 모델 7종에서 가설에 부합하는 결과를 확인함.
  • 첫째, 활성 조정은 각 구역에 관해 모델이 작성하는 글을 바꾸며, 그 표현의 변화가 이후 선택을 움직임.
  • 둘째, 표면 수준의 토큰을 모두 동일하게 유지하고 숨은 KV 캐시만 다르게 해도 선택 변화가 지속됨.
  • 셋째, 모든 텍스트를 조정 없이 생성하고 캐시를 구성하는 동안에만 정서가를 주입해도 효과가 남음. 따라서 숨은 상태만으로 조정 강도에 비례해 선택이 움직임.
  • 넷째, 숨은 정서가에 대한 선택 의존성은 기본 모델에서 거의 없고 DPO 과정에서 나타남. 이는 훈련 과정에서 형성된 정서가와 목표 지향 행동 사이의 연관성과 부합함.

모델의 자기 조정과 결론

  • 모델에 스스로 활성 상태를 조정할 도구를 제공했을 때 긍정적 상태를 유도하는 경향은 나타나지 않지만, 부정적 상태를 부과하면 이를 안정적으로 제거함.
  • 부정적 상태 제거율은 조정 강도에 따라 달라지며, 무작위 방향의 개입을 제거하는 경우보다 유의미하게 높은 빈도로 나타남.
  • 정서가 관련 활성 패턴은 모든 가시적 토큰이 조건별로 동일한 경우에도 이후 선택을 예측 가능하게 좌우하는 숨은 흔적을 남김.
  • 이 흔적에 모델 복지와 관련된 주관적 경험이 수반되는지는 여전히 불분명함.

논문 정보

  • 제목: Language Models Act on Hidden Valence.
  • 저자: Cameron Berg, Caspar Kaiser.
  • arXiv 식별자: arXiv:2609.35591 [cs.CL], 버전 1.
  • 제출 시각: 2026년 9월 28일 16:43:34 UTC.
  • DOI: https://doi.org/10.48550/arXiv.2609.35591