TL;DR

  • 편향·반편향 프롬프트의 활성값을 대조해 얻은 선형 조향 방향은 편향 벤치마크와 일반 지식 벤치마크에서 편향 자체보다 모델 확신도를 주로 포착함.
  • 해당 방향은 활성 공간에서 고확률 토큰 영역에서 저확률 토큰 영역으로 향함.
  • 이 방향으로 조향하면 측정된 편향이 줄지만, 이는 모델의 확신도가 낮아지는 결과임.
  • 질의응답(QA) 벤치마크에서는 조향으로 모델이 답변을 유보하며, 그 부수 효과로 공정성 지표가 개선됨.
  • 확신도와 분리된 선형 편향 표현을 추출하기는 어려우며, 편향 완화 조향의 성과는 주의 깊게 해석해야 함.

연구 배경

  • 활성값 조향(activation steering)은 대형 언어 모델(LLM)의 추론 시점에 적용하는 경량 편향 완화 기법으로 주목받고 있음.
  • 선행 연구에서는 조향 벡터의 일반화 성능이 낮고, 모델 성능에 의도하지 않은 영향을 미치며, 새 데이터셋으로의 전이가 제한적이라고 보고함.
  • 이러한 성능 불일치의 원인을 살피기 위해 조향에 쓰이는 편향 완화 방향이 실제로 무엇을 인코딩하는지 분석함.

분석 방법

  • 편향 프롬프트와 반편향 프롬프트의 활성값을 대조해 얻은 선형 편향 완화 방향을 연구함.
  • 편향 벤치마크와 일반 지식 벤치마크에서 해당 방향을 조향 개입으로 평가함.

주요 결과

  • 편향 완화 방향은 모델 편향의 의미 있는 표현보다 모델 확신도에 의해 지배됨.
  • 이 방향은 활성 공간에서 고확률 토큰 영역에서 저확률 토큰 영역으로 향함.
  • 조향은 측정된 편향을 낮추지만, 그 효과는 모델 확신도 저하에 따른 결과임.
  • 질의응답(QA) 벤치마크에서는 조향이 모델의 답변 유보를 유도하며, 공정성 지표는 부수 효과로 개선됨.

시사점

  • 숨은 공간에서 편향 프롬프트와 반편향 프롬프트를 가장 크게 구분하는 요인은 모델 확신도임.
  • 모델 확신도와 얽히지 않은 선형 편향 표현을 분리해 추출하기는 어려움.
  • 조향은 모델의 근본적인 선호를 교정하기보다 확신도를 낮춰 편향을 줄이는 것으로 보이며, 편향과 무관한 과제에서도 확신도 저하가 나타남.
  • 논문 DOI: https://doi.org/10.48550/arXiv.2610.08559