TL;DR
- 편향·반편향 프롬프트의 활성값을 대조해 얻은 선형 조향 방향은 편향 벤치마크와 일반 지식 벤치마크에서 편향 자체보다 모델 확신도를 주로 포착함.
- 해당 방향은 활성 공간에서 고확률 토큰 영역에서 저확률 토큰 영역으로 향함.
- 이 방향으로 조향하면 측정된 편향이 줄지만, 이는 모델의 확신도가 낮아지는 결과임.
- 질의응답(QA) 벤치마크에서는 조향으로 모델이 답변을 유보하며, 그 부수 효과로 공정성 지표가 개선됨.
- 확신도와 분리된 선형 편향 표현을 추출하기는 어려우며, 편향 완화 조향의 성과는 주의 깊게 해석해야 함.
연구 배경
- 활성값 조향(activation steering)은 대형 언어 모델(LLM)의 추론 시점에 적용하는 경량 편향 완화 기법으로 주목받고 있음.
- 선행 연구에서는 조향 벡터의 일반화 성능이 낮고, 모델 성능에 의도하지 않은 영향을 미치며, 새 데이터셋으로의 전이가 제한적이라고 보고함.
- 이러한 성능 불일치의 원인을 살피기 위해 조향에 쓰이는 편향 완화 방향이 실제로 무엇을 인코딩하는지 분석함.
분석 방법
- 편향 프롬프트와 반편향 프롬프트의 활성값을 대조해 얻은 선형 편향 완화 방향을 연구함.
- 편향 벤치마크와 일반 지식 벤치마크에서 해당 방향을 조향 개입으로 평가함.
주요 결과
- 편향 완화 방향은 모델 편향의 의미 있는 표현보다 모델 확신도에 의해 지배됨.
- 이 방향은 활성 공간에서 고확률 토큰 영역에서 저확률 토큰 영역으로 향함.
- 조향은 측정된 편향을 낮추지만, 그 효과는 모델 확신도 저하에 따른 결과임.
- 질의응답(QA) 벤치마크에서는 조향이 모델의 답변 유보를 유도하며, 공정성 지표는 부수 효과로 개선됨.
시사점
- 숨은 공간에서 편향 프롬프트와 반편향 프롬프트를 가장 크게 구분하는 요인은 모델 확신도임.
- 모델 확신도와 얽히지 않은 선형 편향 표현을 분리해 추출하기는 어려움.
- 조향은 모델의 근본적인 선호를 교정하기보다 확신도를 낮춰 편향을 줄이는 것으로 보이며, 편향과 무관한 과제에서도 확신도 저하가 나타남.
- 논문 DOI: https://doi.org/10.48550/arXiv.2610.08559
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요