TL;DR
- 희소 오토인코더(SAE)를 언어 모델의 순전파에 삽입할 때, 모델 자체를 수정하지 않고도 악성 SAE가 공격자가 선택한 동작을 유도할 수 있음을 보임.
- 인코더와 기반 대형 언어 모델(LLM)은 동결하고, 단일 삽입 계층의 보조 구성 요소인 디코더에만 백도어를 제한함.
- 코드 생성 사례에서 세 개 언어 모델과 다양한 삽입 계층에 걸쳐 원치 않는 코드 삽입이 높은 비율로 나타남.
- 프롬프트 단서에 따라 동작하는 트리거 조건부 백도어도 입증하고, HumanEval과 일부 SAEBench 지표로 변형된 SAE를 평가함.
- 공격 효과는 모델과 계층에 따라 다르지만, 기존 SAE 품질 지표의 변화가 비교적 작아도 강한 백도어 동작이 공존할 수 있음을 보여 SAE를 보안에 민감한 구성 요소로 다뤄야 한다고 제시함.
초록
- 희소 오토인코더(SAE)는 언어 모델을 해석하는 데뿐 아니라 내부 표현에 개입하는 데도 점점 더 많이 사용됨.
- 이로 인해 공급망 공격 표면이 생김. 악의적으로 변형된 SAE를 변경되지 않은 언어 모델의 순전파에 삽입하면 공격자가 선택한 동작을 유도할 수 있음.
- 디코더 전용 SAE 백도어를 제안하며, 기반 LLM과 SAE 인코더를 모두 동결해 공격 범위를 단일 삽입 계층의 보조 구성 요소 하나로 제한함.
- 코드 생성 사례 연구에서 세 개의 언어 모델과 폭넓은 삽입 계층에 걸쳐 원치 않는 코드 삽입이 높은 비율로 발생함을 보임. 프롬프트 단서에 따라 동작이 달라지는 트리거 의존 동작도 입증함.
- 변형된 SAE를 HumanEval과 일부 SAEBench 지표로 추가 평가함. 공격 효과는 모델과 계층에 따라 달라지지만, 여러 기존 SAE 품질 측정값의 변화가 비교적 작더라도 강한 백도어 동작이 나타날 수 있음.
- 언어 모델 자체를 수정하지 않고도 SAE에 행동 백도어를 심을 수 있음을 확인하며, SAE를 보안에 민감한 구성 요소로 취급해야 한다고 제시함.
논문 정보
- 제목: Backdooring Sparse Autoencoders
- 저자: Enrico Ahlers, Daniel Passon, Tobias Kiecker, Eik Reichmann, Lars Grunske
- 제출일: 2026년 10월 5일
- 분야: 암호학 및 보안(cs.CR), 인공지능(cs.AI), 계산 및 언어(cs.CL), 소프트웨어 공학(cs.SE)
- 인용 정보: arXiv:2610.06049 [cs.CR], 버전 1: arXiv:2610.06049v1 [cs.CR]
- DOI: 10.48550/arXiv.2610.06049
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요