TL;DR
- 적대적 접미사를 생성하는 AmpleGCG가 유해 질의마다 수백 개의 접미사를 빠르게 생성하고, 오픈·클로즈드 대규모 언어 모델(LLM)에 전이 가능한 탈옥 공격을 구현함.
- 기존 GCG 최적화에서 손실이 가장 낮은 접미사 하나만 선택하면 중간 단계에서 발견된 다른 성공 접미사를 놓치는 한계가 있음.
- 중간 단계에서 찾은 성공 접미사들을 학습 데이터로 활용해 적대적 접미사의 분포를 학습하는 생성 모델을 구축함.
- Llama-2-7B-chat과 Vicuna-7B에서 공격 성공률(ASR)이 거의 100%에 이르고, 최신 GPT-3.5에서도 99%를 기록함.
- 유해 질의 하나에 대해 적대적 접미사 200개를 4초 만에 생성해 방어를 더 어렵게 함.
배경과 기존 GCG의 한계
- 대규모 언어 모델(LLM)이 널리 보급되고 자율 시스템에 통합됨에 따라 안전성 확보가 중요해짐.
- 안전 정렬이 크게 진전됐지만, 기존 연구 GCG는 이산 토큰 최적화 알고리즘을 사용해 정렬된 LLM을 탈옥시키는 손실이 가장 낮은 접미사 하나를 선택함.
- GCG 최적화 과정에서 손실이 가장 낮은 접미사만 고르는 방식의 한계를 논의하고, 중간 단계에서 발견됐지만 선택되지 않은 성공 접미사들을 확인함.
AmpleGCG 학습과 생성
- 중간 단계에서 발견한 성공 접미사들을 학습 데이터로 활용해 AmpleGCG라는 생성 모델을 학습함.
- AmpleGCG는 유해 질의가 주어졌을 때 나타나는 적대적 접미사의 분포를 포착하고, 임의의 유해 질의에 대해 수초 안에 수백 개의 접미사를 생성함.
- 정렬된 Llama-2-7B-chat과 Vicuna-7B에서 거의 100%의 공격 성공률(ASR)을 달성해 가장 강력한 두 공격 기준선보다 높은 성능을 보임.
오픈·클로즈드 모델 간 전이와 공격 성능
- AmpleGCG는 다른 모델로도 원활하게 전이되며, 클로즈드 소스 LLM을 대상으로 한 공격도 수행함.
- 최신 GPT-3.5에서 99%의 공격 성공률(ASR)을 달성함.
- 적대적 접미사 생성 모델을 학습해 GCG의 영향을 확대하고, 오픈 소스 LLM 공격에서 클로즈드 소스 LLM 공격으로 전이 가능한 방식을 제시함.
- 유해 질의 하나에 적대적 접미사 200개를 4초 만에 생성해 방어를 더 어렵게 함.
논문 정보
- 논문 제목: *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*
- 저자: Zeyi Liao, Huan Sun.
- arXiv 식별자: 2404.07921, 컴퓨터 언어학(cs.CL).
- 제출일: 2024년 4월 11일; 현재 버전(v3) 최종 수정일: 2024년 11월 24일.
- DOI: https://doi.org/10.48550/arXiv.2404.07921
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요