TL;DR

  • 폐쇄형 대형 언어 모델의 추론 능력을 모방하는 증류 공격은 공격자가 증류 후 강화학습(RL)을 추가로 수행하는 경우, 증류 직후에는 효과적으로 보이는 방어도 무력화할 수 있음.
  • 기존 방어 평가가 증류 이후 추가 학습이 없다고 가정해 실제 위협 수준을 낮게 잡을 수 있음.
  • 현재 API에서 쉽게 얻을 수 있는 데이터로 수행한 단순 공격도 정교한 숨겨진 추론 추적 추출 공격과 동등한 추론 능력 향상을 이끌어냄.
  • 근사 추론 추적을 재구성할 만큼 정보를 노출하는 증류 방어는 효과가 없을 가능성이 높음.
  • 배치 수준 증류 방어가 더 효과적일 수 있으며, 논문은 그 가능성과 더 넓은 시사점을 논의함.

연구 배경

  • 증류 공격은 폐쇄형 대형 언어 모델의 추론 능력을 복제해, 악의적 행위자가 낮은 비용으로 최첨단 성능을 재현하도록 함.
  • 공격자는 최첨단 모델의 추론 추적을 대량으로 체계적으로 수집한 뒤, 해당 데이터로 자체 모델을 학습하는 방식으로 증류함.
  • 기존 증류 공격 방어는 대개 증류 직후에 평가되며, 공격자가 이후 모델을 추가로 학습하지 않는다고 암묵적으로 가정함.

강화학습을 포함한 위협 모델

  • 더 현실적인 위협 모델은 증류 후 강화학습으로 모델을 추가 학습하는 상황을 포함함.
  • 위협 모델을 잘못 설정하면 거짓된 안전감을 줄 수 있으며, 증류 직후 효과적으로 보이는 일부 방어는 이후 강화학습을 거치면 무력화될 수 있음.
  • 강화학습은 증류 공격이 효과를 내는 데 필요한 문턱을 낮춤.

공격 결과와 방어 시사점

  • 현재 API에서 쉽게 얻을 수 있는 데이터만 사용하는 단순 공격으로도 기존 폐쇄형 언어 모델의 추론 능력을 탈취할 수 있음.
  • 이 공격으로 얻는 추론 능력 향상은 숨겨진 추론 추적 전체를 추출하는 더 정교한 공격과 동등함.
  • 근사 추론 추적을 재구성할 만큼 충분한 정보를 유출하는 증류 방어는 효과가 없을 가능성이 높음.
  • 논문은 더 넓은 시사점을 논의하고, 더 효과적일 수 있는 배치 수준 증류 방어를 다룸.

논문 정보

  • 제목: *Distillation Defenses Easily Break After Reinforcement Learning*
  • 저자: Shidan Javaheri, Alexander Panfilov, Oliver Britton, Yarin Gal, Yonatan Gideoni
  • 제출일: 2026년 9월 28일
  • 분야: 기계학습(cs.LG), 인공지능(cs.AI), 암호학 및 보안(cs.CR)
  • DOI: https://doi.org/10.48550/arXiv.2609.35699