TL;DR
- 상용 API 기반 블랙박스 대형 언어 모델(LLM)에 출력만 접근할 수 있는 조건에서 비밀정보를 추출하는 프레임워크를 제시하고, 실제 배포된 시스템에서도 마스킹된 자격 증명 복구를 확인함.
- 프롬프트 변형, 응답 교차 검증, 제공업체별 형식 필터링을 활용하는 교차 검증 비밀 지식 증류로 로컬 화이트박스 프록시를 구축함.
- 프록시 기반 추출·후보 필터링에 절단된 top-p 샘플링, 로컬 토큰 엔트로피, N-그램 빈도 프로파일링, 제공업체별 구조적 사전 정보를 결합함.
- 통제된 API 키 벤치마크에서 대표 기준선보다 복구 효과와 실제 키 비율을 높이고 추출 지연 시간을 줄임.
- 책임 있는 실제 환경 평가에서 OpenAI와 Claude Code를 아우르는 독립 배포 블랙박스 LLM 세 시스템으로부터 제공업체별 마스킹 자격 증명을 복구함.
연구 배경과 문제
- Codex와 Claude Code 같은 자율 코딩 에이전트가 LLM을 활용하는 사례가 늘고 있지만, 학습 데이터에 공개 저장소에 노출된 자격 증명이나 비공개 개발 자료에서 수집된 자격 증명이 포함될 수 있어 암기와 후속 유출 위험이 발생함.
- 기존 추출 감사는 대체로 모델 가중치나 토큰 확률에 접근할 수 있다고 가정하지만, 상용 API 기반 모델은 출력만 관찰할 수 있는 경우가 많음.
블랙박스 비밀정보 추출 프레임워크
- 교차 검증 비밀 지식 증류(Cross-Validated Secret Knowledge Distillation)는 의미를 보존하는 프롬프트 변형, 응답 교차 검증, 제공업체별 형식 필터링을 활용해 비밀정보와 관련된 모델 행동을 로컬 화이트박스 프록시에 증류함.
- 프록시 기반 비밀정보 추출 및 후보 필터링(Proxy-Guided Secret Extraction and Candidate Filtering)은 절단된 top-p 샘플링과 로컬 토큰 엔트로피, N-그램 빈도 프로파일링, 제공업체별 구조적 사전 정보를 결합함.
평가 결과
- 통제된 API 키 벤치마크에서 프레임워크는 대표 기준선보다 복구 효과와 실제 키 비율을 높이고 추출 지연 시간을 줄임.
- 책임 있는 실제 환경 평가에서는 OpenAI와 Claude Code를 아우르는 독립 배포 블랙박스 LLM 세 시스템에서 제공업체별 마스킹 자격 증명을 복구함.
- 결과는 출력만 접근할 수 있는 조건에서도 암기된 비밀정보가 노출될 수 있음을 보여줌.
논문 정보
- 논문 제목: *Practical Secrets Extraction against Black-box LLMs*
- 저자: Shiqian Zhao, Siwei Jiang, Xinfeng Li, Runyi Hu, Yandan Zheng, Congyu Guo, Tianwei Zhang, Anh Tuan Luu.
- 분류: 암호학 및 보안(cs.CR), arXiv:2609.36941.
- DOI: 10.48550/arXiv.2609.36941
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요