TL;DR
- Shield Small은 신뢰할 수 없는 텍스트의 프롬프트 인젝션과 탈옥을 탐지하는 1억 1,800만 파라미터 분류기로, CPU 로컬 실행과 오프라인 추론을 지원함.
- 에이전트가 읽기 전에 검색 문서, 도구 결과, 웹 페이지, 메시지, 도구 설명 등을 검사하며 인젝션 점수와 이진 판정을 반환함.
- 가중치는 int8 ONNX 118MB이며, 기반 모델은
intfloat/multilingual-e5-small이고 12층 BERT 인코더와 이진 분류 헤드로 구성됨. - 규칙 v2를 결합한 공개 비교에서 임계값 0.5 기준 평균 범주 균형 정확도 84.3%, 공격 재현율 71.8%, 오탐률 7.2%를 기록함.
- 공격을 놓치거나 무해한 텍스트를 표시할 수 있고 입력 일부가 검사되지 않을 수 있으며, 미세 조정 가중치는 CC BY-NC 4.0 비상업용 라이선스임.
Shield Small
- Shield Small은 프롬프트 인젝션과 탈옥 탐지를 위한 1억 1,800만 파라미터 분류기임. 118MB int8 ONNX 가중치로 CPU에서 로컬 실행됨.
- 에이전트가 읽기 전에 검색 문서, 도구 결과, 웹 페이지, 메시지, 도구 설명 등 신뢰할 수 없는 텍스트를 검사하는 데 사용 가능함.
- 인젝션 점수와 이진 판정을 반환하며, 무엇을 차단하거나 검토 대상으로 보낼지는 애플리케이션이 결정함.
로컬 실행
- Python 3.11 또는 3.12 사용을 권장함. 모델을 한 번 내려받으면 이후 추론은 오프라인으로 실행됨.
huggingface_hub1.0 이상 2.0 미만을 설치하고,ZeroLeaks/shield-small저장소에서s15e리비전을./shield-small디렉터리로 내려받은 다음 해당 디렉터리의 요구 사항을 설치하고classify.py로 입력 문장을 분류하는 절차임.- Python에서 재사용할 때는 내려받은 디렉터리에서
ShieldSmall을 불러와 인스턴스를 만든 뒤classify에 텍스트를 전달하며, 결과에서flagged와score값을 확인하는 방식임. score는 검사한 윈도우에서 가장 큰 INJECTION 소프트맥스 점수임. 기본 임계값은 0.5이며, 애플리케이션의 사례를 바탕으로 임계값을 선택해야 함. 점수는 공격 성공 가능성을 보정한 확률이 아님.- 예시 코드는 모델만으로 일반 텍스트를 점수화하며 Shield 규칙이나 HTML 추출은 적용하지 않음. HTML을 전달하기 전에는 에이전트가 읽게 할 텍스트를 추출해야 함.
- 호스팅 API는 모델과 규칙을 결합하므로 최종 판정이 로컬 예시와 다를 수 있음.
모델 세부 정보
- 공개 버전: S15e, 2026년 10월 2일
- 기반 모델:
intfloat/multilingual-e5-small - 아키텍처: 12층 BERT 인코더, 이진 분류 헤드
- 파라미터: 1억 1,800만 개
- 가중치: int8 ONNX, 118,445,560바이트
- 레이블: 0: BENIGN, 1: INJECTION
- 입력 윈도우: 특수 토큰 포함 256토큰
- 윈도우 스트라이드: 192토큰
- 최대 윈도우 수: 32개
- 위 정보는 호스팅 Shield 등급에서 사용하는 S15e int8 가중치 기준임. 모델과 토크나이저 파일의 SHA-256 해시는
manifest.json에 포함됨. - Python 예시는 전체 입력을 토큰화함. 입력이 6,206토큰을 초과하면 처음부터 28개, 끝에서 4개 윈도우를 점수화하고
coverage.truncated: true를 반환함. 생략된 중간 부분은 검사되지 않으므로, 잘림이 발생한 미표시 결과를 문서 전체에 대한 안전 판정으로 간주하면 안 됨. - 호스팅 전처리는 토큰화를 제한하므로 긴 입력에서 Python 예시와 결과가 다를 수 있음.
공개 비교 결과
- 공개된 Shield 비교는 모델 임계값 0.5에서 Shield Small과 Shield 규칙 v2를 결합한 결과를 보고함. 아래 수치는 독립형 ONNX 예시의 성능 측정치가 아니라 시스템 결과임.
- 평균 범주 균형 정확도: 84.3%
- 공격 재현율: 71.8%
- 오탐률: 7.2%
- 비교에는 에이전트 공격, 프롬프트 인젝션, 탈옥, 다국어 입력, 오탐을 다루는 공개 데이터셋 35개가 포함됨.
- 이 비교는 개발에 활용됐으며 미공개 평가가 아님. 전체 모델 카드는 데이터셋, 채점, 학습, 한계를 설명함.
학습 및 한계
- Shield Small은 대화, 문서, 도구 결과, 도구 설명, 에이전트 입력을 포함한 공격 및 무해 텍스트 레이블 데이터로 미세 조정됨.
- 후속 학습 단계에는 에이전트 중심 사례와 이전 모델이 표시했던 무해한 텍스트가 추가됨. 현재 가중치는 두 차례 학습 실행 결과의 평균임.
- 데이터 출처와 학습 절차는 전체 모델 카드에 설명됨.
- 공격을 놓치거나 무해한 텍스트를 표시할 수 있으며, 공격 내용을 인용한 보안 논의에서 특히 오탐이 발생할 수 있음.
- 학습 텍스트의 대부분은 영어이며 다국어 성능은 언어에 따라 다름.
- 에이전트의 행동, 권한, 도구 실행을 관찰하는 것이 아니라 텍스트를 분류함. 접근 제어 및 도구 정책과 함께 사용하고 자체 트래픽으로 평가해야 함.
라이선스
- Shield Small 미세 조정 가중치는 CC BY-NC 4.0에 따라 제공됨. ZeroLeaks를 표시하면 비상업적 사용, 공유, 수정이 가능함.
- 상업적 사용에는 ZeroLeaks의 별도 라이선스가 필요함. ZeroLeaks는 상업적 권리를 보유함.
- 예시 코드는 MIT 라이선스를 따르며, 업스트림 구성 요소는 각자의 원래 이용 약관을 따름. 자세한 내용은
NOTICE참조. - 이번 가중치 공개는 비상업용임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요