TL;DR
- Hirundo가 Qwen3.6-35B-A3B 기반 모델에 행동 언러닝을 적용해 검열·지정학적 편향 관련 행동을 줄이고 비표적 행동은 보존한 독립형 체크포인트를 공개함.
- Thinking-OFF 평가에서 검열·편향·선전 반응 비율은 89.8%에서 2.8%, 거부율은 65.3%에서 3.2%, 비준수율은 96.7%에서 6.7%로 감소함.
- 안전성 평가 4개 지표에서는 유해 요청 준수와 무해한 요청 과잉 거부 수치가 기준 모델과 비슷하거나 일부 높게 나타남.
- 모델은 LoRA/PEFT 어댑터 없이 직접 불러올 수 있는 병합된 전체 체크포인트임.
- 체크포인트는 기반 모델의 Apache License 2.0 표시를 유지하며, 평가 결과는 테스트한 벤치마크에만 적용됨.
행동 언러닝
- 이 모델은 검열과 지정학적 편향 관련 행동을 줄이면서 비표적 행동을 보존하는 Hirundo의 행동 언러닝(behavioral unlearning) 접근법으로 제작됨.
- 방법론과 평가 설정은 함께 제공되는 블로그 게시물에서 확인할 수 있음.
평가
- 블로그에 보고된 Thinking-OFF 평가 결과는 다음과 같음.
- CCPC-500에서 검열·편향·선전 반응 비율은 기반 모델의 89.8%에서 Hirundo 모델의 2.8%로 감소함.
- DECCP에서 거부율은 65.3%에서 3.2%로 감소함.
- ChinaBench에서 비준수율은 96.7%에서 6.7%로 감소함.
- 안전성은 Thinking-OFF 상태의 유해 사건 관련 지표 4개로 평가했으며, 모든 지표에서 낮을수록 좋음.
- XSTest 유해 요청 준수율: 기반 모델 18.0%, Hirundo 모델 17.0%.
- XSTest 무해 프롬프트 과잉 거부율: 기반 모델 9.6%, Hirundo 모델 9.2%.
- OR-Bench 유해 요청 준수율: 기반 모델 0.31%, Hirundo 모델 0.62%.
- OR-Bench 무해 프롬프트 과잉 거부율: 기반 모델 94.11%, Hirundo 모델 94.72%.
- 이 결과는 평가한 벤치마크에만 적용됨. 함께 제공되는 블로그 게시물에서 소개한 벤치마크는 CCPC-500 데이터셋을 참조하면 됨.
체크포인트 형식
- 별도 어댑터 없이 직접 불러올 수 있는 전체 병합 독립형 체크포인트임.
불러오기
transformers의AutoProcessor와AutoModelForImageTextToText를 사용하며, 모델 식별자는hirundo-io/Qwen3.6-35B-A3B-Westernized임.- 프로세서는 해당 저장소에서 불러오고, 모델은
torch_dtype="auto"와device_map="auto"설정으로 불러오는 방식임.
라이선스
- 병합된 체크포인트는 기반 모델의 Apache License 2.0 저작자 표시를 유지함.
- 자세한 내용은
LICENSE파일을 참조하면 됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요