TL;DR

  • Hirundo가 Qwen3.6-35B-A3B 기반 모델에 행동 언러닝을 적용해 검열·지정학적 편향 관련 행동을 줄이고 비표적 행동은 보존한 독립형 체크포인트를 공개함.
  • Thinking-OFF 평가에서 검열·편향·선전 반응 비율은 89.8%에서 2.8%, 거부율은 65.3%에서 3.2%, 비준수율은 96.7%에서 6.7%로 감소함.
  • 안전성 평가 4개 지표에서는 유해 요청 준수와 무해한 요청 과잉 거부 수치가 기준 모델과 비슷하거나 일부 높게 나타남.
  • 모델은 LoRA/PEFT 어댑터 없이 직접 불러올 수 있는 병합된 전체 체크포인트임.
  • 체크포인트는 기반 모델의 Apache License 2.0 표시를 유지하며, 평가 결과는 테스트한 벤치마크에만 적용됨.

행동 언러닝

  • 이 모델은 검열과 지정학적 편향 관련 행동을 줄이면서 비표적 행동을 보존하는 Hirundo의 행동 언러닝(behavioral unlearning) 접근법으로 제작됨.
  • 방법론과 평가 설정은 함께 제공되는 블로그 게시물에서 확인할 수 있음.

평가

  • 블로그에 보고된 Thinking-OFF 평가 결과는 다음과 같음.
  • CCPC-500에서 검열·편향·선전 반응 비율은 기반 모델의 89.8%에서 Hirundo 모델의 2.8%로 감소함.
  • DECCP에서 거부율은 65.3%에서 3.2%로 감소함.
  • ChinaBench에서 비준수율은 96.7%에서 6.7%로 감소함.
  • 안전성은 Thinking-OFF 상태의 유해 사건 관련 지표 4개로 평가했으며, 모든 지표에서 낮을수록 좋음.
  • XSTest 유해 요청 준수율: 기반 모델 18.0%, Hirundo 모델 17.0%.
  • XSTest 무해 프롬프트 과잉 거부율: 기반 모델 9.6%, Hirundo 모델 9.2%.
  • OR-Bench 유해 요청 준수율: 기반 모델 0.31%, Hirundo 모델 0.62%.
  • OR-Bench 무해 프롬프트 과잉 거부율: 기반 모델 94.11%, Hirundo 모델 94.72%.
  • 이 결과는 평가한 벤치마크에만 적용됨. 함께 제공되는 블로그 게시물에서 소개한 벤치마크는 CCPC-500 데이터셋을 참조하면 됨.

체크포인트 형식

  • 별도 어댑터 없이 직접 불러올 수 있는 전체 병합 독립형 체크포인트임.

불러오기

  • transformers의 AutoProcessor와 AutoModelForImageTextToText를 사용하며, 모델 식별자는 hirundo-io/Qwen3.6-35B-A3B-Westernized임.
  • 프로세서는 해당 저장소에서 불러오고, 모델은 torch_dtype="auto"와 device_map="auto" 설정으로 불러오는 방식임.

라이선스

  • 병합된 체크포인트는 기반 모델의 Apache License 2.0 저작자 표시를 유지함.
  • 자세한 내용은 LICENSE 파일을 참조하면 됨.