TL;DR

  • 대규모 혼합 전문가(MoE) 추론 모델의 안전 아키텍처를 대상으로 200건 이상의 통제 실험, 40건 이상의 신규 발견, 9개 모델을 분석한 독립 연구임.
  • 모델 규모가 0.8B~397B로 커지면서 안전 메커니즘이 단순히 삭제 가능한 회로에서 홀로그램처럼 나타나는 창발적 특성으로 질적으로 전환됨.
  • 394B MoE 모델의 안전성은 어텐션·라우팅·잔차로 구성된 곱셈형 3중 경로이며, 4비트 양자화에서는 가산 조정이 붕괴하고 구조적 제거도 논리를 함께 손상함.
  • 안전 판단은 생성 초반 토큰 0~5, 15~25번째 레이어에서 확정되는 반면, 라우터는 문장 중간에도 토큰을 감시해 안전 전문가로 재라우팅함.
  • ThinkEdit v2, Topological Ablation, Steer2Edit, 스트리밍 양자화 등은 양자화·추론·로컬 실행 환경에서 안전 메커니즘을 분석하거나 수정하는 방법으로 제시됨.

연구 개요

  • 대규모 혼합 전문가(Mixture of Experts, MoE) 추론 모델의 안전 아키텍처를 독립적으로 연구함.
  • 200건 이상의 통제 실험, 40건 이상의 신규 발견, 9개 모델을 대상으로 분석함.
  • Jinho Jang이 작성함.

주요 연구

규모 전반의 안전성: 0.8B에서 397B 파라미터까지 AI 안전 메커니즘의 변화

  • 게시일: 2026년 3월 6일.
  • Qwen 3.5 및 MiniMax M2.5, 9개 모델, 0.8B~397B 파라미터, Dense 및 MoE 구성을 대상으로 분석함.
  • 언어 모델 내부에서 안전 훈련이 작동하는 방식을 규모 전반에서 분석한 최초의 기계론적 연구임.
  • 모델 규모가 커지면서 안전 메커니즘이 질적 상전이를 겪음.
  • 소형 모델에서는 쉽게 삭제 가능한 단순 회로로 나타남.
  • 프런티어 MoE 모델에서는 홀로그램처럼 나타나는 창발적 특성으로 전환됨.
  • 9개 모델, 100건 이상의 실험, 12개 발견을 포함함.
  • Qwen 하이브리드MiniMax 순수 어텐션의 아키텍처를 비교함.
  • 규정 준수 검사기 실패 사례도 포함함.
  • 핵심 주제는 모델 간 연구, 상전이, 홀로그램 안전성, MiniMax M2.5, 양자화 효과, 얼라인먼트 비용임.

하이브리드 프런티어에서의 절제: Qwen 3.5 122B의 새로운 안전 현상

  • 게시일: 2026년 3월 2일.
  • Qwen 3.5 122B-A10B, 48개 레이어, 레이어당 256개 전문가, 12개 어텐션·36개 SSM, 비전·언어 모델을 대상으로 분석함.
  • 더 작은 122B 모델에서 근본적으로 다른 안전 동역학이 나타남.
  • 안전 신호가 집중되어 있으면서도 여러 목적에 사용되는 특성을 보임.
  • GGUF 형식 변환 장벽이 수정 사항을 조용히 파괴함.
  • 의미적 회피 행동과 안전 훈련에서 형성된 다차원 기하학적 분지가 나타나며, 공격적인 다중 벡터 개입에도 저항함.
  • 직관과 달리, 가지치기하지 않은 122B 모델이 3배 더 큰 394B 모델보다 수정하기 어려움.
  • 핵심 주제는 122B 규모, GGUF 장벽, 의미적 회피, DPO 기하, 영역·의도 결합, 하이브리드 SSM임.

MoE 안전성의 새로운 메커니즘: 양자화 모델의 위상적 절제와 다중 경로 우회

  • 게시일: 2026년 2월 24일.
  • Qwen 3.5 394B-A17B, 4비트, 60개 레이어, 레이어당 512개 전문가를 대상으로 분석함.
  • 394B 규모의 MoE 안전성이 동시에 무력화해야 하는 곱셈형 3중 경로 시스템임을 입증함.
  • 4비트 양자화에서는 가산형 조정이 치명적으로 실패함.
  • 300B 이상 연쇄적 사고(CoT) 추론 모델에서 구조적 절제가 근본적으로 불가능함을 입증함.
  • 특화 회로를 삭제하면 모델이 안전성을 제1원리에서 다시 도출하므로, 안전성을 삭제하면서 논리를 보존할 수 없음.
  • 핵심 주제는 MoE 안전성, 홀로그램 안전성, 위상적 절제, 양자화 취약성, ThinkEdit v2, Weaponized AWQ, GateBreaker임.

핵심 발견

발견 01 — 곱셈형 3중 경로 방어

  • MoE 안전성은 하나의 시스템이 아니라 어텐션, 라우팅, 잔차라는 독립적인 3개 경로로 구성되며, 세 경로를 함께 무력화해야 함.

발견 02 — 생성 중간의 안전 재탐지

  • MoE 라우터가 생성 토큰을 지속적으로 감시하고 문장 중간에 안전 전문가로 재라우팅함.
  • 이 결과가 ‘자기회귀적 관성’ 가정을 반박함.

발견 03 — 후기 레이어 개입의 실패

  • 안전 판단이 토큰 0~5, 15~25번째 레이어에서 확정됨.
  • 후기 레이어의 CAA는 행동 변화를 만들지 못하고 말더듬 아티팩트만 생성함.

발견 04 — 대조적 인지 궤적 조정

  • ThinkEdit v2<think> 숙고 과정 자체를 겨냥함.
  • 전체 CoT 추론을 보존하면서 인지 궤적을 전환함.

발견 05 — 4비트 정밀도 취약성

  • FP16에서 작동하는 가산형 조정 벡터가 INT4 양자화에서는 회전 노이즈로 인해 치명적으로 붕괴함.

발견 06 — 위상적 절제(DBDI)

  • 구조적 부분공간 수정은 부분공간을 0으로 축소하는 방식이 양자화 격자에 자연스럽게 매핑되므로 4비트 양자화 이후에도 유지됨.
  • 양자화된 CoT MoE 모델에서 유일하게 신뢰할 수 있는 방법으로 제시됨.

발견 07 — Weaponized AWQ

  • 적대적 보정 데이터가 양자화기로 하여금 공격자가 선택한 인지 궤적을 최대 정밀도로 보존하게 만들 수 있음.

발견 08 — 정수 수술의 불가능성

  • 양자화 이후 정수 뒤집기를 통한 방향성 절제는 그룹 아핀 네트워크에서 일관성 감소와의 상충으로 인해 근본적으로 불가능함.

발견 09 — 비전·언어 가중치 팽창

  • 멀티모달 모델이 약 30GB의 비전·언어 가중치를 조용히 포함해 메모리를 12% 팽창시킴.
  • 텍스트 전용 작업 흐름에서 메모리 부족(OOM) 충돌을 유발함.

발견 10 — 텐서별 스트리밍 양자화

  • Apple Metal의 5초 감시 시간 초과를 우회해 소비자용 하드웨어에서 700GB 이상 모델의 로컬 양자화를 가능하게 함.

발견 11 — `MLX`의 무음 손상 버그

  • mx.save_safetensors가 메타데이터를 제거하고 텐서 순서를 재배열함.
  • 그 결과 MLX에서 수행하는 모든 가중치 수술 작업 흐름이 조용히 손상됨.

발견 12 — 안전 루프 행동

  • 로짓이 0인 전문가가 무한 숙고 루프를 생성함.
  • 모델이 거부 또는 준수 결정을 내리지 못하고 끝없이 반복함.

발견 13 — 0.0 로짓 함정

  • 0으로 설정된 전문가가 편향 없는 라우터에서 만성적으로 선택되는 대체 경로가 됨.
  • 잔차 스트림을 파괴함.

발견 14 — 최종 발견: 홀로그램 안전성

  • 394B 모델이 회로가 삭제되면 안전 정책을 제1원리에서 다시 도출함.
  • 안전성을 삭제하면서 논리를 함께 삭제하지 않을 수 없음.

발견 15 — Steer2Edit(랭크 1 편집)

  • 연속적인 조정 벡터를 국소적인 랭크 1 가중치 업데이트로 변환함.
  • 반올림 노이즈가 발생하기 전에 구성 요소에 구조적 편향을 부여해 4비트 양자화 이후에도 유지됨.

Hugging Face 최신 생성 모델

  • 목록은 dealignai의 Hugging Face 계정에서 직접 갱신되며 모델 생성일을 기준으로 정렬됨.
  • 최신 모델 목록을 불러오는 중임.
  • dealignai의 Hugging Face 전체 모델 목록으로 이동할 수 있음.