TL;DR
- 대규모 혼합 전문가(MoE) 추론 모델의 안전 아키텍처를 대상으로 200건 이상의 통제 실험, 40건 이상의 신규 발견, 9개 모델을 분석한 독립 연구임.
- 모델 규모가 0.8B~397B로 커지면서 안전 메커니즘이 단순히 삭제 가능한 회로에서 홀로그램처럼 나타나는 창발적 특성으로 질적으로 전환됨.
- 394B MoE 모델의 안전성은 어텐션·라우팅·잔차로 구성된 곱셈형 3중 경로이며, 4비트 양자화에서는 가산 조정이 붕괴하고 구조적 제거도 논리를 함께 손상함.
- 안전 판단은 생성 초반 토큰 0~5, 15~25번째 레이어에서 확정되는 반면, 라우터는 문장 중간에도 토큰을 감시해 안전 전문가로 재라우팅함.
ThinkEdit v2, Topological Ablation, Steer2Edit, 스트리밍 양자화 등은 양자화·추론·로컬 실행 환경에서 안전 메커니즘을 분석하거나 수정하는 방법으로 제시됨.
연구 개요
- 대규모 혼합 전문가(Mixture of Experts, MoE) 추론 모델의 안전 아키텍처를 독립적으로 연구함.
- 200건 이상의 통제 실험, 40건 이상의 신규 발견, 9개 모델을 대상으로 분석함.
- Jinho Jang이 작성함.
주요 연구
규모 전반의 안전성: 0.8B에서 397B 파라미터까지 AI 안전 메커니즘의 변화
- 게시일: 2026년 3월 6일.
- Qwen 3.5 및 MiniMax M2.5, 9개 모델, 0.8B~397B 파라미터, Dense 및 MoE 구성을 대상으로 분석함.
- 언어 모델 내부에서 안전 훈련이 작동하는 방식을 규모 전반에서 분석한 최초의 기계론적 연구임.
- 모델 규모가 커지면서 안전 메커니즘이 질적 상전이를 겪음.
- 소형 모델에서는 쉽게 삭제 가능한 단순 회로로 나타남.
- 프런티어 MoE 모델에서는 홀로그램처럼 나타나는 창발적 특성으로 전환됨.
- 9개 모델, 100건 이상의 실험, 12개 발견을 포함함.
- Qwen 하이브리드와 MiniMax 순수 어텐션의 아키텍처를 비교함.
- 규정 준수 검사기 실패 사례도 포함함.
- 핵심 주제는 모델 간 연구, 상전이, 홀로그램 안전성, MiniMax M2.5, 양자화 효과, 얼라인먼트 비용임.
하이브리드 프런티어에서의 절제: Qwen 3.5 122B의 새로운 안전 현상
- 게시일: 2026년 3월 2일.
- Qwen 3.5 122B-A10B, 48개 레이어, 레이어당 256개 전문가, 12개 어텐션·36개 SSM, 비전·언어 모델을 대상으로 분석함.
- 더 작은 122B 모델에서 근본적으로 다른 안전 동역학이 나타남.
- 안전 신호가 집중되어 있으면서도 여러 목적에 사용되는 특성을 보임.
- GGUF 형식 변환 장벽이 수정 사항을 조용히 파괴함.
- 의미적 회피 행동과 안전 훈련에서 형성된 다차원 기하학적 분지가 나타나며, 공격적인 다중 벡터 개입에도 저항함.
- 직관과 달리, 가지치기하지 않은 122B 모델이 3배 더 큰 394B 모델보다 수정하기 어려움.
- 핵심 주제는 122B 규모, GGUF 장벽, 의미적 회피, DPO 기하, 영역·의도 결합, 하이브리드 SSM임.
MoE 안전성의 새로운 메커니즘: 양자화 모델의 위상적 절제와 다중 경로 우회
- 게시일: 2026년 2월 24일.
- Qwen 3.5 394B-A17B, 4비트, 60개 레이어, 레이어당 512개 전문가를 대상으로 분석함.
- 394B 규모의 MoE 안전성이 동시에 무력화해야 하는 곱셈형 3중 경로 시스템임을 입증함.
- 4비트 양자화에서는 가산형 조정이 치명적으로 실패함.
- 300B 이상 연쇄적 사고(CoT) 추론 모델에서 구조적 절제가 근본적으로 불가능함을 입증함.
- 특화 회로를 삭제하면 모델이 안전성을 제1원리에서 다시 도출하므로, 안전성을 삭제하면서 논리를 보존할 수 없음.
- 핵심 주제는 MoE 안전성, 홀로그램 안전성, 위상적 절제, 양자화 취약성,
ThinkEdit v2, Weaponized AWQ, GateBreaker임.
핵심 발견
발견 01 — 곱셈형 3중 경로 방어
- MoE 안전성은 하나의 시스템이 아니라 어텐션, 라우팅, 잔차라는 독립적인 3개 경로로 구성되며, 세 경로를 함께 무력화해야 함.
발견 02 — 생성 중간의 안전 재탐지
- MoE 라우터가 생성 토큰을 지속적으로 감시하고 문장 중간에 안전 전문가로 재라우팅함.
- 이 결과가 ‘자기회귀적 관성’ 가정을 반박함.
발견 03 — 후기 레이어 개입의 실패
- 안전 판단이 토큰 0~5, 15~25번째 레이어에서 확정됨.
- 후기 레이어의 CAA는 행동 변화를 만들지 못하고 말더듬 아티팩트만 생성함.
발견 04 — 대조적 인지 궤적 조정
ThinkEdit v2가<think>숙고 과정 자체를 겨냥함.- 전체 CoT 추론을 보존하면서 인지 궤적을 전환함.
발견 05 — 4비트 정밀도 취약성
- FP16에서 작동하는 가산형 조정 벡터가 INT4 양자화에서는 회전 노이즈로 인해 치명적으로 붕괴함.
발견 06 — 위상적 절제(DBDI)
- 구조적 부분공간 수정은 부분공간을 0으로 축소하는 방식이 양자화 격자에 자연스럽게 매핑되므로 4비트 양자화 이후에도 유지됨.
- 양자화된 CoT MoE 모델에서 유일하게 신뢰할 수 있는 방법으로 제시됨.
발견 07 — Weaponized AWQ
- 적대적 보정 데이터가 양자화기로 하여금 공격자가 선택한 인지 궤적을 최대 정밀도로 보존하게 만들 수 있음.
발견 08 — 정수 수술의 불가능성
- 양자화 이후 정수 뒤집기를 통한 방향성 절제는 그룹 아핀 네트워크에서 일관성 감소와의 상충으로 인해 근본적으로 불가능함.
발견 09 — 비전·언어 가중치 팽창
- 멀티모달 모델이 약 30GB의 비전·언어 가중치를 조용히 포함해 메모리를 12% 팽창시킴.
- 텍스트 전용 작업 흐름에서 메모리 부족(OOM) 충돌을 유발함.
발견 10 — 텐서별 스트리밍 양자화
- Apple Metal의 5초 감시 시간 초과를 우회해 소비자용 하드웨어에서 700GB 이상 모델의 로컬 양자화를 가능하게 함.
발견 11 — `MLX`의 무음 손상 버그
mx.save_safetensors가 메타데이터를 제거하고 텐서 순서를 재배열함.- 그 결과
MLX에서 수행하는 모든 가중치 수술 작업 흐름이 조용히 손상됨.
발견 12 — 안전 루프 행동
- 로짓이 0인 전문가가 무한 숙고 루프를 생성함.
- 모델이 거부 또는 준수 결정을 내리지 못하고 끝없이 반복함.
발견 13 — 0.0 로짓 함정
- 0으로 설정된 전문가가 편향 없는 라우터에서 만성적으로 선택되는 대체 경로가 됨.
- 잔차 스트림을 파괴함.
발견 14 — 최종 발견: 홀로그램 안전성
- 394B 모델이 회로가 삭제되면 안전 정책을 제1원리에서 다시 도출함.
- 안전성을 삭제하면서 논리를 함께 삭제하지 않을 수 없음.
발견 15 — Steer2Edit(랭크 1 편집)
- 연속적인 조정 벡터를 국소적인 랭크 1 가중치 업데이트로 변환함.
- 반올림 노이즈가 발생하기 전에 구성 요소에 구조적 편향을 부여해 4비트 양자화 이후에도 유지됨.
Hugging Face 최신 생성 모델
- 목록은
dealignai의 Hugging Face 계정에서 직접 갱신되며 모델 생성일을 기준으로 정렬됨. - 최신 모델 목록을 불러오는 중임.
dealignai의 Hugging Face 전체 모델 목록으로 이동할 수 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요