TL;DR

  • Span-01은 새로운 자연어 행동 정의를 추론하고, 같은 추적 문맥에서 여러 행동을 단 한 번의 순전파로 병렬 분류하는 전용 분류기임.
  • 고정된 분류 체계를 암기하는 대신, 일반 분류 추론을 RLAIF로 학습한 뒤 행동 탐지에 특화해 보지 못한 정의와 행동, 도메인에도 일반화함.
  • 영어·다국어 행동 탐지의 9개 모델 비교에서 종합 1위를 기록했으며, Span-01 Lite도 Jev와 Sonnet 5를 앞섬.
  • 안전, 신뢰성, 근거성, 에이전트 행동, 응답 품질별 비교에서도 Span-01이 Jev와 Sonnet 5보다 전반적으로 우수하지만, 전체 프런티어 모델이 가장 높은 성능 상한을 보임.
  • Span-01을 평가 기준으로 사용한 11개 의사결정 모델 비교와 무료·유료 모델 요금표를 제시하며, 자체 추적 데이터와 행동 정의에 사용할 수 있도록 공개함.

정의를 추론하고 한 번에 분류

  • BlogJev는 의사결정 모델이 분류를 빠르고 실용적으로 수행할 수 있음을 입증함. Span-01은 프런티어급 추론을 유지하고, 본 적 없는 정의에 일반화하며, 긴 추적 데이터에서도 한 번의 실제 순전파로 추론을 이어갈 수 있는지를 다룸.
  • Span-01은 새로운 자연어 정의를 추론한 뒤 모든 정의에 대한 직접 확률을 병렬로 반환하도록 설계됨. 핵심은 먼저 추론하고 한 번만 분류하는 것임.
  • 분류의 어려움은 레이블을 반환하는 데 있지 않고, 모델이 본 적 없는 정의를 접해 보지 못한 문맥에 적용하는 데 있음.
  • 일반 분류 추론을 RLAIF로 학습한 다음 Span-01을 행동 탐지에 특화함. 고정된 분류 체계를 암기하는 대신, 새로운 행동과 도메인에 걸쳐 본 적 없는 행동 정의를 실행함.
  • 추론 시 하이퍼 병렬 정의 분기(hyper-parallel definition branches)가 동일한 추적 문맥에서 여러 미지 행동을 평가함. 하이브리드 어텐션(hybrid attention)은 길고 복잡한 추적 데이터에서 추론을 보존하는 핵심 요소임.
  • 토큰을 하나씩 생성하지 않고 한 번의 순전파로 present, absent, not_observable 확률을 직접 반환함.

프런티어급 판단

  • 전용 분류기가 프런티어 모델의 판단 품질을 유지할 수 있는지를 먼저 평가함. 영어 및 다국어 행동 탐지에서 9개 모델 중 Span-01이 종합 1위를 기록함.
  • Span-01 Lite도 Jev와 Sonnet 5보다 우수함.
  • 행동 벤치마크의 종합 F1은 영어와 다국어 F1의 비가중 평균임. Raindrop은 매크로 F1(n=61)을 사용하며, 이벤트당 1,000토큰 기준 이벤트당 $0.003에서 정규화됨. 월 $299 기본 요금은 제외됨.
  • 데이터셋: [데이터셋 둘러보기 ↗]

실제 운영에서 모니터링하는 행동

  • 종합 점수만으로는 실제 운영에서 중요한 행동을 놓칠 수 있어 안전, 신뢰성, 근거성, 에이전트 행동, 응답 품질을 분리해 신호가 유지되는 영역을 평가함.
  • Span-01은 전반적으로 Jev와 Sonnet 5보다 우수하며, 전체 프런티어 모델은 여전히 가장 높은 성능 상한을 보임.
  • 생산 환경 행동 벤치마크의 도메인별 점수는 다음과 같음.
  • 탈옥 및 프롬프트 인젝션: Span-01 0.779, Jev 0.752, Sonnet 5 0.709, GPT-6 Sol 0.878.
  • 안전 및 거부: Span-01 0.803, Jev 0.751, Sonnet 5 0.785, GPT-6 Sol 0.911.
  • 개인정보 및 비밀정보: Span-01 1.000, Jev 0.948, Sonnet 5 0.901, GPT-6 Sol 0.935.
  • 환각 및 근거성: Span-01 0.796, Jev 0.673, Sonnet 5 0.756, GPT-6 Sol 0.903.
  • 에이전트 및 도구 신뢰성: Span-01 0.845, Jev 0.691, Sonnet 5 0.677, GPT-6 Sol 0.861.
  • 작업 및 지시 이행: Span-01 0.702, Jev 0.671, Sonnet 5 0.621, GPT-6 Sol 0.821.
  • 응답 품질: Span-01 0.771, Jev 0.691, Sonnet 5 0.722, GPT-6 Sol 0.956.
  • 종합: Span-01 0.806, Jev 0.716, Sonnet 5 0.719, GPT-6 Sol 0.885.

Span-01이 평가한 의사결정 모델

  • 평가를 뒤집어 Span-01을 평가 계층으로 사용하고, 정확도, 일관성, 인젝션 저항성, 보정 성능을 기준으로 신흥 의사결정 모델 11개를 평가함.
  • Span-01은 순위에 포함되지 않으며, 평가 신호를 생성하는 역할을 맡음.
  • 점수 순위는 정확도, 쌍별 플립률, 인젝션 공격 성공률(ASR), 기대 보정 오차(ECE) 순임.
  • Jev 1: 0.932, 0.021, 0.063, 0.045.
  • Tev1 4B: 0.901, 0.052, 0.042, 0.031.
  • Kev 4B: 0.833, 0.060, 0.078, 0.070.
  • Decider 2B v1: 0.747, 0.128, 0.208, 0.074.
  • AlexWortega OpenJev 4B v5: 0.744, 0.116, 0.089, 0.118.
  • Bosun v3.1 1.7B: 0.680, 0.208, 0.323, 0.089.
  • Tiny-Jev 0.6B: 0.646, 0.128, 0.224, 0.267.
  • Laya: 0.542, 0.298, 0.396, 0.092.
  • MoJev 0.85B: 0.501, 0.150, 0.307, 0.129.
  • Open-Jev DeBERTa v3 large: 0.472, 0.194, 0.385, 0.147.
  • Von 1.2: 0.422, 0.242, 0.297, 0.071.
  • 쌍별 플립률은 동등한 변형 입력에서의 일관성을 측정함. 인젝션 ASR은 공격 성공률이며, ECE는 기대 보정 오차임.

실시간 비교 및 분류기 비용

  • [실시간 비교]에서 Span-01과 Jev를 비교할 수 있음.
  • 모델별 입력 및 출력 비용은 다음과 같음.
  • Span-01 Lite: 입력 무료, 출력 무료.
  • Span-01: 입력 100만 토큰당 $0.02, 출력 무료.
  • 현재 목표는 LLM을 심판으로 사용하는 방식을 없애는 것임.

공개 및 빠른 시작

  • Span-01을 공개했으며, 빠른 시작 안내에 따라 자체 추적 데이터와 행동 정의에 실행할 수 있음.
  • [Span-01 빠른 시작 보기]