HAL-X AI가 질문에 확률을 붙여 답하고 문서에서 수치·인용문·근거를 찾는 오픈소스 모델 THX-01을 공개했다. 제작진은 지원 티켓 분류 벤치마크에서 TypeSafe Jev 1.13보다 높은 평균 정확도를 보고했지만, 문서의 숫자 찾기에서는 Jev가 더 높은 점수를 기록했다.

THX-01은 3억 2200만 개 매개변수로 구성되며, 3억 700만 개 매개변수의 mmBERT-base 인코더와 1500만 개 매개변수의 결정 헤드를 사용한다. 한 번의 순전파로 여러 질문에 답하도록 설계됐고, 모델 카드에 따르면 단일 GPU에서 요청당 약 10밀리초가 걸린다. 질문당 입력은 최대 1024토큰이며, 이를 넘는 상태 정보는 잘린다. Apache 2.0 라이선스로 공개됐다.

모델은 선택지별 확률을 반환하는 분류 외에도, 문서에 적힌 숫자와 문장 그대로의 발췌, 답변을 뒷받침하는 문서 부분을 반환한다. 숫자 찾기는 값을 정규화하지만 단위나 통화를 변환하지 않는다. 문서에 마일만 적혀 있는데 킬로미터를 묻거나, 미국 달러만 적혀 있는데 유로를 물으면 null을 반환한다. 발췌 기능은 문서에 있는 문구만 잘라내며, 산술 계산이나 바꿔쓰기는 하지 않는다.

모델 카드의 지원 티켓 분류 시험은 아제르바이잔어·러시아어·영어·터키어로 된 2,843개 티켓과 15개 범주를 다뤘다. 네 시험 세트 평균 정확도는 THX-01이 98.4%, TypeSafe Jev 1.13이 97.4%였다. THX-01의 독립 시험 세트 기대 보정 오차(ECE)는 0.003으로 제시됐다. 모델 카드에 따르면 이 점수는 독립 시험 세트에서 측정됐으며, 비교 대상 대규모 언어 모델은 확률을 반환하지 않아 ECE 비교에서 제외됐다. Claude Sonnet 5.5는 각 세트에서 200개 티켓을 층화 추출해 평가했다.

문서 추출 시험에서는 숫자 찾기 정확도가 THX-01 93.4%, TypeSafe Jev 1.13 96.6%였다. THX-01은 발췌 토큰 F1 점수 84.1%, 근거 인용 정확도 94.0%를 기록했다. 모델 카드에 따르면 신뢰도 임계값을 적용하면 네 티켓 시험 세트 모두에서 전체 티켓의 약 4분의 3을 오류 없이 자동 처리하고, 티켓의 90%를 최소 99.5% 정확도로 처리할 수 있다고 한다. 이는 모델 제작진이 제시한 평가 결과다.

언어 후학습은 아제르바이잔어를 포함한 18개 언어로 진행됐고, 인코더는 100개가 넘는 언어를 지원한다고 모델 카드는 설명한다. 한 GPU에서 질문 하나에 약 9밀리초, 같은 상태에 대한 질문 세 개에 약 10밀리초가 걸리며, 150개 요청을 묶으면 약 156밀리초라고 제시했다.

설치 방법은 다음과 같다. 가중치는 처음 사용할 때 모델 저장소에서 내려받는다.

pip install thx01 pip install "thx01[server]"

세부 벤치마크와 사용 방법은 THX-01 모델 카드에서 확인할 수 있다. 모델 카드가 밝힌 한계로는 유사한 범주가 많은 분류가 있다. 예를 들어 Banking77의 77개 의도 분류 정확도는 65.9%이며, 겹치는 감정 범주 6개로 구성된 DAIR Emotion은 44.6%다.