TL;DR

  • 현대 대형 언어 모델(LLM)의 토크나이제이션(tokenization) 조사 논문은 기존 방법과 병목을 정리하며, 특히 서브워드 토크나이제이션의 효용과 한계를 분석하고 더 나은 평가와 연구가 필요하다고 제시함.
  • 토크나이저는 텍스트 정규화와 사전 분할, 토큰 분할, 정수 ID 매핑, 임베딩 변환을 거쳐 모델 입력을 구성함.
  • 서브워드 토큰은 단어 단위 방식의 미등록 단어 문제를 줄이고 문자 단위보다 짧은 시퀀스를 만들지만, 어휘 크기와 시퀀스 길이 사이의 계산·매개변수 절충이 발생함.
  • 빈도 중심 어휘 구축은 자원이 풍부한 언어에 유리할 수 있으며, 언어별 과분절과 계산량 차이를 낳고 교차 토크나이저·언어 간 비교를 어렵게 함.
  • 토크나이저 변경 효과를 검증하려면 더 나은 측정과 벤치마크, 적절한 규모의 실험, 압축률과 다운스트림 성능의 연계 분석이 필요하며 특정 대체 토크나이저가 최선이라고 주장하지 않음.

현대 언어 모델의 텍스트 입력 인터페이스

  • 현대 언어 모델은 원시 텍스트를 입력으로 받고 원시 텍스트를 출력하지만, 텍스트 자체가 아니라 토큰 시퀀스를 처리함. 토크나이제이션은 텍스트를 모델이 처리하도록 설계된 단위로 바꾸는 첫 단계임.
  • 토크나이저는 어휘와 텍스트를 토큰으로 변환하는 절차의 조합임.
  • 처리 단계는 텍스트 정규화와 거친 사전 분할, 어휘 항목으로의 토큰 분할, 정수 ID 매핑, 임베딩 벡터 변환 순서임.[p2]
  • 도식 예시는 “tokenization”과 “pipeline”을 여러 조각으로 나누는 방식이며, 정량적 결과를 나타내는 예시는 아님.

서브워드 토크나이제이션의 절충

  • 주류 방식인 서브워드 토크나이제이션은 문자나 바이트와 단어 사이의 세분성을 지닌 토큰을 사용함.
  • 단어 단위 모델과 비교하면 모든 단어 형태를 포함할 만큼 큰 어휘 없이도 미등록 단어 문제를 해결하고 어휘 크기를 제한해 임베딩 매개변수와 필요한 로짓 수를 줄임.
  • 문자 단위 모델과 비교하면 토큰 하나에 더 많은 정보를 담아 귀납적 편향을 개선하고 시퀀스를 크게 짧게 만듦.
  • 어휘가 지나치게 크면 임베딩 및 출력 계층의 매개변수 비용이 증가하고, 토큰을 더 세분화하면 시퀀스가 길어져 계산량이 증가할 수 있음.[p8]
  • 표 2.1의 사례에서 임베딩 가중치를 공유하는 Gemma 4 E2B는 26만 2천 토큰 어휘를 사용하며, 총 46억 5천만 개 매개변수 중 59.80%를 임베딩 및 출력 계층에 배정함.[p10]

언어별 토큰 배분과 측정 문제

  • 빈도 기반 어휘 구축은 토크나이저 학습 데이터에서 더 많이 나타나는 언어에 유리한 경향이 있음. 공유 어휘는 일부 언어를 간결하게 인코딩하는 반면 다른 언어는 더 많은 조각으로 나눌 수 있음.
  • 조사 논문은 더 나은 지원을 받는 언어보다 텍스트를 더 많고 대체로 덜 의미 있는 서브워드 단위로 나누는 현상을 과분절(oversegmentation)이라고 부름.
  • 토큰 수가 늘면 모델 시퀀스가 길어져 지연 시간이나 자원 사용량이 커질 수 있음. 표준 트랜스포머의 셀프 어텐션 계산 비용은 시퀀스 길이에 따라 이차적으로 증가하지만, 토큰 수(CTC)는 이 부담을 나타내는 대리 지표일 뿐임.[p42]
  • 다음 토큰 교차 엔트로피와 퍼플렉시티는 토큰 단위 측정값이며, 문자열 하나를 인코딩하는 토큰 수에 따라 달라지므로 토크나이저 간에 그대로 비교할 수 없음.[p48]
  • 바이트당 비트 수(bits-per-byte)는 바이트 수로 정규화하지만, 문자 체계에 따라 바이트 수 자체가 달라지므로 언어 간 공정한 비교를 자동으로 보장하지 않음.[p48]

더 나은 평가를 위한 연구 과제

  • 토크나이저 절제 실험은 처음부터 모델을 학습해야 하는 경우가 있어 비용이 높고 결과에 잡음이 생길 수 있음. 조사 논문에 따르면 2025년 집계 대상 학술 행사에서 토크나이제이션 관련 용어를 언급한 논문은 전체의 최대 2%임.[p9]
  • 조사 논문은 단일 대체 토크나이저를 제안하지 않고 다음 과제를 제시함.[p11]
  • 측정 방식과 벤치마크 개선
  • 관련성 있는 규모에서 효과 검증
  • 압축률 같은 내재적 특성과 다운스트림 성능의 연계
  • 토큰 수가 적으면 다른 조건이 같을 때 토큰 단위 과금이 줄어들 수 있음. 그러나 압축률만으로 모델 품질 향상, 실제 경과 시간 기준 추론 속도 향상, 전체 비용 감소가 입증되지는 않음.[p76]

토크나이제이션 연구의 중요성

  • 조사 논문은 토크나이제이션을 계산 및 추론 비용, 매개변수 예산, 언어별 불균등 대우 같은 실질적 영향과 연결해 정리함.
  • 토크나이저 선택의 영향을 더 확신 있게 연구할 수 있도록 평가를 개선해야 한다고 주장함. 이는 연구 확대의 필요성을 제기하는 것이며, 특정 토크나이저가 가장 우수하다는 증거를 제시하는 것은 아님.[p97]