TL;DR

  • Kokoro-82M을 브라우저에서 실행해 6개 언어 41개 음성으로 최대 1,500자를 처리하며, 입력한 텍스트를 업로드하지 않고 음성을 생성함.
  • 첫 실행 때 엔진에 따라 326MB(WebGPU) 또는 92MB(CPU) 모델을 한 번 내려받으며, 이후에는 브라우저 캐시에서 불러옴.
  • WebGPU에서는 40단어 문단을 약 3초에 처리하고 첫 문장은 약 1초 뒤 재생하며, CPU에서는 전체 처리에 약 20~40초가 걸림.
  • 생성 음성은 24kHz 모노 WAV로 저장되며, MP3와 M4A 내보내기는 아직 제공되지 않음.
  • 모델은 Apache-2.0 라이선스로 상업적 이용이 가능하며, 생성 오디오에 대해 Sandbook은 권리를 주장하지 않음.

작동 방식

  • 음성 엔진은 사용자의 컴퓨터에서 실행되며, 첫 문장이 준비되는 즉시 재생되는 동안 나머지 문장을 렌더링하고 WAV 파일을 제공함.
  • 시작을 누르면 브라우저가 Kokoro-82M 모델을 한 번 내려받아 캐시에 저장하며, 이후 작업은 브라우저 탭 안에서 이뤄짐.
  • 입력 텍스트를 문장 단위로 나누고 각 문장을 음소로 변환한 뒤, 선택한 음성으로 24kHz 오디오를 생성함.
  • 영어는 Kokoro 자체 영어 음소 변환기를 사용하며 숫자, 가격, 시간도 읽기 방식으로 변환함. 스페인어, 프랑스어, 이탈리아어, 포르투갈어, 힌디어는 해당 음성을 선택할 때만 내려받는 eSpeak NG를 사용함.
  • 추론은 백그라운드 작업자에서 실행되므로 페이지 반응성이 유지됨.

WebGPU 또는 CPU에서의 실행

  • 도구가 실행 엔진을 자동으로 선택함. 작은 양자화 모델은 WebGPU에서 음성이 깨져 들리므로 품질 설정은 제공하지 않음.
  • WebGPU(그래픽 카드)는 전체 정밀도 모델을 사용하며, 최초 다운로드 크기는 326MB임. 최신 노트북에서 40단어 문단은 약 3초가 걸리고 첫 문장은 약 1초 뒤 재생됨. 컴퓨터용 최신 Chrome과 Edge, Mac용 Safari 26에서 WebGPU를 사용할 수 있음.
  • CPU(WebAssembly)는 WebGPU를 사용할 수 없을 때 8비트 모델을 사용하며, 최초 다운로드 크기는 92MB임. 실시간보다 느리며 프로세서에 따라 첫 문장까지 10~15초, 같은 문단 전체에 20~40초가량 걸림.
  • 두 방식 모두 두 번째 방문부터는 다시 내려받지 않고 브라우저 캐시에서 몇 초 안에 모델을 불러옴. 실행 중 탭에서 1~1.5GB의 메모리를 사용할 수 있음.

6개 언어, 41개 음성

  • 음성에 따라 언어가 정해지며, Sandbook 앱과 같은 41개 음성 및 앱의 이름과 설명을 제공함.
  • 영어: 28개 음성으로, 미국식 20개와 영국식 8개를 포함하며 Heart, Bella, Michael, Emma, George 등이 있음.
  • 스페인어: 3개 음성(Dora, Alex, Santa).
  • 프랑스어: 1개 음성(Siwis).
  • 이탈리아어: 2개 음성(Sara, Nicola).
  • 브라질 포르투갈어: 3개 음성(Dora, Alex, Santa).
  • 힌디어: 4개 음성(Alpha, Beta, Omega, Psi).
  • 음성 선택기 옆 재생 버튼을 누르면 모델을 불러오지 않고 음성을 미리 들을 수 있으며, Kokoro 음성 샘플 전체도 들을 수 있음.
  • 속도는 0.5×~2.0× 범위이며 모델 내부에서 적용되므로 빠른 속도에서도 사람이 빠르게 말하는 듯한 음성이 유지됨.

다운로드, 이용 권한 및 제한

  • 생성한 음성은 24kHz 모노 WAV로 저장할 수 있음. MP3와 M4A 내보내기는 아직 제공되지 않음.
  • Kokoro-82M 모델은 상업적 이용을 허용하는 Apache-2.0 라이선스로 배포됨. 생성한 오디오에 대해 Sandbook은 권리를 주장하지 않음.
  • 생성 한도는 한 번에 1,500자, 음성으로 약 1분 30초 분량임.
  • 모델에 데스크톱급 메모리가 필요하므로 이 도구는 컴퓨터용으로 설계됨. 휴대전화는 브라우저 버전을 실행할 메모리가 부족할 수 있으며, 휴대전화에서는 음성 샘플을 먼저 표시한 뒤 모델 로드를 제안함.
  • 첫 다운로드 직후 탭을 닫으면 브라우저의 캐시 저장이 완료되지 않을 수 있으며, 이 경우 다음 방문 때 모델을 다시 내려받음.
  • 텍스트와 오디오는 브라우저를 벗어나지 않음. 도구가 가져오는 파일은 모델, 선택한 음성, 영어가 아닌 음성에 필요한 음소 변환기뿐임. 페이지는 도구 사용 횟수만 집계하며 입력 내용은 집계하지 않음.

iPhone에서 오프라인으로 사용

  • 이 페이지는 모델 시연용이며, Sandbook 앱은 같은 Kokoro-82M 모델을 Apple MLX를 통해 iPhone과 iPad에서 완전 오프라인으로 실행함. 41개 음성을 모두 제공하며 길이 제한이 없음.
  • 앱은 EPUB 책, PDF, 웹 페이지, 스캔한 페이지를 소리 내어 읽고, 말하는 단어를 강조하며 읽던 위치를 기억함. 무료이며 계정이나 구매 항목이 필요 없음. iOS 18.2 이상이 설치된 iPhone 12 이상이 필요함.
  • 휴대전화에서 모델을 실행하는 방식은 Kokoro TTS iPhone 앱 페이지에서 설명함. 화면 읽기만 필요하다면 iOS의 기본 설정으로도 가능하며, Speechify와 NaturalReader 등과의 비교는 iPhone 리더 대안에서 확인할 수 있음.
  • App Store에서 무료로 다운로드할 수 있으며 iPhone과 iPad 전용임. 인앱 구매는 없음.

Kokoro TTS 온라인 자주 묻는 질문

  • 정말 무료인가? 계정이나 가입이 필요 없고 생성 횟수 제한도 없음. 한 번에 최대 1,500자를 처리하며 원하는 만큼 생성할 수 있음. 모델이 서버가 아니라 사용자 컴퓨터에서 실행되므로 비용이 들지 않음.
  • 생성 음성을 상업적으로 사용할 수 있는가? Kokoro-82M 모델은 상업적 이용을 허용하는 Apache-2.0 라이선스로 배포됨. Sandbook은 생성한 오디오에 권리를 주장하지 않으므로 WAV 파일을 영상, 강좌, 제품 등에 사용할 수 있음. 음성은 합성 음성이므로 실제 인물의 목소리를 사용하지 않음.
  • 컴퓨터에서 느린 이유는 무엇인가? WebGPU가 없으면 도구가 WebAssembly를 통해 CPU에서 92MB 모델을 실행하므로 실시간보다 느림. 빠른 노트북에서도 40단어 문단은 약 20~40초가 걸리고 첫 문장은 10~15초 뒤 재생됨. 컴퓨터용 최신 Chrome이나 Edge처럼 WebGPU를 지원하는 브라우저는 그래픽 카드에서 전체 모델을 실행해 같은 문단을 약 3초에 처리함.
  • iPhone이나 Android에서 작동하는가? 모델은 브라우저 탭 하나에서 약 1GB의 메모리를 필요로 하며, iPhone의 Safari는 메모리를 많이 사용하는 탭을 닫을 수 있음. 휴대전화에서는 음성 샘플을 재생한 뒤 시험 실행용 베타 버튼을 제공함. iPhone과 iPad에서는 무료 Sandbook 앱이 같은 모델을 기기에서 실행함.
  • 오프라인으로 작동하는가? 일부만 가능함. 최초 로드 뒤 모델 파일이 브라우저에 캐시되면 서버 없이 탭 안에서 음성을 생성할 수 있지만, 페이지를 여는 데는 여전히 인터넷 연결이 필요함. iPhone이나 iPad에서 완전 오프라인으로 Kokoro TTS를 사용하려면 모델이 포함된 Sandbook 앱을 이용해야 함.