generative experiences co.가 내부 모델의 프리뷰를 공개했다. 코드명은 Haydn-01이다. 제작사는 기존 텍스트 음성 변환이나 오디오 이해 방식과 달리, 단일 아키텍처에서 아래 세 기능을 제공하는 모델은 없다고 주장했다.
- 오디오 분류: 음성 샘플을 입력하고 화자가 화났는지, 슬픈지, 행복한지 등을 묻는다.
- 실시간 대화: TTFC는 2.1초, RTF는 0.88이다.
- 비음성 오디오 이해: 동물 소리, 붐비는 장소, 시끄러운 환경을 식별하며, 이해할 수 없는 경우에는 예측을 거부한다.
제작사는 기존 방식의 예로 오픈AI ChatGPT 음성, 구글 Gemini TTS, ElevenLabs를 들었다. 개발에 기여한 곳으로 mmastrac(djev), trynarilabs(DiaTTS), Google DeepMind(DiffusionGemma), typesafeai(Jev), vLLM, Modal(컴퓨팅), Hugging Face를 언급했다. 크레딧에는 TaDiCodec(Amphion, NeurIPS ’25), Future(아티스트), Epic Records, Freebandz가 포함됐다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요