TL;DR
- Simple AI가 실제 전화 통화에서 음성 활동 감지기보다 중앙값 기준 300밀리초 빠르게 발화 종료를 판단하고 대화 흐름을 개선하는 음성 처리 시스템 Tango를 공개함.
- Tango는 전사문을 기다리지 않고 오디오에서 발화 종료와 끼어들기를 직접 판단하며, 통화별 전사문은 계속 생성하되 핵심 처리 경로에서는 제외함.
- 공개 LiveKit 벤치마크에서 90% 이상의 감지율을 요구할 때 11개 시스템 중 가장 빠르며, 실제 발화 종료 400건 중 15건을 놓침.
- Tango는 이전 프로덕션 에이전트보다 우발적 끼어들기를 64% 줄였으며, 고객이 말하기 시작한 뒤 약 100밀리초 만에 실제 끼어들기를 인식함.
- 8kHz 전화 음성에 맞춘 듀얼 채널 처리로 80밀리초마다 실시간 평가를 수행하고 추론을 그 절반보다 짧은 시간에 실행함.
음성 AI의 기존 작동 방식
- 기존 음성 AI는 고객 발화를 전사하고, 전사문으로 응답을 생성한 뒤, 다시 오디오로 변환하는 계단식 방식을 주로 사용함.
- 에이전트가 활용해야 하는 정보가 먼저 텍스트로 평탄화되는 과정에서 상당 부분이 손실되며, 전사문이 준비될 때까지 응답을 시작할 수 없어 속도와 자연스러움이 저하됨.
- Tango는 중요한 판단에 필요한 발화 종료와 끼어들기를 오디오에서 직접 읽어 이 단계를 건너뜀. 모든 통화의 전사문은 계속 생성되지만 핵심 처리 경로에는 들어가지 않음.
Tango의 오디오 처리 이점
발화 종료 판단 정확도 향상
- Tango는 경쟁 발화 종료 모델보다 빠를 뿐 아니라 정확도도 높음. 오탐은 끼어들기를 늘리고 미탐은 불편한 침묵을 유발하므로 발화 종료 판단의 정확도는 대화 흐름에 중요함.
- 공개 LiveKit 벤치마크에서 감지율 90% 이상을 요구할 때 11개 시스템 중 가장 빠르며, 실제 발화 종료 400건 중 15건을 놓침. 같은 기준에서 Soniox는 54건, Deepgram Flux는 197건을 놓침.
- Smart Turn과 비교하면 발화 종료 포착률이 같은 조건에서 발화 도중 신호를 내는 빈도가 3.7~4.7배 낮음.
우발적 끼어들기 감소
- 실제 끼어들기와 “음, 그렇죠” 같은 짧은 맞장구는 전사문에서 비슷해 보일 수 있지만 대응은 정반대임. 전자는 말을 멈춰야 하고 후자는 계속 말해야 함.
- Tango는 두 상황을 실시간으로 구별해 고객이 동의의 뜻으로 말하는 동안 대화를 끊지 않음.
- 프로덕션의 이전 에이전트와 비교해 끼어들기를 64% 줄였으며, 고객이 말하기 시작한 뒤 약 100밀리초 만에 실제 끼어들기를 인식함.
텍스트에 담기지 않는 음성 신호 포착
- “고맙습니다”라는 텍스트만으로는 미소를 지으며 말했는지 이를 악물고 말했는지 알 수 없음.
- 텍스트는 상호작용을 인간답게 만드는 정확한 신호인 어조, 운율, 말의 속도를 제거하지만, 오디오 기반 처리는 이 신호를 보존함.
번역 손실 없는 속도
- 기존 파이프라인은 에이전트가 판단을 시작하기 전에 약 1초의 지연을 추가함.
- Tango는 오디오 입력에서 판단으로 바로 이어지며 에이전트 채널과 고객 채널을 동시에 처리함.
- 스트리밍 오디오 모델을 직접 사용해 80밀리초마다 실시간 평가를 수행하고, 그 절반보다 짧은 시간에 추론을 실행함. 전사문을 기다릴 필요가 없으며 두 번째 파이프라인도 실행하지 않음.
Tango의 작동 모습
- 전사문 기반 모델은 침묵을 보고 추측하지만, Tango는 고객이 여전히 생각 중임을 오디오에서 파악해 적절한 시점에 응답함.
- 실제 끼어들기와 대화 중 맞장구를 구별하므로 고객이 “알겠습니다”라고 말할 때마다 에이전트가 말을 멈추지 않음.
콜센터에 미치는 영향
- 자연스러운 에이전트와 로봇 같은 에이전트의 차이는 실제로 약 1초의 지연에 달려 있으며, 이 차이는 이미 추적 중인 지표에 직접 나타남.
- 고객 만족도 점수(CSAT): 고객 만족도는 문제 해결 여부만이 아니라 전반적인 경험에 좌우됨. 어색한 침묵과 잘못된 끼어들기가 줄면 에이전트가 정답을 말했더라도 통화가 망가진 듯 느껴지는 경우가 줄어듦.
- 평균 처리 시간(AHT): 침묵, 끼어들기, 반복되는 “죄송합니다, 말씀하세요”는 통화에 시간을 더하며 콜센터 규모에서는 이 시간이 빠르게 누적됨.
- 통화 포기율: 이탈 고객은 오답을 들은 고객만이 아니라 도움을 받기도 전에 답답함을 느껴 전화를 끊은 고객임.
비교 결과
- 차트에서 상단에 가까운 시스템일수록 더 많은 발화 종료를 포착하고, 왼쪽에 가까운 시스템일수록 더 빠르게 포착함.
- Tango는 속도 대비 정확도가 가장 높고 정확도 기준으로 가장 빠른 모델임. 가장 좋고 자연스러운 대화에는 두 특성이 모두 필요함.
실제 통화에 맞춘 설계
- 대부분의 발화 종료 모델은 깨끗하고 대역폭이 높은 오디오로 학습하고 벤치마크를 수행함. 실제 고객 통화는 전화 시스템을 거치는 압축된 8kHz 전화 음성으로, AI 에이전트가 등장하기 훨씬 전에 구축된 시스템을 통과함.
- 따라서 데모에서 잘 작동하는 모델도 콜센터의 실제 통화량과 마주하면 성능이 저하되는 경우가 많음.
- Tango는 처음부터 듀얼 채널 및 전화 음성 기반으로 설계됨. 인프라 업그레이드를 요구하지 않고 기존 인바운드·아웃바운드 통화 시스템에 직접 연결됨.
- 이는 벤치마크 수치와 프로덕션에서 실제로 확인할 수 있는 수치의 차이임.
Simple Tango의 다음 단계
- Tango는 이미 Simple의 프로덕션 트래픽 전반에서 운영되며, 고객이 매일 처리하는 통화에서 지연 감소, 정확도 향상, 대화 자연스러움 개선을 제공함.
- Tango는 앞으로 구축할 모든 에이전트에 대한 설계 방식에도 이미 영향을 미치고 있음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요