TL;DR
- Jev를 적용한 Pipecat 음성 에이전트는 같은 100개 작업을 각각 세 차례 수행한 테스트에서 발화 중 끼어들기를 52%에서 11%로 줄였으며, 과제 완료율은 거의 달라지지 않음.
- 테스트는 VAmoS Pro Bench의 14개 에이전트 중 Pipecat 에이전트 하나를 대상으로 진행됐으며, 소음 조건마다 75회 통화를 포함함.
- Jev는 발신자의 발화 내용과 에이전트의 마지막 문장을 분류해 차례 종료 여부를 판단하는 빠른 분류 모델이며, 응답 시간은 약 150밀리초임.
- 완료 통화는 Jev 미적용 시 300회 중 50회, 적용 시 53회였고, 중앙값 응답 시간은 2.1초에서 4.6초로 증가함.
- 테스트는 한 에이전트와 한 설정에 한정되며, TV 음성을 발신자 발화로 받아 적는 문제는 해결되지 않음.
벤치마크 결과
- VAmoS Pro Bench는 음성 에이전트 벤치마크이며, 이번 테스트에서는 14개 에이전트 중 Pipecat 에이전트를 골라 Jev가 발신자의 발화 종료 시점을 판단하도록 설정함.
- 동일한 100개 작업을 에이전트별로 세 차례 수행한 결과, 에이전트가 발신자의 발화 도중 말을 시작한 비율이 52%에서 11%로 감소함.
- 비교 기준은 VAmoS Pro Bench의 동일한 100개 작업과 세 차례 실행이며, 소음 조건마다 75회 통화가 포함됨. 모든 소음 조건에서 감소 폭이 유의했으며 p < 10⁻⁷임.
발화 차례 감지가 어려운 이유
- 많은 음성 에이전트는 타이머를 사용함. 음성 활동 감지(Voice Activity Detection)라는 작은 음향 모델이 발화 여부를 표시하고, 정해진 시간 동안 발화가 없으면 차례가 끝난 것으로 보고 에이전트가 답함.
- 타이머는 침묵만 감지하므로, 발신자가 계좌번호를 끊어 말하거나 청구서를 찾겠다며 잠시 멈추는 상황을 발화 종료로 오인할 수 있음. 에이전트가 문장이 끝나기 전에 답하고 발신자가 말을 이어가면 서로의 말이 겹치며, 전화 통화에서는 반복, 숫자 오인, 발신자가 처음부터 다시 말해야 하는 상황으로 이어짐.
- 배경 소음은 문제를 더 키움. 방 안의 TV 소리도 발화로 인식되므로 음성 인식기가 TV 대사를 발신자의 말처럼 기록함.
- 텍스트 에이전트에서는 사용자가 엔터 키를 누르는 시점으로 입력 종료를 알 수 있지만, 음성 에이전트에는 엔터 키가 없음. 에이전트는 연속된 오디오를 들으며 발화 시점을 판단해야 하므로, 너무 일찍 말하면 대화를 끊고 너무 늦게 말하면 침묵을 길게 만듦.
의미 기반 발화 차례 감지를 간편하게 적용
- 의미 기반 발화 차례 감지는 발신자가 소리를 내는지뿐 아니라 실제로 무슨 말을 했는지도 살핌. “계좌번호는 447입니다”는 끝나지 않은 생각일 수 있고, “이상입니다, 감사합니다”는 끝난 발화일 수 있음. 여러 음성 프레임워크가 이미 의미 기반 감지 기능을 제공함.
- Jev는 이를 기존 시스템에 간편하게 적용할 수 있는 빠른 범용 분류 모델임. 텍스트와 질문을 입력하면 약 150밀리초 만에 라벨을 반환함.
- 발화 차례 감지에서는 지금까지의 발신자 발화와 에이전트의 직전 문장을 입력으로 사용하며, 결과 라벨은 다음 세 가지임.
complete: 발화 완료short: 구절 중간에 끊긴 짧은 멈춤long: 청구서를 찾는 경우처럼 더 오래 이어지는 멈춤
에이전트에 따라 효과가 달라지는 이유
- Jev의 효과는 음성 인식기, 발신자가 처한 소음 환경, 발신자의 멈춤 방식, 에이전트가 차례를 얼마나 오래 열어두는지 등 주변 구성에 따라 달라짐.
- 모델이나 아키텍처를 선택할 때와 마찬가지로, 효과를 확인하려면 벤치마크가 필요함.
- Pipecat 에이전트를 동일한 가상 발신자와 배경 소음 조합으로 같은 100개 작업에 각각 세 차례 실행함. 한 번은 기본 타이머를 사용하고, 다른 한 번은 Jev가 발화 종료 시점을 판단함.
- 그 외 차이는 Pipecat 버전임. Jev 적용 테스트는 1.12, 미적용 테스트는 1.8을 사용함. 벤치마크는 각 통화에서 에이전트가 뒤쪽의 청구 및 대출 시스템에 어떤 변경을 했는지 평가함.
달라진 점과 달라지지 않은 점
- 끼어들기가 크게 감소함: 발신자 발화 중 에이전트가 말을 시작한 비율이 52%에서 11%로 감소함. 감소는 모든 소음 조건에서 나타남.
- 과제 완료율은 거의 같음: Jev 미적용 시 300회 중 50회, 적용 시 53회가 통과함. 통화는 더 차분해졌지만 정답률은 높아지지 않음.
- 응답이 느려짐: 응답 시간 중앙값이 2.1초에서 4.6초로 증가함. 주된 원인은 발화 차례를 열린 상태로 더 오래 유지한 것임.
- TV 음성 문제는 해결되지 않음: 음성 인식기는 여전히 TV 대사를 발신자의 말처럼 기록하며, Jev는 TV 발화가 끝날 때까지 기다리는 경우가 많음.
이번 테스트로 알 수 없는 점
- 테스트 대상은 직접 정한 차례 유지 시간 설정을 적용한 에이전트 하나임.
- 발화 차례 감지기를 공정하게 비교하려면 모두 같은 통화에 적용해야 함. 따라서 이번 결과만으로 Jev 일반의 성능을 판단할 수 없으며, 다른 에이전트에서는 다른 결과가 나올 수 있음.
자체 통화에서 실행
- 이번 결과는 600회의 시뮬레이션 통화에서 도출됨. Veris는 발신자, 정책, 소음 환경을 반영한 유사한 시뮬레이션을 제공해 새 구성 요소가 실제 고객에게 영향을 주기 전에 통화 결과를 확인할 수 있다고 설명함.
- Veris는 새 발화 차례 감지기, 모델, 프롬프트를 시뮬레이션 발신자 및 시스템 복제본과 함께 실행하고 에이전트의 동작을 평가함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요