TL;DR
- Jev를 WebSpeaker의 초기 판단에 적용한 시험에서 모델 자체는 빠르고 약간 더 정확했지만, 모든 구성에서 방문자가 답변을 받기까지 더 오래 걸림.
- 폴란드어와 영어 합성 질문을 사용한 4개 시험에서는 고객 데이터가 모델에 전달되지 않았으며, 단일 판단 정확도는 Jev와 Gemini 모두 96.7%임.
- Jev를 먼저 실행하면 Gemini의 작업량은 줄지만 Jev의 판단을 기다려야 해 전체 답변이 평균 약 27% 늦어짐.
- 두 모델을 병렬로 실행하면 분석 단계는 일반 요청에서 9%, 느린 요청에서 24% 빨라지고 판단 정확도도 높아지지만, 전체 답변은 약 22% 늦어짐.
- Jev는 프로덕션에 배포되지 않았으며, 전체 대화의 속도·품질·비용과 데이터 처리 검토를 더 큰 시험에서 확인한 뒤 재평가할 수 있음.
Jev를 고려한 이유
- WebSpeaker는 기업 웹사이트의 콘텐츠와 문서를 바탕으로 방문자 질문에 답하는 챗봇임. 답변을 작성하기 전에 챗봇은 회사 자료를 검색할지, 무엇을 찾을지, 방문자가 사람과 대화하려는지 등을 판단함.
- 현재 Gemini가 초기 판단과 검색 질의 및 대화 메모 준비를 담당함. TypeSafe AI가 공개한 Jev는 텍스트 작성보다 주어진 선택지에서 빠르고 거의 반사적으로 판단하도록 설계된 모델임.
- 첫 시험에서 Jev의 단일 판단 호출 시간 중앙값은 232밀리초였고, Gemini는 전체 계획을 준비하는 데 1,824밀리초가 걸림. 두 모델의 작업은 동일하지 않았고 Gemini가 더 많은 일을 했지만, 속도 차이를 바탕으로 ‘Jev가 판단하고 Gemini가 작성하는’ 역할 분담을 시험함.
시험한 내용
- 폴란드어와 영어 합성 질문으로 4가지 시험을 진행했으며, 시험 대상 모델에 고객 데이터를 보내지 않음.
- 단일 판단: 챗봇이 정보를 검색할지, 바로 답할지, 대화를 사람에게 넘길지 결정하는 시험에서 Jev와 Gemini의 정확도는 질문 60개 기준 모두 96.7%임. Jev가 훨씬 빨랐지만 수행한 작업은 일부에 그침.
- Gemini 판단을 Jev 판단으로 대체: Gemini 계획의 일부 판단을 Jev로 교체한 뒤 전체 챗봇 대화를 실행함. Jev는 기대한 답을 더 자주 선택했으며 정확도는 91% 대 87%임. 다만 다른 모델의 추가 확인이 필요한 계획은 Jev를 사용했을 때 약간 더 자주 발생함. 단독으로는 올바른 판단이라도 나머지 계획과 맞지 않을 수 있으며, 예를 들어 검색 질의가 준비되지 않았는데 ‘문서를 검색하라’고 결정하는 경우가 있음.
- Jev 실행 후 Gemini 실행: Gemini의 작업량은 줄고 처리도 빨라졌지만, 먼저 Jev를 기다려야 했음. 판단 항목을 늘리자 Jev의 중앙 호출 시간은 232밀리초에서 872밀리초로 증가함. 분석 단계가 길어졌고 전체 답변은 평균 약 27% 늦게 도착함.
- Jev와 Gemini 병렬 실행: 분석 단계는 일반적인 요청에서 9%, 처리 시간이 긴 요청에서 24% 빨라짐. 판단 정확도도 92% 대 87%로 높았음. 그럼에도 전체 답변은 약 22% 늦게 도착했고, 한 사례에서는 챗봇이 내부적으로 모순되는 답변을 제공함.
더 빠른 단계가 더 빠른 답변으로 이어지지 않은 이유
- 질문 분석 뒤에는 정보 검색, 계획 추가 확인, 답변 작성, 답변 검증이 이어짐. 분석 단계에서 절약한 151밀리초는 이후 단계에서 사라짐.
- 역할 분담을 바꾸자 일부 대화에서 챗봇이 다른 경로를 선택하거나 검색 범위를 넓히거나 좁혔고, 추가 확인을 실행하기도 함. 두 모델이 병렬로 작동하면 서로의 판단을 알지 못하므로 Gemini는 Jev가 검색이 필요하다고 판단했는지 모른 채 검색 질의를 작성할 수 있음.
- 표본이 작아 어떤 요인이 가장 큰 영향을 미쳤는지는 판단할 수 없지만, 전체적인 결과의 방향은 분명함. 모델 간에 작업을 나누면 각 모델이 알고 있는 정보가 달라지며, 한 구성 요소의 속도만으로 전체 시스템의 속도를 알 수 없음.
WebSpeaker 고객에게 의미하는 점
- WebSpeaker에 새 모델을 추가하는 기준은 다른 측면을 악화시키지 않으면서 전체 대화의 품질·속도·비용을 개선하는 것임. 분리된 시험에서 빠른 결과가 나오는 것은 조사할 이유이지, 배포할 이유는 아님.
- 새 모델 제공업체에 방문자 질문을 전달하기 전에는 질문을 처리하는 위치, 보관 기간, 모델 학습에 사용하는지 여부, 실제 트래픽에서의 성능을 확인함.
- Jev는 이 검토 단계에 이르지 않았으며 고객 대화에 투입되지 않음. 이번 실험은 프로덕션 코드 외부에서 진행됨.
Jev를 다시 검토할 것인가?
- 재검토 가능성은 있음. 이번 시험은 8개 테스트 시나리오를 각각 세 번 반복한 파일럿이며, 모든 최종 답변의 품질을 체계적으로 평가하지 않음. 어느 쪽으로도 결론을 내리기에는 충분하지 않으며, 두 가지 구성의 전체 비용도 아직 계산하지 않음.
- 더 크고 다양한 질문 집합에서 역할 분담이 품질을 낮추지 않으면서 전체 응답을 일관되게 빠르게 하고 비용을 줄이며, 제공업체가 데이터 처리 검토를 통과하는 경우 재검토할 계획임.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요