음성 AI의 성능은 듣는 것에 달려 있습니다
대부분의 사람들은 음성 AI를 떠올릴 때 에이전트가 무엇을 말하는지 생각합니다. 하지만 에이전트가 응답하려면 먼저 듣고 이해해야 하는데, 이는 대화형 AI에서 가장 어려운 문제 중 하나입니다.
누군가 은행이나 보험회사에 전화해 본인 확인을 하는 상황을 생각해 보세요. 이름은 "Caitlyn"입니다. 간단해 보이지만 이 이름은 Caitlyn, Kaitlyn, Katelyn, Caitlin 등 적어도 네 가지 방식으로 철자를 쓸 수 있습니다. 상담원이라면 계정을 확인해 철자를 확인한 뒤 넘어갈 것입니다. 반면 음성 전사 모델은 학습 데이터에 따라 통계적으로 가장 가능성이 높은 표기를 예측하는데, 그것이 맞을 수도 있고 아닐 수도 있습니다.
이름의 모호성을 해소하는 일은 상담원이 발신자의 말을 이해하려 할 때 마주하는 여러 과제 중 하나에 불과합니다. 또 다른 과제는 이러한 모델이 학습하는 영어 데이터에 거의 등장하지 않는 특정 기술 용어, 브랜드명 또는 업계 전문 용어를 인식하는 것입니다. 음절 하나를 잘못 듣는 것만으로도 성공과 실패가 갈릴 수 있으며, 대규모 환경에서는 이런 작은 전사 오류가 누적되어 시스템 전반의 실패로 이어집니다.
실시간으로 음성을 텍스트로 변환하는 전사 기능은 모든 통화의 기반입니다. 하지만 대부분의 플랫폼은 이를 범용 서비스처럼 다룹니다. 제공업체를 선택하고 오디오를 입력한 뒤, 최선의 결과를 기대하는 식입니다.
Sierra는 제공업체를 상황에 맞게 동적으로 선택하고, 고객 맥락을 반영하며, 70개 이상의 언어를 지원하고, 실제 환경의 다양한 변수에 적응하는 전사 플랫폼을 구축했습니다. 이를 통해 상담원 업무 효율성과 고객 만족도를 모두 높였습니다.
'그럭저럭 괜찮은' 전사의 문제점
표준 음성-텍스트 변환 API는 조용한 환경에서 표준 미국 영어를 잘 처리합니다. 하지만 실제 환경에서의 음성 AI는 훨씬 더 복잡합니다.
이러한 조건에서의 성능을 평가하기 위해 도메인별 고객 서비스 오디오를 사용해 내부 벤치마크를 구축했습니다. 통제된 환경에서 녹음된 깨끗한 음성을 기반으로 하는 일반적인 벤치마크와 달리, Sierra의 벤치마크는 상담원이 실제로 업무를 수행하는 환경을 반영합니다. 짧고 끊기는 발화, 배경 소음, 다양한 억양, 다국어 대화 등이 이에 포함됩니다. 이를 통해 실제 환경에서의 성능을 정량적으로 파악하고, 시간이 지나면서 이를 개선할 수 있는 기반을 마련합니다.
상담원이 “충분히 정확한” 전사본을 바탕으로 의도를 추론할 수 있는 다른 대화와 달리, 검증은 이분법적입니다. 정확히 일치해야 합니다.
두 철자의 발음이 같으면 모델은 추측할 수밖에 없습니다. 하지만 이는 쉬운 경우입니다. 학습 데이터에서 충분히 다뤄지지 않은 언어의 이름은 그럴듯한 음역조차 만들어 내지 못할 수 있습니다. 대화 도중 맥락이 바뀌면 문제는 더 어려워집니다. 예를 들어, 영어로 통화를 시작한 발신자가 이름 철자를 말하기 위해 스페인어로 바꿨다가 다시 영어로 돌아오는 경우입니다. 또는 대체로 영어로 진행되는 통화에서 상담원이 프랑스어 거리 이름을 기록해야 하는 경우도 있습니다.
표준 전사 파이프라인은 대화의 주제나 발신자가 다음에 어떤 말을 할지에 대한 맥락 없이 오디오를 개별적으로 처리합니다.
다중 제공업체 앙상블: 진실에 다가가기 위한 삼각 측량
모든 면에서 뛰어난 단일 전사 제공업체는 없습니다. 정확도는 언어, 지연 시간 제약, 오디오 품질, 말하기 방식에 따라 달라집니다. 동일한 오디오라도 모델마다 서로 다른 오류를 보입니다.
단일 제공업체를 선택하고 그 약점을 관리하는 대신, 여러 제공업체에 병렬로 질의한 뒤 결과를 결합하는 앙상블러를 구축했습니다.

앙상블러는 "최고의" 결과를 선택하거나 다수결을 따르지 않습니다. 대신 다음을 위해 맞춤 로직을 적용합니다:
- 출력 결과를 교차 검토하여 제공업체 간에 의견이 일치하거나 차이가 나는 부분을 파악합니다. 그리고
- 대화의 이전 차례에서 나온 신호를 반영합니다.
여러 제공업체를 함께 사용하면 안정성도 높아집니다. 음성 API는 부하가 걸리면 간혹 성능이 저하되거나 장애가 발생할 수 있으며, 단일 제공업체에 의존하면 일시적인 장애가 고객과의 상호작용 단절로 이어질 수 있습니다. 여러 전사 모델에 병렬로 요청하면 한 제공업체를 사용할 수 없게 되더라도 시스템은 계속 작동할 수 있습니다.
내부 벤치마크 결과, 앙상블을 사용하면 최고 성능의 단일 제공업체 대비 발화 오류율(발화에서 의미를 바꾸는 오류가 발생하는 빈도)을 평균 약 25% 줄일 수 있으며, 전사 개선 여지가 더 큰 언어에서는 최대 37%까지 줄일 수 있음을 확인했습니다.
모델 간의 불일치는 중요한 정보를 제공합니다. 여러 제공업체의 결과를 종합하고 대화 기록을 바탕으로 검증하여, 개별 시스템만으로는 얻을 수 없는 더 신뢰도 높은 기록을 생성합니다. 이는 제공업체마다 서로 다른 방식으로 오류가 발생하는 극단적인 상황에서 특히 강력합니다.
문맥 인식 전사: 검색 공간 축소
각 제공업체가 활용할 수 있는 정보가 많을수록 앙상블 성능도 향상됩니다. 당사 플랫폼은 대화 맥락을 전사 과정에 직접 반영합니다. 음성 에이전트가 발신자에게 이름을 확인해 달라고 요청할 때는 이미 확인해야 할 이름을 알고 있습니다. 고객 기록에 있기 때문입니다. 주소를 물을 때도 등록된 주소를 알고 있습니다. 전사 모델이 가능한 모든 발화 중에서 추측하게 하는 대신, 대화 맥락을 제공합니다.

금융 서비스 에이전트의 경우, 문맥 인식 전사를 통해 입력 검증률이 25% 이상 향상되었고, 그 결과 AI 에이전트가 쉽게 처리할 수 있었던 문제로 지원 담당자에게 연결되는 고객 수가 줄었습니다.
문맥 인식 전사를 모든 음성 발화에 적용한 후 Sierra 음성 에이전트의 해결률은 최대 1% 향상되었으며, 이는 주당 수만 건의 추가 문제 해결로 이어졌습니다. 또한 주요 전사 오류는 최대 15% 감소했습니다.
매끄러운 언어 전환
Sierra의 전사 플랫폼은 덴마크어, 타갈로그어, 광둥어를 비롯해 70개 이상의 언어와 방언을 지원합니다. 미국의 발신자는 영어로 대화하지만 이름과 주소는 스페인어입니다. 상담원은 일반 대화에는 영어 전사가, 이름과 주소에는 스페인어를 인식하는 전사가 필요하며, 그 후에는 다시 영어 전사가 필요합니다. 또는 홍콩의 발신자가 광둥어로 말하다가 기술 용어 때문에 영어로 전환한 뒤 다시 광둥어로 돌아갈 수도 있습니다.
대화 언어가 바뀌면 시스템은 오디오가 끊기거나 지연이 추가되지 않도록 해당 언어에 최적화된 다른 제공업체 조합을 선택해 전사 파이프라인을 동적으로 재구성합니다.
이는 한 언어로만 깔끔하게 이루어지지 않는 수많은 실제 대화에서 중요합니다. 또한 단일 플랫폼으로 수십 개 시장의 고객에게 서비스를 제공하는 글로벌 브랜드에도 중요합니다.
대화 이어가기: 잘 들리지 않을 때 묻기
문제가 전사 모델이 아니라 오디오에 있는 경우도 있습니다. 발신자가 시끄러운 환경에 있거나 전화 연결 상태가 좋지 않거나 너무 빨리 말했을 수 있습니다. 알아들을 수 없는 오디오로는 앙상블이나 컨텍스트 주입을 아무리 적용해도 신뢰할 수 있는 전사 결과를 얻을 수 없습니다.
그런 경우에는 사람처럼 명확히 확인하는 것이 최선입니다. "죄송합니다. 잘 알아듣지 못했습니다. 성을 철자로 말씀해 주시겠어요?"라고 묻는 편이 잘못된 이름을 자신 있게 확인한 뒤 발신자를 엉뚱한 곳으로 안내하는 것보다 훨씬 낫습니다. 대부분의 음성 AI 시스템은 전사 모델이 반환한 내용을 그대로 처리합니다. 당사 플랫폼은 조용히 실패하는 대신 자연스럽게 복구할 수 있도록 합니다.
이것이 중요한 이유
음성 AI는 들을 수 있는 만큼만 제 성능을 발휘합니다. 아무리 고도화된 언어 모델, 정교하게 설계된 워크플로, 자연스러운 음성이라도 상담원이 처음부터 발신자의 말을 정확히 이해하지 못한다면 모두 소용없습니다.
전사를 지능형 멀티 제공업체 플랫폼으로 구축해, 음성 AI의 가장 취약한 부분을 에이전트가 조치를 취하고 어려운 상황에서도 원활하게 복구하는 데 활용할 수 있는 인프라로 탈바꿈시켰습니다.
고객과의 대화를 Sierra에 맡기는 금융 서비스 기업, 의료 서비스 제공업체, 글로벌 브랜드에게 정확성은 필수입니다. 당사의 전사 플랫폼은 처음부터 정확한 대화를 가능하게 합니다.


