Aller au contenu principal

Une IA vocale n’est efficace que si elle entend correctement

Quand on parle d’IA vocale, la plupart des gens se concentrent sur ce que dit l’agent. Pourtant, avant de pouvoir répondre, un agent doit d’abord comprendre ce qu’il entend. Et c’est précisément là que se situe l’un des plus grands défis de l’IA conversationnelle.

Prenons un exemple simple. Une personne appelle sa banque ou son assureur pour vérifier son identité. Son prénom est « Caitlyn ». À l’oral, rien de plus simple. Mais il existe plusieurs orthographes possibles : Caitlyn, Kaitlyn, Katelyn ou Caitlin. Un conseiller humain consulte le dossier, repère immédiatement la bonne orthographe et poursuit la conversation. Un modèle de transcription vocale, lui, choisit la variante qui lui paraît statistiquement la plus probable au regard de ses données d’entraînement. Elle sera parfois correcte… et parfois non.

Les noms propres ne sont qu’un exemple parmi beaucoup d’autres. Les agents doivent aussi reconnaître des références produits, des noms de marque, des acronymes, des termes techniques ou un jargon métier qui apparaissent rarement dans les données utilisées pour entraîner les modèles. Une seule syllabe mal transcrite peut suffire à faire échouer une authentification, une commande ou une résolution de problème. À grande échelle, ces erreurs apparemment anodines finissent par avoir un impact réel sur l’expérience client.

La transcription — c’est-à-dire la conversion de la parole en texte en temps réel — constitue le socle de chaque conversation vocale. Pourtant, la plupart des plateformes la considèrent comme un simple service interchangeable : elles choisissent un fournisseur de transcription, lui transmettent le flux audio et espèrent obtenir le bon résultat.

Chez Sierra, nous avons adopté une approche différente. Notre plateforme de transcription sélectionne dynamiquement le moteur le plus adapté à chaque conversation, enrichit la transcription avec le contexte propre à votre entreprise, prend en charge plus de 70 langues et s’adapte en permanence aux conditions réelles d’utilisation. Résultat : des transcriptions plus fiables, des agents plus performants et une meilleure expérience pour vos clients.

Le problème d’une transcription « suffisamment bonne »

Les API de reconnaissance vocale standard offrent de bonnes performances lorsqu’il s’agit de transcrire un anglais américain standard dans un environnement calme. Mais les conversations que traitent les agents IA en production sont bien plus complexes.

Pour mesurer ces performances dans des conditions réelles, nous avons constitué chez Sierra un référentiel interne à partir de conversations issues du service client. Contrairement aux jeux de données traditionnels, composés d’enregistrements propres réalisés dans des environnements contrôlés, notre référentiel reflète la réalité du terrain : phrases incomplètes, hésitations, bruit de fond, grande diversité d’accents et conversations multilingues. Il nous permet de mesurer objectivement les performances de nos systèmes et de les améliorer en continu.

Dans de nombreuses conversations, une transcription « suffisamment bonne » suffit à un agent IA pour comprendre l’intention du client. En revanche, certaines tâches exigent une exactitude parfaite. C’est notamment le cas lors d’une vérification d’identité, où une seule erreur de transcription peut faire échouer tout le processus.

Lorsque plusieurs orthographes correspondent à une même prononciation, un modèle de reconnaissance vocale doit faire une estimation. Mais ce n’est que la partie visible du problème. Les difficultés sont encore plus grandes lorsqu’il s’agit de noms issus de langues peu représentées dans les données d’entraînement, pour lesquels le modèle peut être incapable de proposer une translittération correcte.

La situation se complique encore lorsque le contexte linguistique évolue au cours d’un même appel. Un client peut commencer la conversation en anglais, passer à l’espagnol pour épeler son nom, puis revenir à l’anglais. Ou encore devoir dicter une adresse française au milieu d’un échange en anglais. Ces changements de contexte sont fréquents dans les centres de contact internationaux.

Les solutions de transcription traditionnelles traitent pourtant chaque flux audio de manière isolée. Elles ne tiennent ni compte du contexte de la conversation, ni de ce que l’agent sait déjà du client, ni de ce qu’il est le plus probable qu’il entende ensuite.

Assemblage multi-fournisseurs : croiser les modèles pour se rapprocher de la meilleure transcription

Aucun moteur de transcription n’est performant dans toutes les situations. La qualité des résultats varie selon la langue, la qualité de l’audio, la latence requise ou encore le style de parole. Et surtout, chaque modèle commet des erreurs différentes face à un même enregistrement.

Plutôt que de dépendre d’un fournisseur unique et d’en subir les limites, nous avons développé un moteur d’assemblage qui interroge plusieurs moteurs de transcription en parallèle, puis combine intelligemment leurs résultats.

Diagram illustrating Sierra Transcription Ensembling: Caller Audio goes to Providers A, B, and C, whose outputs feed into an Ensembler with Conversation Context to produce a Final Transcript.

L’assembleur ne se contente ni de sélectionner la transcription jugée « la meilleure », ni d’appliquer un simple vote majoritaire. Il s’appuie sur une logique de décision spécialement conçue pour :

  • recouper les résultats de plusieurs moteurs de transcription afin d’identifier les points de convergence et de divergence ;
  • intégrer le contexte des échanges précédents afin d’interpréter correctement la conversation en cours.

Cette approche améliore également la résilience de la plateforme. Les services de reconnaissance vocale peuvent voir leurs performances se dégrader ou devenir temporairement indisponibles sous l’effet de la charge. En s’appuyant sur plusieurs fournisseurs en parallèle, la plateforme continue de fonctionner même si l’un d’entre eux rencontre une panne ou une baisse de qualité.

Sur nos benchmarks internes, cette approche permet de réduire en moyenne d’environ 25 % le taux d’erreur sur les énoncés — c’est-à-dire la proportion de phrases contenant une erreur qui en modifie le sens — par rapport au meilleur moteur de transcription utilisé seul. Pour certaines langues, où les marges de progression sont plus importantes, cette amélioration atteint 37 %.

Les divergences entre les modèles constituent d’ailleurs une source d’information précieuse. En confrontant plusieurs hypothèses de transcription et en les interprétant à la lumière du contexte conversationnel, la plateforme produit des transcriptions plus fiables que n’importe quel moteur pris isolément. Cette approche est particulièrement efficace dans les cas les plus difficiles, où chaque fournisseur échoue… mais de manière différente.

Transcription contextuelle : réduire l’espace des possibles

L’assemblage de plusieurs moteurs de transcription est d’autant plus efficace qu’ils disposent d’un contexte riche. C’est pourquoi notre plateforme injecte directement le contexte de la conversation dans le processus de transcription.

Lorsqu’un agent vocal demande à un client de confirmer son nom, cette information figure généralement déjà dans son dossier. De même, lorsqu’il lui demande de confirmer une adresse, un numéro de contrat ou toute autre donnée connue, la réponse attendue existe déjà dans les systèmes de l’entreprise.

Plutôt que de laisser le moteur de transcription choisir parmi une infinité de possibilités, nous lui fournissons ce contexte en amont. L’espace des interprétations possibles est ainsi considérablement réduit, ce qui améliore la précision des transcriptions, notamment pour les noms propres, les adresses, les références produits et les autres informations spécifiques à votre activité.

A dark screen shows speech recognition results comparing accuracy with and without context. An agent asks for a name, which the caller speaks. Without context, it's transcribed as "Kaitlyn." With context, it's "Caitlyn," which matches the customer record.

Pour les agents déployés dans les services financiers, la transcription contextuelle a permis d’augmenter de plus de 25 % les taux de vérification des informations. Concrètement, cela signifie que beaucoup moins d’appels doivent être transférés à un conseiller humain, l’agent IA étant désormais capable de traiter de manière autonome des demandes qui nécessitaient auparavant une intervention.

Après avoir généralisé la transcription contextuelle à l’ensemble des conversations vocales, nos clients constatent jusqu’à 1 % de résolutions supplémentaires — soit des dizaines de milliers de demandes traitées chaque semaine — ainsi qu’une réduction pouvant atteindre 15 % des erreurs de transcription ayant un impact sur le sens de la conversation.

Basculement fluide entre les langues

La plateforme de transcription de Sierra prend en charge plus de 70 langues et dialectes, du danois au tagalog, en passant par le cantonais.

Les conversations réelles passent fréquemment d’une langue à l’autre. Un client peut échanger en anglais, épeler son nom ou son adresse en espagnol, puis reprendre la conversation en anglais. À Hong Kong, un appel peut commencer en cantonais, passer brièvement à l’anglais pour évoquer un terme technique, avant de revenir au cantonais.

Lorsque la langue change, la plateforme adapte automatiquement le pipeline de transcription. Elle sélectionne en temps réel les moteurs les plus performants pour la langue concernée, sans interrompre la conversation ni ajouter de latence perceptible.

Cette capacité est essentielle pour les conversations multilingues du quotidien. Elle l’est tout autant pour les entreprises internationales, qui accompagnent des clients dans des dizaines de pays depuis une plateforme unique, sans avoir à compromettre la qualité de la transcription ou de l’expérience client.

Relance conversationnelle : demander lorsqu’il y a un doute

Parfois, le problème ne vient pas du moteur de transcription, mais de l’audio lui-même. Le client appelle depuis un environnement bruyant, la qualité de la ligne est médiocre ou il parle trop vite. Dans ces situations, aucun modèle, aussi performant soit-il, ne peut produire une transcription fiable à partir d’un signal audio de mauvaise qualité.

La meilleure solution consiste alors à faire ce qu’un conseiller humain ferait naturellement : demander une précision.

« Je suis désolé, je n’ai pas bien compris. Pourriez-vous épeler votre nom de famille, s’il vous plaît ? »

Cette approche offre une bien meilleure expérience que de valider une transcription erronée et d’engager la conversation sur une mauvaise piste. La plupart des plateformes de voix IA se contentent pourtant d’accepter la sortie du moteur de transcription, même lorsqu’elle est incertaine. Avec Sierra, les agents savent reconnaître leurs limites et relancer la conversation lorsque cela est nécessaire, plutôt que de laisser une erreur se propager.

Pourquoi c’est important

Une IA vocale n’est performante que si elle comprend correctement son interlocuteur. Le meilleur modèle de langage, le parcours conversationnel le mieux conçu ou la voix la plus naturelle ne servent à rien si l’agent ne comprend pas correctement le client dès les premiers instants de l’échange.

En faisant de la transcription une plateforme intelligente, capable de combiner plusieurs moteurs, d’exploiter le contexte métier et de demander des clarifications lorsque nécessaire, Sierra transforme l’un des maillons les plus fragiles de l’IA vocale en une infrastructure robuste. Les agents peuvent ainsi continuer à agir efficacement, même lorsque les conditions sont loin d’être idéales.

Pour les institutions financières, les acteurs de la santé et les entreprises internationales qui confient leurs conversations clients à Sierra, la précision n’est pas un simple indicateur de performance : c’est une exigence. Votre équipe s’appuie sur une plateforme de transcription qui garantit que chaque conversation démarre sur des bases solides.

Abonnez-vous au blog Sierra

Recevez des notifications sur les nouvelles fonctionnalités produit, les actualités clients et bien plus encore.

Découvrez comment Sierra peut vous aider.

Découvrez comment créer des expériences client plus performantes et plus humaines avec l’IA.