Zum Hauptinhalt springen

Sprachkanal-KI ist nur so gut wie das, was sie hört

Wenn die meisten Menschen an Sprachkanal-KI denken, denken sie daran, was der Agent sagt. Doch bevor ein Agent antworten kann, muss er hören – und genau das ist, wie sich herausstellt, eines der schwierigsten Probleme der dialogorientierten KI.

Stellen Sie sich vor, jemand ruft bei seiner Bank oder Versicherung an, um seine Identität zu bestätigen. Ihr Vorname ist „Caitlyn“. Das klingt zunächst einfach – doch es gibt mindestens vier Schreibweisen dieses Namens: Caitlyn, Kaitlyn, Katelyn oder Caitlin. Ein Supportmitarbeiter würde einen Blick auf das Konto werfen, die Schreibweise prüfen und weitermachen. Ein Sprachtranskriptionsmodell hingegen sagt auf Grundlage seiner Trainingsdaten die statistisch wahrscheinlichste Variante voraus, die korrekt sein kann – oder auch nicht.

Die Unterscheidung von Namen ist nur eine von mehreren Herausforderungen, vor denen Agenten stehen, wenn sie verstehen wollen, was Anrufer sagen. Eine weitere besteht darin, spezifische Fachbegriffe, Markennamen oder Branchenjargon zu erkennen, die in den englischsprachigen Daten, mit denen diese Modelle trainiert werden, nur selten vorkommen. Eine einzige falsch verstandene Silbe kann über Erfolg oder Misserfolg entscheiden und im großen Maßstab führen diese kleinen Transkriptionsfehler zu systematischem Versagen.

Die Transkription – die Umwandlung gesprochener Sprache in Echtzeit in Text – bildet die Grundlage jedes Anrufs. Dennoch behandeln die meisten Plattformen sie wie eine Massenware: Anbieter auswählen, Audio einspeisen und auf das Beste hoffen.

Bei Sierra haben wir eine Transkriptionsplattform entwickelt, die dynamisch zwischen verschiedenen Anbietern routet, den Kontext der Kundschaft einbezieht, mehr als 70 Sprachen unterstützt und sich an die vielfältigen Schwankungen der realen Welt anpasst. So steigert sie sowohl die Effektivität der Agenten als auch die Kundenzufriedenheit.

Das Problem mit Transkriptionen nach dem Motto „gut genug“

Standard-APIs zur Spracherkennung funktionieren bei amerikanischem Standardenglisch in ruhiger Umgebung gut. Doch Sprach-KI in der Praxis ist deutlich komplexer.

Um die Leistung unter diesen Bedingungen zu bewerten, haben wir einen internen Benchmark mit branchenspezifischen Kundenservice-Audiodaten erstellt. Im Gegensatz zu typischen Benchmarks, die auf sauberen Aufnahmen in kontrollierten Umgebungen basieren, bildet der Benchmark von Sierra die Bedingungen ab, unter denen Mitarbeitende tatsächlich arbeiten: kurze, abgehackte Äußerungen, Hintergrundgeräusche, unterschiedlichste Akzente und mehrsprachige Gespräche. So erhalten wir einen quantitativen Einblick in die Leistung unter realen Bedingungen und eine Grundlage, sie im Laufe der Zeit zu verbessern.

Anders als bei anderen Gesprächen, bei denen Agenten die Absicht aus einer „hinreichend guten“ Transkription ableiten können, ist die Verifizierung binär: Sie erfordert eine exakte Übereinstimmung.

Wenn beide Schreibweisen gleich klingen, rät das Modell. Doch das ist ein einfacher Fall. Bei Namen aus Sprachen, die in den Trainingsdaten unterrepräsentiert sind, kann das Modell möglicherweise nicht einmal eine plausible Transliteration erzeugen. Wechselt der Kontext mitten im Gespräch, wird die Herausforderung größer. Zum Beispiel bei einer anrufenden Person, die auf Englisch beginnt, ins Spanische wechselt, um ihren Namen zu buchstabieren, und dann wieder ins Englische zurückwechselt. Oder bei einem Agenten, der in einem ansonsten englischsprachigen Gespräch einen französischen Straßennamen erfassen muss.

Herkömmliche Transkriptionspipelines verarbeiten Audio isoliert, ohne zu berücksichtigen, worum es im Gespräch geht oder was der Anrufer voraussichtlich als Nächstes sagen wird.

Ensemblebildung mit mehreren Anbietern: Die Wahrheit durch Triangulation eingrenzen

Kein einzelner Transkriptionsanbieter ist in allen Bereichen gut. Die Genauigkeit hängt von Sprache, Latenzanforderungen, Audioqualität und Sprechstil ab. Verschiedene Modelle machen bei derselben Audiodatei unterschiedliche Fehler.

Statt uns für einen Anbieter zu entscheiden und mit dessen Schwächen umzugehen, haben wir einen Aggregator entwickelt, der mehrere Anbieter parallel abfragt und ihre Ergebnisse kombiniert.

Diagram illustrating Sierra Transcription Ensembling: Caller Audio goes to Providers A, B, and C, whose outputs feed into an Ensembler with Conversation Context to produce a Final Transcript.

Der Aggregator wählt weder das „beste“ Ergebnis aus noch richtet er sich nach der Mehrheitsentscheidung. Stattdessen wendet er benutzerdefinierte Logik an, um:

  • die Ergebnisse abzugleichen und zu ermitteln, wo die Anbieter übereinstimmen oder voneinander abweichen; und
  • Hinweise aus früheren Gesprächsrunden zu berücksichtigen.

Der Einsatz mehrerer Anbieter erhöht zudem die Zuverlässigkeit. Sprach-APIs können unter Last gelegentlich an Leistung verlieren oder ausfallen und die Abhängigkeit von einem einzigen Anbieter kann aus einem vorübergehenden Ausfall eine gestörte Kundeninteraktion machen. Durch die parallele Abfrage mehrerer Transkriptionsmodelle kann das System weiterarbeiten, selbst wenn ein Anbieter nicht verfügbar ist.

Unsere internen Benchmarks zeigen, dass eine solche Ensemblebildung die Äußerungsfehlerrate (wie häufig eine Äußerung einen sinnverändernden Fehler enthält) gegenüber dem besten einzelnen Anbieter im Durchschnitt um etwa 25 % und bei Sprachen mit größerem Verbesserungspotenzial bei der Transkription um bis zu 37 % senken kann.

Unterschiede zwischen Modellen sind aufschlussreich. Indem wir Ergebnisse verschiedener Anbieter abgleichen und den Gesprächsverlauf berücksichtigen, erstellen wir Transkripte, die zuverlässiger sind als jedes einzelne System. Das ist besonders unter schwierigen Bedingungen hilfreich, wenn Anbieter auf unterschiedliche Weise versagen.

Kontextbezogene Transkription: Eingrenzung des Suchraums

Ensemblebildung wird leistungsfähiger, wenn jeder Anbieter mit besseren Informationen arbeiten kann. Unsere Plattform speist den Gesprächskontext direkt in den Transkriptionsprozess ein. Wenn ein Sprachagent einen Anrufer bittet, seinen Namen zu bestätigen, wissen wir bereits, welchen Namen wir erwarten – er ist im Kundendatensatz hinterlegt. Wenn wir nach einer Adresse fragen, kennen wir die hinterlegte Adresse. Statt das Transkriptionsmodell aus dem gesamten Spektrum möglicher Äußerungen raten zu lassen, geben wir ihm den Kontext aus dem Gespräch.

A dark screen shows speech recognition results comparing accuracy with and without context. An agent asks for a name, which the caller speaks. Without context, it's transcribed as "Kaitlyn." With context, it's "Caitlyn," which matches the customer record.

Bei unseren KI-Agenten für Finanzdienstleistungen verbesserte die kontextbezogene Transkription die Eingabevalidierungsraten um über 25 % – dadurch mussten deutlich weniger Anrufer an einen Support-Mitarbeiter weitergeleitet werden, um ein Problem zu lösen, das der KI-Agent problemlos hätte bewältigen sollen.

Durch die Ausweitung der kontextsensitiven Transkription auf alle Gesprächsbeiträge konnten die Sierra-Sprachagenten ihre Lösungsquoten um bis zu 1 % steigern – das entspricht Zehntausenden zusätzlichen gelösten Anliegen pro Woche – und schwerwiegende Transkriptionsfehler um bis zu 15 % reduzieren.

Nahtlos zwischen Sprachen wechseln

Die Transkriptionsplattform von Sierra unterstützt über 70 Sprachen und Dialekte – von Dänisch über Tagalog bis Kantonesisch. Ein Anrufer in den Vereinigten Staaten spricht Englisch, hat jedoch einen spanischen Namen und eine spanische Adresse. Der Mitarbeiter benötigt für das allgemeine Gespräch eine englische Transkription, für Name und Adresse eine spanischsprachige Transkription und anschließend wieder eine englische. Oder ein Anrufer in Hongkong beginnt auf Kantonesisch, wechselt für einen Fachbegriff ins Englische und dann wieder zurück ins Kantonesische.

Wenn sich die Gesprächssprache ändert, konfiguriert das System die Transkriptionspipeline dynamisch neu und wählt eine andere, für diese Sprache optimierte Kombination von Anbietern aus – ohne Audioverluste oder zusätzliche Latenz.

Das ist wichtig für die vielen Gespräche im Alltag, die nicht klar auf eine Sprache beschränkt sind. Es ist auch wichtig für globale Marken, die Menschen in Dutzenden von Märkten über eine einzige Plattform bedienen.

Umgang mit Verständnisschwierigkeiten: Nachfragen, wenn etwas nicht verstanden wird

Manchmal liegt das Problem nicht am Transkriptionsmodell, sondern an der Audioqualität. Die anrufende Person befindet sich in einer lauten Umgebung, hat möglicherweise eine schlechte Telefonverbindung oder hat zu schnell gesprochen. Auch durch den Einsatz mehrerer Modelle oder zusätzlichen Kontext lässt sich aus unverständlichem Audio keine zuverlässige Transkription erzeugen.

In solchen Fällen ist es am besten, wie ein Mensch um Klärung zu bitten. „Entschuldigung, ich habe Sie nicht ganz verstanden. Könnten Sie bitte Ihren Nachnamen buchstabieren?“ ist deutlich besser, als selbstsicher den falschen Namen zu bestätigen und den Anrufer auf den falschen Weg zu schicken. Die meisten Sprachkanal-KI-Systeme verarbeiten allerdings einfach das, was das Transkriptionsmodell liefert. Unsere Plattform hingegen ermöglicht eine elegante Fehlerbehandlung statt unbemerkt Fehler zu produzieren.

Warum das wichtig ist

Sprachkanal-KI ist nur so gut wie das, was sie hört. Das fortschrittlichste Sprachmodell, der sorgfältigst konzipierte Workflow, die natürlichste Stimme – all das zählt nicht, wenn ein Agent nicht von Anfang an genau verstehen kann, was der Anrufer sagt.

Indem wir die Transkription als intelligente Plattform mit mehreren Anbietern aufgebaut haben, haben wir die Schwachstellen von Sprachkanal-KI in eine Infrastruktur verwandelt, auf die sich unsere Agenten verlassen können, um auch unter schwierigen Bedingungen souverän zu handeln.

Für Finanzdienstleistungsunternehmen, Gesundheitsdienstleister und globale Marken, die Sierra ihre Kundengespräche anvertrauen, ist Genauigkeit unerlässlich. Unsere Transkriptionsplattform sorgt dafür, dass jedes Gespräch auf einer soliden Grundlage beginnt.

Den Sierra-Blog abonnieren

Bleiben Sie über neue Produktfunktionen, Kunden-Updates und mehr auf dem Laufenden.

Entdecken Sie, was Sierra für Sie tun kann

Erfahren Sie, wie Sierra Ihnen mit KI zu besseren Ergebnissen verhelfen kann.