Zum Hauptinhalt springen

Der Lebenszyklus der Agentenentwicklung

In den vergangenen Jahrzehnten hat Software die Welt erobert, während die Weltwirtschaft digitalisiert wurde. Da die Welt zunehmend von Software abhängig ist, haben Entwicklerteams eine gemeinsame Vorgehensweise entwickelt, um Software robuster zu machen: den Softwareentwicklungslebenszyklus (SDLC). Der Standard-SDLC umfasst all die mühsam erarbeiteten Best Practices, die wir alle gemeinsam entwickelt haben, um sicherzustellen, dass die von uns verwendete Software zuverlässig, funktional und vertrauenswürdig ist.

KI-Agenten brechen alle Regeln, die wir von Software erwarten – und haben dabei auch den typischen Softwareentwicklungszyklus gesprengt.

Herkömmliche Software wird in einer regelbasierten und deterministischen Programmiersprache geschrieben, sodass dieselbe Eingabe zuverlässig dieselbe Ausgabe erzeugt. Agenten hingegen enthalten häufig auf Englisch formulierte Prompts für Large Language Models (LLMs) und sind zielorientiert sowie nicht deterministisch, sodass selbst geringfügige Änderungen an der Eingabe zu drastisch unterschiedlichen Ergebnissen führen.

Herkömmliche Software erfasst Nutzereingaben strukturiert über Formulare, Felder, Touchscreens und Tastaturen. Agenten kommunizieren in der Regel über natürliche Sprache – sowohl schriftlich als auch sprachlich – und ermöglichen so eine nahezu unendliche Zahl möglicher Interaktionen, die Agentenentwickler berücksichtigen müssen.

Herkömmliche Software ist dank des Mooreschen Gesetzes der vergangenen Jahrzehnte extrem schnell und kostengünstig. Über Amazon Web Services können Sie mehr als 10 Millionen Seitenaufrufe Ihrer Website kostenlos bereitstellen und sie Nutzern weltweit innerhalb von Millisekunden ausliefern. Agenten hingegen sind auf LLMs angewiesen, die aufgrund der Kosten für die Modellausführung oft langsam und um Größenordnungen teurer sind als herkömmliche Software. Würde jeder dieser 10 Millionen Seitenaufrufe GPT-4 aufrufen, könnte Ihre OpenAI-Rechnung leicht mehrere Hunderttausend Dollar betragen – und das Rendern jedes Seitenaufrufs würde mehrere Sekunden dauern.

Wenn Ihr herkömmlicher Softwareanbieter ein Upgrade veröffentlicht, können Sie in der Regel davon ausgehen, dass Ihre Software mit wenigen oder gar keinen Änderungen weiterhin funktioniert. Ist hingegen ein Upgrade für eines der LLMs verfügbar, auf denen Ihr KI-Agent basiert, werden die Karten neu gemischt. Prompts, die für ein Modell entwickelt wurden, liefern bei einem leistungsfähigeren Modell selten dieselben Ergebnisse. Wenn Sie das Modell zudem mit Ihren eigenen proprietären Daten feinabgestimmt haben, müssen Sie den Trainings- und Evaluierungsprozess von Grund auf neu starten.

Wir haben uns von einer Welt regelbasierter, deterministischer, schneller, günstiger und starrer Software mit gut verstandenen Abhängigkeiten und Upgrade-Prozessen hin zu einer Welt zielorientierter, nicht deterministischer, langsamer, teurer und flexibler Software bewegt, für deren Upgrades es keinerlei Change-Management-Prozesse gibt. Wie um alles in der Welt können wir aber unsere KI-Agenten zuverlässig machen? Und wie können wir Agenten zukunftssicher machen, damit sie von den Milliardeninvestitionen von Anbietern von Basismodellen wie OpenAI, Microsoft und Google profitieren?

Eine neue Art von Software erfordert einen neuen Entwicklungsansatz. Bei Sierra haben wir KI-Agenten in Industriequalität für Marken wie Sonos, WeightWatchers und SiriusXM entwickelt, die jeden Monat Millionen von Menschen betreuen. Mit Agent OS haben wir einen einzigartigen Entwicklungszyklus entwickelt, der Sierra-Agenten zuverlässig, testbar und äußerst leistungsfähig macht.

Dieser Beitrag fasst die Erkenntnisse zusammen, die wir auf diesem Weg gewonnen haben. Er richtet sich an ein technisches Publikum – an Entwicklerteams, die in ihren Unternehmen KI-Agenten entwickeln, sei es auf der Sierra-Plattform oder anderswo. Wir hoffen, dass Sie diese Erkenntnisse ebenso nützlich finden wie wir.

Sierra Agent Development Life Cycle

Entwicklung: Deklarative Ziele und Schutzschranken

Computer haben traditionell Automatisierung ermöglicht, indem sie die von Softwareentwicklern definierten Regeln schnell und zuverlässig ausführen. Dank der Fähigkeit großer Sprachmodelle zum Schlussfolgern kann Software Probleme auf kreative Weise lösen, die vom Entwickler nicht vorgegeben ist.

Um diese Fähigkeiten zum Schlussfolgern zu nutzen, können Entwickler benutzerdefinierte Modelle trainieren, ein Open-Source-Modell feinabstimmen oder eines der weit verbreiteten Basismodelle mithilfe von Prompt Engineering optimieren. Ein spezialisiertes Modell mit einem gut formulierten Prompt ermöglicht bei entsprechender Gestaltung anspruchsvolle Schlussfolgerungen: Was hat den Anstieg der Verkaufszahlen im letzten Quartal verursacht? Welches der drei verfügbaren Produkte würde die Bedürfnisse des Nutzers am besten erfüllen?

Das Problem vieler LLM-basierter Anwendungen ist ihre Unvorhersehbarkeit. In 90 % der Fälle wirken sie fast wie von Magie. In 10 % der Fälle halluzinieren sie allerdings und spielen verrückt – sie erfinden Flugpreise oder sogar Gerichtsurteile.

Wie können wir die Leistungsfähigkeit und Flexibilität von Agenten nutzen, ohne ihre (mitunter katastrophalen) Nachteile in Kauf zu nehmen? Unsere Lösung ist Sierra Agent SDK.

Sierra Agent SDK ermöglicht Entwicklern, mit einer deklarativen Programmiersprache leistungsstarke, flexible Agenten zu erstellen, die aus kombinierbaren Fähigkeiten bestehen und prozedurales Wissen ausdrücken – also wie Aufgaben erledigt werden sollen.

Dieses deklarative Modell ermöglicht Entwicklern, nicht nur die Ziele zu formulieren, die ihr Agent erreichen soll (z. B. dem Kunden bei der Rücksendung einer Bestellung zu helfen), sondern auch deterministische Schutzschranken festzulegen, die der Agent nicht überschreiten kann (z. B. Bestellungen können nur innerhalb von 30 Tagen nach dem Kauf zurückgegeben werden). Agenten, die auf Sierra basieren, sind kreativ. Doch in entscheidenden Momenten, etwa bei der Bearbeitung einer Bestellung oder bei einem Tarif-Upgrade, sorgen deterministische Schutzmechanismen dafür, dass Ihre Geschäftslogik strikt und zuverlässig durchgesetzt wird.

Mit Sierra Agent SDK können Entwickler das gewünschte Verhalten eines Agenten unabhängig von den zugrunde liegenden LLMs deklarieren. So können Sierra-Kunden äußerst komplexe Agenten erstellen, die sowohl wartbar als auch kombinierbar sind – und vermeiden dabei die undurchschaubaren, fast unvorstellbar komplexen Workflows von Agenten, die auf Prompt Engineering basieren. Und wenn neue Modelle wie GPT-4o verfügbar werden, können Agenten ohne Codeänderungen von diesen Verbesserungen profitieren.

Release: Unveränderliche Agenten-Snapshots

Moderne Softwareteams definieren ihre Infrastruktur als Code und speichern die Konfiguration ihrer Software und Hardware in der Versionsverwaltung, sodass eine gesamte Anwendung – von den Servern über die Datenbank bis hin zur Geschäftslogik selbst – atomar definiert ist. Dieser Ansatz ermöglicht es modernen Softwareteams, die Kapazität problemlos an die Nachfrage anzupassen, und ist vor allem einer der zentralen Mechanismen, mit denen sich Softwaresysteme zurücksetzen lassen, wenn etwas schiefgeht.

Das Verhalten von KI-Agenten wird nicht nur durch herkömmlichen Quellcode, sondern auch durch eine Reihe neuer Abhängigkeiten bestimmt, darunter Versionen von Basismodellen, Wissensdatenbanken für die Retrieval-Augmented Generation und Prompts.

Sierra Agent OS ermöglicht Entwicklern, Agenten-Releases so zu paketieren, dass all diese Abhängigkeiten atomar enthalten sind. Ähnlich wie bei Software, die nach dem Prinzip "Infrastructure as Code" erstellt wird, ist jedes Agenten-Release ein Snapshot. Dieser umfasst neben dem zugrunde liegenden Quellcode und den Prompts auch Modellversionsabhängigkeiten sowie eine unveränderliche Momentaufnahme des gesamten Wissens, das dem Agenten zur Verfügung steht.

Unveränderliche Agenten-Releases ermöglichen Sierra-Kunden, das Verhalten von Agenten bei Bedarf sofort zurückzusetzen. Sie eröffnen zudem leistungsstarke neue Möglichkeiten zum Experimentieren, darunter A/B-Tests mehrerer Releases, um neues Agentenverhalten im Hinblick auf Geschäftsziele zu messen.

Qualitätssicherung: Kontinuierliches, strukturiertes menschliches Feedback

Live-KI-Agenten können jede Woche Tausende oder sogar Millionen von Gesprächen führen. Um sie kontinuierlich zu verbessern, müssen wir ihre Leistung fortlaufend bewerten und dieses Feedback direkt in ihr Verhalten einfließen lassen.

Die Bewertung eines Gesprächs ist selten eine technische Aufgabe. Um zu beurteilen, ob ein KI-Agent korrekt gehandelt hat, braucht es eine Fachkraft, die die Spielregeln Ihres Unternehmens kennt, etwa aus dem Kundenservice oder Vertrieb.

Zur kontinuierlichen Qualitätssicherung umfasst die Sierra-Plattform den Experience Manager, eine leistungsstarke Plattform zur Überprüfung von Gesprächen, die sowohl technischen als auch nicht technischen Nutzer:innen zugänglich ist. Mithilfe des Experience Managers bewerten Customer-Experience-Teams täglich Gesprächsstichproben nach festen Kriterien und geben dazu Feedback. Hat der KI-Agent die richtige Entscheidung getroffen? Hat der KI-Agent die passende Sprache und den richtigen Ton verwendet? Fehlte dem Agenten das Wissen, das er zur Beantwortung einer Frage benötigte? Was hätte der Agent tun sollen, wenn eine Entscheidung falsch war?

Diese annotierten Gespräche bilden die Grundlage für die Verbesserung von Agenten. Da der Agent mit Agent SDK erstellt wurde, kennen wir den Gedankengang hinter jeder Agentenentscheidung, sodass die Plattform präzise ermitteln kann, warum sich ein Agent möglicherweise fehlerhaft verhalten hat. Und weil jedes Problem mit einem Gespräch annotiert ist, können Entwickler die Gespräche, die zu Problemen geführt haben, schnell und einfach simulieren. So lassen sich mit einem breiten Spektrum an Entwicklerwerkzeugen Verbesserungen für Agenten zügig bereitstellen.

Noch wichtiger ist, dass diese annotierten Gespräche die Grundlage für die Regressionstests des Agenten bilden – und damit sicherstellen, dass Ihr KI-Agent nie zweimal denselben Fehler macht.

Regressionstests für Gesprächsverläufe

Integrationstests sind bei komplexen Softwaresystemen bekanntermaßen schwierig, bei dialogorientierter KI jedoch aufgrund der nichtdeterministischen Natur der zugrunde liegenden Sprachmodelle noch schwieriger. Subtile Änderungen an Modellen oder Prompts, die ein Problem beheben, können leicht frühere Lösungen zunichtemachen, was zu einem endlosen Katz-und-Maus-Spiel beim Prompt Engineering und sehr frustrierten Kunden führt.

Agent OS ermöglicht native Agententests inklusive Gesprächssimulation.

Jede annotierte Unterhaltung im Experience Manager kann zu einem Unterhaltungstest werden – einer Momentaufnahme der Unterhaltung, die anhand von Mock-APIs simuliert wird, um das Problem zuverlässig zu reproduzieren. Wenn Customer-Experience-Teams Tausende von Unterhaltungen annotieren, stehen Entwicklern Tausende von Unterhaltungstests zur Verfügung, die während der Entwicklung und vor jedem Agenten-Release parallel ausgeführt werden können. So entsteht ein positiver Kreislauf zur Verbesserung der Agentenqualität.

Dies ermöglicht Agenten-Entwicklern eine testgetriebene Entwicklung, sodass die gesamte Testsuite zu einer robusten Regressionstestsuite zur Validierung von Agenten-Releases wird.

Immer wenn Sierra die zugrunde liegende Agent-OS-Plattform aktualisiert, führen wir nicht nur interne Qualitätsbewertungen durch, sondern auch Regressionstests für jeden unserer Live-Kunden, um sicherzustellen, dass die Plattformaktualisierungen nicht zu Rückschritten beim Verhalten der Agenten unserer Kunden führen.

Die Zukunft der Agentenentwicklung

Wenn es sich so anfühlt, als stünden wir bei der Entwicklung von KI-Agenten noch ganz am Anfang, dann deshalb, weil es genauso ist. Wir bewegen uns auf unbekanntem Terrain. Ausgereifte LLM-basierte Agenten gab es vor etwas mehr als einem Jahr schlicht noch nicht, ebenso wenig wie die Methoden und Tools zu ihrer Entwicklung und Erprobung. Es ist ein bisschen wie 1996: Das Internet existiert, und die Menschen bauen Websites und erste Webanwendungen, aber es gibt noch keinen LAMP-Stack. Bei Sierra entwickeln wir nicht nur produktionsreife Agenten für unsere Kunden, sondern erfinden auch neue Tools und Prozesse, um Agenten zuverlässiger, skalierbarer und wartbarer zu machen.

Wenn Sie mit Sierra einen Agenten für Ihr Unternehmen entwickeln möchten, würden wir gerne mit Ihnen zusammenarbeiten.

Den Sierra-Blog abonnieren

Bleiben Sie über neue Produktfunktionen, Kunden-Updates und mehr auf dem Laufenden.

Entdecken Sie, was Sierra für Sie tun kann

Erfahren Sie, wie Sierra Ihnen mit KI zu besseren Ergebnissen verhelfen kann.