Aller au contenu principal

Le cycle de vie de développement d’un agent

Au cours des dernières décennies, les logiciels sont devenus le moteur de l’économie mondiale à mesure que celle-ci se numérisait. Pour concevoir des applications toujours plus fiables, les ingénieurs ont progressivement établi une méthodologie commune : le cycle de développement logiciel (Software Development Lifecycle, ou SDLC). Ce cadre rassemble les bonnes pratiques qui permettent de créer des logiciels robustes, fiables et dignes de confiance.

L’émergence des agents IA remet profondément en question ce modèle. En bouleversant notre façon de concevoir les logiciels, ils nous obligent également à repenser le cycle de développement traditionnel.

Les logiciels classiques sont écrits dans des langages de programmation déterministes, où une même entrée produit toujours le même résultat. Les agents IA, eux, s’appuient sur des modèles de langage (LLM) guidés par des instructions rédigées en langage naturel et orientés vers des objectifs. Leur comportement n’est pas déterministe : de légères variations dans le contexte ou les données d’entrée peuvent conduire à des résultats très différents.

Les interactions évoluent elles aussi. Les logiciels traditionnels recueillent les informations au moyen d’interfaces structurées — formulaires, champs de saisie, boutons ou écrans tactiles. Les agents IA, en revanche, communiquent principalement en langage naturel, à l’écrit comme à l’oral. Ils doivent donc être capables de gérer une infinité de formulations, d’intentions et de situations, ce qui change profondément la manière de les concevoir, de les tester et de les faire évoluer.

Les logiciels traditionnels sont devenus extrêmement rapides et peu coûteux grâce aux progrès constants de la loi de Moore. Aujourd’hui, il est possible de servir plus de 10 millions de pages web depuis Amazon Web Services, partout dans le monde, en quelques millisecondes et pour un coût quasiment nul.

Les agents IA fonctionnent selon une logique très différente. Ils s’appuient sur des modèles de langage (LLM) dont les coûts d’inférence restent élevés et dont les temps de réponse se comptent souvent en secondes plutôt qu’en millisecondes. Si chacune de ces 10 millions de pages faisait appel à GPT-4, la facture OpenAI pourrait facilement atteindre plusieurs centaines de milliers de dollars.

Les mises à jour suivent elles aussi une logique différente. Avec un logiciel traditionnel, une nouvelle version est généralement conçue pour préserver la compatibilité avec les versions précédentes. Vous pouvez donc mettre à jour vos outils sans avoir à les reconfigurer en profondeur.

Avec les agents IA, rien n’est garanti. Lorsqu’un nouveau modèle devient disponible, les prompts optimisés pour la génération précédente produisent rarement exactement les mêmes résultats. Et si vous avez personnalisé ce modèle en le spécialisant sur vos propres données, vous devrez souvent reprendre l’ensemble du cycle d’entraînement, d’évaluation et de validation avant de pouvoir le déployer en production.

Nous sommes ainsi passés d’un monde où les logiciels étaient déterministes, rapides, peu coûteux et fondés sur des règles, avec des dépendances maîtrisées et des processus de mise à jour bien établis, à un monde où les agents sont orientés vers des objectifs, non déterministes, plus lents, plus coûteux et en constante évolution. Les pratiques de gestion du changement qui fonctionnaient pour les logiciels traditionnels ne suffisent plus.

Comment, dans ce contexte, concevoir des agents IA fiables ? Et comment bâtir des agents capables de tirer parti, dans la durée, des milliards de dollars investis par des entreprises comme OpenAI, Microsoft et Google dans les modèles de nouvelle génération ?

Un nouveau type de logiciel appelle une nouvelle façon de le concevoir. Chez Sierra, nous aidons les entreprises à développer et exploiter des agents IA de niveau industriel pour des marques comme Sonos, WeightWatchers ou SiriusXM, qui servent chaque mois des millions de consommateurs. Avec Agent OS, les équipes disposent d’un cycle de développement spécifiquement conçu pour les agents IA, afin de les rendre fiables, testables et performants à grande échelle.

Dans cet article, nous partageons les principaux enseignements que nous avons tirés de cette expérience. Il s’adresse avant tout aux ingénieurs qui conçoivent et exploitent des agents IA, qu’ils utilisent la plateforme Sierra ou d’autres solutions. Nous espérons que les pratiques présentées ici vous seront aussi utiles qu’elles l’ont été pour nous.

Sierra Agent Development Life Cycle

Développement : objectifs déclaratifs et garde-fous

Historiquement, l’informatique a permis aux équipes de mettre en place des processus en exécutant rapidement et de manière fiable les règles définies par les développeurs. Avec les capacités de raisonnement des grands modèles de langage, vos logiciels peuvent désormais résoudre des problèmes de façon créative, sans que chaque solution soit prédéfinie par le développeur.

Pour exploiter ces capacités de raisonnement, les développeurs peuvent entraîner des modèles personnalisés, ajuster un modèle open source, ou concevoir des prompts pour l’un des nombreux modèles de base disponibles. Lorsqu’il est bien conçu, un modèle spécialisé associé à un prompt pertinent permet un raisonnement avancé : Qu’est-ce qui a provoqué le pic de ventes au dernier trimestre ? Parmi les trois produits disponibles, lequel répond le mieux aux besoins de l’utilisateur ?

Le problème de nombreuses applications basées sur des LLM est leur caractère non déterministe. 90 % du temps, elles semblent remarquables. 10 % du temps, elles hallucinent et se dérèglent complètement, inventent des tarifs aériens ou même inventent de la jurisprudence.

Comment bénéficier de la puissance et de la flexibilité des agents sans en subir parfois les conséquences désastreuses ? Votre équipe peut y parvenir avec le Sierra Agent SDK.

L’Agent SDK de Sierra permet à vos développeurs d’utiliser un langage de programmation déclaratif pour créer des agents puissants et flexibles, en combinant des compétences modulaires qui décrivent précisément les procédures à suivre.

Ce modèle déclaratif permet aux développeurs de définir non seulement les objectifs que l’agent doit atteindre — par exemple, aider un client à retourner une commande — mais aussi les garde-fous déterministes qu’il ne peut jamais franchir, comme n’autoriser les retours que dans les 30 jours suivant l’achat.

Les agents conçus sur Sierra conservent ainsi toute la flexibilité et les capacités de raisonnement des LLM, tout en restant strictement encadrés lorsque cela est essentiel. Pour des actions sensibles, comme traiter une commande, effectuer un remboursement ou modifier une offre, ces garde-fous garantissent que les règles métier sont appliquées de manière fiable, cohérente et prévisible.

Le Sierra Agent SDK permet également de définir le comportement des agents indépendamment des modèles de langage sous-jacents. Les équipes peuvent ainsi concevoir des agents sophistiqués, tout en conservant une architecture modulaire, facile à maintenir et à faire évoluer, sans multiplier les workflows complexes ni dépendre d’un prompt engineering difficile à maîtriser.

Enfin, lorsque de nouveaux modèles deviennent disponibles, comme GPT-4o, vos agents peuvent en bénéficier sans qu’il soit nécessaire de modifier leur logique métier ou leur code.

Versionnement : des instantanés d’agents immuables

Les équipes d’ingénierie modernes gèrent leur infrastructure selon une approche Infrastructure as Code (IaC), où l’ensemble de la configuration des applications et de l’infrastructure est stocké dans un système de contrôle de version. Serveurs, bases de données, services et logique métier sont ainsi définis de manière atomique. Cette approche permet de faire évoluer facilement les systèmes en fonction de la demande et, surtout, de revenir rapidement à une version précédente en cas d’incident.

Les agents IA introduisent toutefois de nouvelles dépendances, qui vont bien au-delà du simple code source : versions des modèles de langage, prompts, bases de connaissances utilisées pour la génération augmentée par récupération (RAG), outils, politiques ou encore configurations de sécurité.

Avec Sierra Agent OS, chaque version d’un agent capture l’ensemble de ces éléments dans un instantané immuable. À l’image de l’Infrastructure as Code, une version d’agent ne contient pas uniquement son code et ses prompts : elle fige également la version du modèle sous-jacent ainsi qu’un instantané de toutes les connaissances auxquelles l’agent a accès.

Ces versions immuables offrent plusieurs avantages. Elles permettent d’abord de restaurer instantanément un comportement antérieur si une mise à jour ne produit pas les résultats attendus. Elles facilitent également l’expérimentation, en rendant possible des tests A/B entre différentes versions d’un même agent afin de mesurer précisément l’impact de nouveaux comportements sur les indicateurs métier.

Assurance qualité : un retour humain continu et structuré

Un agent conversationnel IA en production peut gérer des milliers, voire des millions de conversations chaque semaine. Pour continuer à améliorer ses performances, il est indispensable de l’évaluer en continu et d’intégrer ces retours directement dans son comportement.

Cette évaluation est avant tout un travail métier. Déterminer si un agent a pris la bonne décision ne relève pas uniquement de la technique : cela exige une connaissance approfondie des règles de l’entreprise et des attentes des clients. C’est pourquoi les responsables de l’expérience client, les équipes support ou les responsables commerciaux jouent un rôle essentiel dans l’amélioration continue des agents.

Pour faciliter ce travail, Sierra intègre Experience Manager, un outil d’analyse et d’audit des conversations conçu aussi bien pour les équipes techniques que pour les experts métier. Chaque jour, les équipes peuvent examiner des échantillons de conversations et les annoter afin de répondre à des questions essentielles : l’agent a-t-il pris la bonne décision ? A-t-il utilisé le ton et le niveau de langage appropriés ? Lui manquait-il une information pour répondre correctement ? Si la réponse était incorrecte, quel comportement aurait-il dû adopter ?

Ces conversations annotées deviennent le socle de l’amélioration continue de l’agent. Grâce au Sierra Agent SDK, chaque décision est associée à une trace de raisonnement complète. La plateforme peut ainsi identifier précisément l’origine d’un comportement incorrect. Les développeurs peuvent ensuite rejouer les conversations concernées, comprendre la cause du problème et déployer rapidement les améliorations appropriées.

Plus important encore, ces conversations annotées alimentent automatiquement les tests de régression. Chaque erreur corrigée devient un scénario de test supplémentaire, garantissant que l’agent ne reproduira pas le même comportement lors des versions suivantes.

Tests : tests de régression pour les conversations

Les tests d’intégration sont déjà l’un des défis les plus complexes du développement logiciel. Avec les agents conversationnels, ils deviennent encore plus difficiles en raison du caractère non déterministe des modèles de langage. Une modification de prompt ou un changement de modèle peut résoudre un problème… tout en en réintroduisant un autre. Les équipes se retrouvent alors dans une boucle sans fin de prompt engineering, au détriment de la qualité de l’expérience client.

Avec Agent OS, les tests font partie intégrante du cycle de développement grâce à la simulation de conversations.

Chaque conversation annotée dans Experience Manager peut être transformée en un test de conversation : un instantané fidèle de l’échange, rejoué dans un environnement simulé à l’aide d’API fictives afin de reproduire le comportement observé de manière fiable. Au fil du temps, à mesure que les équipes métier analysent et annotent des milliers de conversations, les développeurs disposent d’une bibliothèque de milliers de tests qu’ils peuvent exécuter automatiquement pendant le développement et avant chaque mise en production. Chaque nouveau retour client vient ainsi enrichir la couverture de test de l’agent.

Cette approche permet d’appliquer les principes du test-driven development (TDD) aux agents IA. Chaque problème identifié devient un nouveau test, et l’ensemble constitue une solide suite de tests de régression permettant de valider chaque nouvelle version de l’agent avant son déploiement.

Lorsque Sierra publie une nouvelle version d’Agent OS, nous ne nous contentons pas de réaliser des évaluations internes. Nous exécutons également la suite de tests de régression propre à chacun de nos clients afin de vérifier que les évolutions de la plateforme n’altèrent pas le comportement de leurs agents. Les améliorations de la plateforme bénéficient ainsi à tous, sans compromettre les comportements spécifiques développés pour chaque entreprise.

L’avenir du développement d’agents

Si vous avez l’impression que nous n’en sommes qu’aux débuts du développement des agents IA, c’est parce que c’est effectivement le cas. Nous explorons un territoire encore largement inconnu. Il y a un peu plus d’un an, les agents sophistiqués reposant sur des modèles de langage n’existaient pratiquement pas. Les méthodes, les outils et les bonnes pratiques permettant de les concevoir, de les tester et de les exploiter restent encore à inventer.

La situation rappelle les débuts du Web. Nous sommes en quelque sorte revenus en 1996 : Internet existe, les premières équipes construisent des sites et des applications web, mais les frameworks et les outils qui deviendront des standards n’ont pas encore émergé.

Chez Sierra, nous ne nous contentons pas de développer des agents IA de niveau industriel pour nos clients. Nous concevons également les outils, les méthodes et les processus qui permettront à leurs équipes de créer des agents plus fiables, plus évolutifs et plus faciles à maintenir.

Si vous souhaitez créer des agents IA pour votre entreprise avec Sierra, nous serions ravis d’échanger avec vous.

Abonnez-vous au blog Sierra

Recevez des notifications sur les nouvelles fonctionnalités produit, les actualités clients et bien plus encore.

Découvrez comment Sierra peut vous aider.

Découvrez comment créer des expériences client plus performantes et plus humaines avec l’IA.