État des lieux de l'ingénierie de l'IA | Datadog

« Au cours de l'année écoulée, l'IA générative a progressé à pas de géant. Les équipes ne se contentent plus d'un simple appel à un modèle pour créer un produit. Passant de l'expérimentation à la production, elles gèrent désormais des flottes de modèles, des frameworks d'orchestration, des appels à des outils, des prompts complexes, des mécanismes de reprise et des architectures multi-services. Avec cette nouvelle phase, les entreprises auraient dû rester en terrain connu : routage, gestion du cycle de vie, planification des capacités, contrôle des coûts et débogage dans des systèmes distribués. »

En réalité, les LLM introduisent un comportement inédit : tout changement du modèle, du prompt ou de la récupération peut faire évoluer la latence, les coûts et les taux d'erreur sans modification apparente du code. À l'heure du déploiement des agents en production, une évaluation rigoureuse et une discipline opérationnelle solide sont donc essentielles pour passer d'une démonstration convaincante à un système fiable.

Dans ce rapport, nous nous penchons sur l'ingénierie de l'IA en production en nous intéressant à la télémétrie des LLM recueillie auprès de plus d'un millier de clients Datadog. Nous avons constaté que les équipes disposent de réelles opportunités de renforcer l'efficience et la fiabilité de la gestion de leur flotte de modèles, la conception des agents, l'ingénierie contextuelle et l'optimisation des coûts. Néanmoins, l'identification et l'activation de ces leviers restent peu évidentes en raison d'un écosystème très dynamique.

De plus en plus, les entreprises multiplient les modèles

En analysant les données de télémétrie des agents LLM de nos clients, nous avons constaté que les entreprises font de plus en plus appel à plusieurs prestataires. 63 % font confiance à OpenAI, mais les modèles Gemini de Google et Claude d’Anthropic ont respectivement gagné 20 et 23 points en un an.

Il est important de noter que, si la part d’OpenAI a diminué sur un an, cela ne signifie pas que les modèles de l’entreprise sont moins utilisés dans l’absolu. C’est même l’inverse : le nombre de clients Datadog utilisant OpenAI a plus que doublé, même si d’autres fournisseurs ont connu une croissance plus rapide.

La diversification des modèles s’observe aussi au sein des entreprises. Elles sont plus de 70 % à utiliser au moins trois modèles, et le nombre d’entreprises qui s’appuient sur plus de six modèles a presque doublé. Plutôt que de se fier à un modèle unique par défaut, elles créent des portefeuilles de modèles pour utiliser le plus adapté à chaque charge de travail, selon les exigences de latence, de coût, de risque opérationnel et de tâche.

Cette multiplication des plateformes pose toutefois des difficultés en matière d’ingénierie de plateforme, de DevX et de conformité. Les équipes ont du mal à itérer rapidement. L’application uniforme des politiques de sécurité et de conformité est aussi plus complexe.

Les équipes qui prennent aujourd’hui une longueur d’avance considèrent l’inférence comme un pipeline et évaluent, comparent et modifient régulièrement le modèle adapté à chaque étape, au gré de la baisse des coûts et de l’évolution des performances. En exécutant une passerelle de modèles et en maintenant un framework d’évaluation opérationnalisé, elles peuvent sélectionner le modèle idéal pour chaque cas d’usage en fonction de la qualité des résultats, des coûts et de la latence attendus.

« La plupart des équipes utilisent désormais plusieurs modèles en production. Environ 70 % en exploitent au moins trois, et ce chiffre ne cesse d'augmenter. »

La dette technique des LLM s’alourdit à mesure que les équipes adoptent les nouvelles versions sans retirer les versions précédentes

En choisissant de multiplier les modèles, les entreprises s’exposent à la complexité de leur maintenance. Notre analyse suggère que les équipes testent rapidement les nouvelles versions de leurs modèles mais se montrent réticentes à retirer les anciennes versions déjà en production. Par conséquent, de nombreuses entreprises risquent d’ajouter des modèles plus rapidement qu’elles n’en suppriment.

Chaque modèle supplémentaire dans un système d’agents accroît la charge opérationnelle et alourdit les besoins d’évaluation. Les équipes doivent donc valider en continu les performances et gérer les régressions de l’ensemble de leurs modèles actifs.

Avec le doublement des frameworks d’agents, l’importance d’une télémétrie approfondie se renforce

Les frameworks comme LangChain et Pydantic AI accélèrent le développement en facilitant la création de patterns récurrents. D’après notre étude, leur adoption a presque doublé entre début 2025 et début 2026, passant de plus de 9 % des entreprises à presque 18 %. Les équipes ont besoin d’une télémétrie complète pour voir comment leurs agents s’exécutent.

Cet essor des frameworks se retrouve à l’identique dans toutes les structures.

Les équipes qui s’appuient sur le code boilerplate fourni par les frameworks peuvent se retrouver à démultiplier les agents. C’est pourquoi il est essentiel pour elles de collecter une télémétrie complète des agents pour comprendre leur exécution en conditions réelles.

« La prochaine vague de défaillances des agents ne sera pas liée à ce qu'ils ne savent pas faire mais à ce que les équipes ne peuvent pas voir. »

Les entreprises développent des agents fortement structurés, avec de longs prompts système, mais la mise en cache des prompts reste rare

D’après notre étude, 69 % des tokens d’entrée correspondaient à des prompts système. Les équipes doivent réduire ces prompts pour limiter la consommation de tokens et placer les composants réutilisables dans des modules pour les mettre en cache.

La mise en cache des prompts réduit les coûts et accélère l’exécution de manière très efficace. Toutefois, seuls 28 % des spans d’appels aux LLM présentent des tokens lus depuis le cache.

L’explosion de la fenêtre de contexte ouvre un nouveau potentiel à l’ingénierie du contexte

Avec la montée en puissance de l’IA agentique, les fenêtres de contexte des meilleurs modèles ont gagné plusieurs ordres de grandeur. Les équipes en profitent pour introduire dans les prompts davantage de contexte.

À mesure que la taille des prompts augmente, la latence et les coûts vont inévitablement poser problème.

La fiabilité des agents plafonne en raison des erreurs de quota, première cause d’échec des appels aux LLM

Nous avons examiné les échecs des appels aux LLM. 5 % de l’ensemble des spans d’appels aux LLM ont signalé une erreur. En mars 2026, 2 % avait renvoyé une erreur liée à des quotas. Ces chiffres suggèrent que les capacités limitées des fournisseurs de modèles compromettent la fiabilité des agents.

Les équipes doivent travailler sur l’ingénierie de capacité et les prompts et éviter les pics de longueur de boucle.

Les agents sont encore en grande majorité monolithiques

Selon notre étude, 59 % des requêtes d’applications agentiques ne passent qu’un appel à un service.

Perspectives

Les entreprises technologiques spécialisées en IA misent sur des systèmes multimodèles structurés, fortement contextualisés et de plus en plus distribués. Face à ces défis, les équipes doivent acquérir de nouvelles compétences pour maîtriser les budgets et le backpressure, prévoir des mécanismes de repli et orienter chaque tâche vers le modèle le plus adapté.