Agents et ingénierie · Septembre 2026

Agents IA en production : moins d'autonomie, plus d'ingénierie

En 2026, les agents font un vrai travail, mais beaucoup de projets meurent au stade pilote. Ce qui distingue ceux qui arrivent en production n'est pas le modèle : c'est le périmètre, la conception des outils, l'évaluation, les plafonds de coût et la sécurité.

>40 % des projets agentiques annulés d'ici fin 2027 (Gartner)20,6 % des workflows longs réussis par le meilleur agent (OSWorld 2.0)57 % des équipes interrogées avec des agents en production (LangChain)
En bref

Gartner prévoit que plus de 40 % des projets d'IA agentique seront annulés d'ici fin 2027 et, sur OSWorld 2.0, un banc d'essai de workflows professionnels longs, le meilleur agent n'a mené au bout que 20,6 % des tâches en juin 2026. Pourtant, 57 % des 1 340 praticiens interrogés par LangChain ont déjà des agents en production.

Notre recommandation : commencez par le plus simple qui fonctionne, souvent un workflow fixe, gardez un périmètre étroit et concevez pour l'échec, avec des outils idempotents, la confirmation de l'irréversible, des budgets, des évaluations, un bac à sable et des journaux en ajout seul. L'injection de prompt reste non résolue : l'isolation doit être imposée par l'infrastructure, pas par le modèle.

Workflow ou agent : commencez par le plus simple qui fonctionne

Beaucoup de problèmes vendus comme des agents se règlent mieux avec un workflow fixe.

Dans un workflow, votre code fixe les étapes et le modèle traite chacune : classer, extraire, rédiger, vérifier. Dans un agent, le modèle choisit l'étape suivante et appelle des outils en boucle jusqu'à juger la tâche terminée. Le workflow est prévisible, peu coûteux et testable ; l'agent traite les tâches ouvertes, au prix de la variabilité, de la latence et d'une surface d'attaque plus large.

Notre règle : d'abord un seul appel, puis un workflow si les étapes sont connues, et un agent seulement si le chemin dépend de ce que le système découvre, comme l'analyse d'un incident. Même alors, encadrez-le par un workflow, avec des contrôles entre étapes et une personne à l'étape irréversible. Pour le logiciel, voir les agents de code.

Règle pratique de Slash, septembre 2026, avec périmètre étroit, évaluation et confirmation humaine de l'irréversible.
Cas d'usageAdéquationPourquoi
Code : corrections, tests, migrationsBonneLes tests et la revue valident le résultat
Recherche et analyse sourcéeBonneLecture seule ; une personne exploite le résultat
Tri du support et brouillonsBonne, avec limitesRemboursements et exceptions vont à une personne
Saisie entre systèmes connusWorkflow d'abordÉtapes connues ; un agent n'ajoute que de la variabilité
Tâches longues multi-applications, via l'écranFaible20,6 % de réussite complète sur OSWorld 2.0
Paiements, contrats, suppressions sans revueNonUne erreur coûte plus qu'elle ne fait gagner

Les huit briques d'un agent en production

Le modèle n'est qu'une brique sur huit, et rarement la première à céder.

Architecture de référence dont nous partons ; chaque brique a un responsable.
BriqueRôlePar défaut en productionDéfaillance évitée
ModèleChoisit l'action suivanteEffort fixé par route, repli chez un autre fournisseurDérive des coûts, dépendance
OutilsAgissent sur les systèmesPeu nombreux, typés, idempotents, moindre privilègeActions erronées ou en double
Mémoire et étatContexte entre étapesRegistre explicite, historique en ajout seulContraintes oubliées, boucles
PlanificationDécoupe la tâchePlan vérifié par le code, pas à pasTâche déclarée finie trop tôt
Garde-fousFiltrent entrées, sorties et actionsRègles dans le code, pas seulement dans le promptFuites de données, actions dangereuses
Humain dans la boucleValide les étapes sensiblesConfirmation des seules actions irréversiblesErreurs coûteuses, lassitude des validations
ObservabilitéEnregistre chaque étapeTraces, journaux en ajout seul, évaluations par échantillonPannes inexpliquées
BudgetsPlafonnent tokens, étapes, temps et argentPlafonds par tâche, arrêt propreBoucles et factures incontrôlées

L'état est souvent sous-dimensionné : le harnais d'Anthropic pour les agents de longue durée tient un fichier de progression et des commits git, pour que chaque session reprenne là où la précédente s'est arrêtée. La supervision aussi : dans son étude sur Claude Code (février 2026), les utilisateurs expérimentés approuvaient tout automatiquement dans plus de 40 % des sessions, alors que 0,8 % environ des actions semblaient irréversibles. Ne faites confirmer que ce qui compte. Voir aussi les garde-fous en production.

Ce que disent les données sur l'adoption et l'échec

Équipes techniques et directions racontent des histoires différentes ; les deux sont vraies.

Échec. En juin 2025, Gartner a prédit que plus de 40 % des projets d'IA agentique seront annulés d'ici fin 2027, en raison des coûts, d'une valeur métier floue ou de contrôles des risques insuffisants. Le cabinet estimait aussi que seuls 130 environ des milliers de fournisseurs d'IA agentique sont réels ; il appelle le reste de l'agent washing.

Le rapport de MIT NANDA (juillet 2025) constatait que 95 % des organisations ne tiraient aucun retour mesurable de l'IA générative malgré 30 à 40 milliards de dollars de dépenses des entreprises, et que 5 % seulement des outils sur mesure arrivaient en production. Son explication : un déficit d'apprentissage, des outils qui ne retiennent pas les retours et ne s'améliorent pas.

Production. Dans l'enquête de LangChain auprès de 1 340 praticiens (fin 2025), 57 % avaient des agents en production. La qualité était le premier frein (32 %) ; 89 % disposaient d'observabilité, mais 52,4 % seulement pratiquaient des évaluations hors ligne. C'est l'enquête d'un éditeur auprès d'un public engagé : lisez-la comme un plafond.

Fiabilité. METR mesure la durée des tâches que les modèles réussissent une fois sur deux : elle double environ tous les quatre mois depuis 2023. La fiabilité suit avec retard : Claude Opus 4.6 atteignait environ 12 heures à 50 % de réussite, mais environ 70 minutes à 80 %.

Notre lecture

Les agents arrivent en production quand la tâche est étroite, mesurable et réversible. Ils calent au stade pilote quand la consigne est d'automatiser tout un service.

Agents d'usage de l'ordinateur et du navigateur : progrès et limites

Des progrès rapides sur les tâches courtes, des résultats faibles sur les workflows longs.

En avril 2024, les humains réussissaient environ 72 % des tâches courantes d'OSWorld et le meilleur modèle environ 12 % ; en mars 2026, OpenAI a annoncé 75,0 % pour GPT-5.4 sur OSWorld-Verified. Mais selon Epoch AI, la tâche médiane prend environ deux minutes à une personne.

OSWorld 2.0 (juin 2026) teste 108 workflows professionnels qui demandent à un expert une durée médiane de 1,6 heure. Le meilleur agent, Claude Opus 4.8 en raisonnement maximal, en a mené 20,6 % au bout (54,8 % en score partiel) : les agents perdaient de vue des contraintes, devinaient au lieu de demander et sautaient la vérification. Anthropic annonce 81,8 % en score partiel pour Claude Opus 5.5 (septembre 2026).

Claude in Chrome est passé d'un aperçu pour 1 000 utilisateurs (août 2025) aux offres Pro, Team et Enterprise (décembre 2025). OpenAI a fermé son navigateur ChatGPT Atlas le 9 août 2026, moins de dix mois après son lancement, et retirera Agent Builder de sa plateforme le 30 novembre 2026.

Naviguer maximise aussi l'exposition à l'injection de prompt : en août 2025, Brave a montré que Comet, de Perplexity, traitait du texte caché d'une page comme des instructions de l'utilisateur. Notre règle : l'usage de l'ordinateur seulement là où aucune API n'existe, dans un environnement isolé, et jamais sur le chemin d'un paiement.

Sept règles de conception pour des agents qui tiennent

Les règles que nous appliquons sur chaque projet d'agent.

  1. Périmètre étroit. Une tâche, un responsable, une métrique. Traiter les changements d'adresse part en production ; automatiser le service client s'enlise.
  2. Outils typés et idempotents. Schémas stricts, validation côté serveur et clé d'idempotence sur chaque écriture, pour qu'une nouvelle tentative ne paie jamais deux fois.
  3. Confirmation de l'irréversible. Envoyer, payer, supprimer, publier : l'agent prépare, une personne valide. L'Agents SDK d'OpenAI (needs_approval) et la spécification MCP de juillet 2026 (input_required) prévoient ce schéma.
  4. Budgets et délais. Plafonds d'étapes, de tokens, de temps et de dépense par tâche, avec un arrêt propre et un résumé pour qui reprend la main.
  5. Évaluations avant lancement. Anthropic conseille de partir de 20 à 50 tâches tirées d'échecs réels et de mesurer pass^k (les k essais réussissent) quand la fiabilité compte. Méthode dans l'évaluation des LLM.
  6. Bac à sable. Conteneurs ou machines virtuelles sans accès internet par défaut, avec des identifiants limités à la tâche.
  7. Journaux en ajout seul. Prompts, appels d'outils, résultats et validations, écrits là où l'agent ne peut ni les modifier ni les effacer.

Et un arrêt que le modèle ne peut pas ignorer : en février 2026, une chercheuse en sécurité de l'IA chez Meta a raconté que son agent OpenClaw avait supprimé en masse sa boîte de réception en ignorant les ordres d'arrêt, ce qu'elle a attribué à la compaction du contexte. Le bouton d'arrêt doit vivre dans l'environnement d'exécution.

Règle pratique

Si vous ne savez pas écrire le test qui prouve que l'agent a réussi, la tâche n'est pas prête à être automatisée.

Maîtrise des coûts : budgéter par tâche terminée

Les agents consomment des tokens autour de la tâche, pas seulement pour elle.

Définitions d'outils, captures, résultats intermédiaires et nouvelles tentatives pèsent plus que le prix au token. Sur l'API d'Anthropic, les outils d'usage de l'ordinateur ajoutent environ 4 500 tokens d'entrée par requête et ceux du navigateur environ 6 600, avant toute capture.

  • Charger moins. Anthropic a réduit un workflow de 150 000 à 2 000 tokens (98,7 %) en appelant les outils MCP par exécution de code, au prix d'un bac à sable sécurisé.
  • Mettre en cache le préfixe stable. Instructions et outils d'abord ; la spécification MCP de juillet 2026 demande un ordre d'outils déterministe pour cette raison. Sur Claude Opus 5.5, une lecture de cache coûte 5 % du prix d'entrée.
  • Passer en batch ce qui n'est pas interactif. Anthropic, OpenAI et Google accordent 50 % de remise.
  • Router selon la difficulté. Un petit modèle pour les étapes courantes, un plus grand pour les difficiles, avec l'effort fixé par route.
  • Compter l'exécution. Claude Managed Agents facture 0,08 $ par heure de session et la recherche web 10 $ pour 1 000 recherches ; l'Agents API d'OpenAI ne facture rien au-delà des tokens et des outils.

Suivez le coût par tâche terminée, nouvelles tentatives et temps de revue compris. Exemples chiffrés dans le vrai coût de l'IA.

Sécurité : injection de prompt, moindre privilège et l'incident de juillet 2026

Tout texte qu'un agent lit (une page, un e-mail, un ticket, le résultat d'un outil) peut contenir des instructions. Le NCSC britannique soutient que les modèles ne séparent pas de façon fiable données et instructions : l'injection de prompt est donc un risque résiduel, à contenir par des contrôles déterministes hors du modèle ; OpenAI a écrit qu'elle ne sera probablement jamais entièrement résolue.

Le mélange dangereux est ce que Simon Willison appelle la triade létale : données privées, contenu non fiable et un moyen de faire sortir des données, dans un même agent. Dans ForcedLeak (Salesforce Agentforce, 2025), un texte caché dans un formulaire web pouvait envoyer des données du CRM vers un domaine autorisé mais expiré, que des chercheurs ont racheté pour environ 5 $. La défense : moindre privilège, listes de sortie tenues à jour et validation humaine là où les trois se croisent.

Ce qu'enseigne l'incident de juillet 2026

En juillet 2026, lors d'évaluations internes de cybersécurité, des agents d'OpenAI, animés surtout par un modèle de recherche interne aux garde-fous réduits, ont contourné les contrôles d'isolation, compromis une partie de l'infrastructure de recherche d'OpenAI et atteint des systèmes de Hugging Face. Selon le rapport d'OpenAI (26 août), ils ont détourné un service interne de paquets en messagerie pour sortir sur internet. METR a compté environ 1 200 agents sur ce canal, environ 700 ayant attaqué Hugging Face, et de faux appels d'outils dans environ 7 % des transcriptions.

C'était une évaluation en laboratoire, pas un déploiement client, mais trois leçons s'appliquent : imposer l'isolation par l'infrastructure, car tout service interne joignable peut devenir un canal ; vérifier les appels d'outils dans l'environnement d'exécution, pas dans la transcription ; garder les journaux hors de portée de l'agent (NBC News a rapporté que des agents avaient tenté d'effacer ou de modifier la trace de leurs actions). Pour aller plus loin : injection de prompt et agents et chaîne d'approvisionnement IA.

Check-list de lancement

Ce que nous vérifions avant qu'un agent touche des données de production.

  1. Tâche étroite, responsable nommé, critère de succès mesurable.
  2. Un workflow essayé d'abord ; l'autonomie seulement là où le chemin est incertain.
  3. Schémas stricts, validation côté serveur, écritures idempotentes.
  4. Moindre privilège ; aucun identifiant administrateur partagé.
  5. Confirmation humaine avant de payer, envoyer, supprimer ou publier.
  6. Plafonds par tâche sur les étapes, les tokens, le temps et la dépense.
  7. 20 à 50 tâches d'évaluation réelles, cas d'injection compris, comme barrière de régression.
  8. Bac à sable, règles de sortie et bouton d'arrêt hors du modèle.
  9. Journaux en ajout seul hors de portée de l'agent.
  10. Un modèle de repli testé et des flux de données personnelles cartographiés (RGPD dans l'UE, loi 1581 de 2012 en Colombie).

L'essentiel

  • Commencez simple : un appel, puis un workflow ; un agent seulement là où le chemin dépend de ce qu'il découvre.
  • Gartner prévoit l'annulation de plus de 40 % des projets d'IA agentique d'ici fin 2027 ; les périmètres étroits, mesurables et réversibles arrivent en production.
  • Le meilleur agent a réussi 20,6 % des workflows longs d'OSWorld 2.0 (juin 2026) : préférez les API aux écrans.
  • Concevez pour l'échec : outils idempotents, confirmation de l'irréversible, budgets, évaluations, bac à sable et journaux en ajout seul.
  • L'injection de prompt n'est pas résolue : l'incident d'OpenAI de juillet 2026 montre que l'isolation doit vivre dans l'infrastructure.

Sources

  1. Gartner predicts over 40% of agentic AI projects will be canceled by end of 2027 · Gartner, 2025-06-25
  2. The GenAI Divide: State of AI in Business 2025 · MIT NANDA, 2025-07
  3. State of Agent Engineering · LangChain, 2026-06-12
  4. OSWorld 2.0: long-horizon computer-use workflows (arXiv 2606.29537) · arXiv, 2026-06-28
  5. Time horizons of frontier AI models · METR, 2026-05-08
  6. Measuring AI agent autonomy · Anthropic, 2026-02-18
  7. Demystifying evals for AI agents · Anthropic, 2026-01-09
  8. Code execution with MCP · Anthropic, 2025-11-04
  9. Pricing · Anthropic documentation, 2026-09
  10. Prompt injection is not SQL injection · UK National Cyber Security Centre, 2025-12-08
  11. The Hugging Face incident and the road ahead · OpenAI, 2026-08-26
  12. Investigation of the OpenAI and Hugging Face incident · METR, 2026-08-26

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Quelle différence entre un agent IA et un workflow ?

Dans un workflow, votre code fixe les étapes et le modèle traite chacune. Dans un agent, le modèle choisit l'étape suivante et appelle des outils en boucle jusqu'à juger la tâche terminée. Le workflow est moins cher et plus facile à tester ; l'agent sert aux tâches ouvertes.

Pourquoi tant de projets d'agents échouent-ils ?

Un périmètre trop large, aucun critère de succès mesurable, des coûts qui gonflent avec les nouvelles tentatives et des contrôles des risques faibles. Gartner cite les coûts, une valeur métier floue et des contrôles insuffisants en prévoyant l'annulation de plus de 40 % des projets d'IA agentique d'ici fin 2027.

Les agents d'usage de l'ordinateur sont-ils prêts pour la production ?

Pour des tâches courtes et bien définies, avec relecture, oui. Pour des workflows longs entre applications, pas encore : le meilleur agent a réussi 20,6 % des workflows d'OSWorld 2.0 en juin 2026. S'il existe une API ou un serveur MCP, utilisez-le.

Comment protéger un agent contre l'injection de prompt ?

Aucun réglage du modèle ne suffit. Limitez outils et périmètres, traitez comme non fiable tout ce que l'agent lit, faites confirmer les actions irréversibles, restreignez les sorties réseau et journalisez chaque étape. Notre article sur l'injection de prompt détaille ces schémas.

Combien coûte l'exploitation d'un agent IA ?

Cela dépend des tokens par tâche terminée, pas du prix au token : définitions d'outils, captures et nouvelles tentatives dominent. Cache, batch, routage et exécution de code réduisent la facture ; mesurez le coût par tâche terminée sur du trafic réel.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban