Agents et ingénierie · Septembre 2026

Le code avec des agents : écrire devient bon marché, vérifier non

Depuis février 2025, les agents de code sont passés d'un aperçu en terminal à des travailleurs en arrière-plan qui ouvrent seuls des pull requests. Les preuves de productivité sont mitigées et les données de sécurité appellent à la prudence. Voici ce que nous recommandons de changer dans une équipe logicielle, et ce qu'il faut mesurer.

19 % de temps en plus avec l'IA (essai METR 2025)45 % d'échantillons de code IA en échec aux tests de sécurité90 % des répondants DORA 2025 utilisent l'IA
En bref

Les agents de code travaillent désormais à trois endroits : l'éditeur, le terminal et le cloud, où ils prennent un ticket et rendent une pull request. L'adoption est large, mais les preuves sur la vitesse sont mitigées : dans l'essai randomisé de METR en 2025, des développeurs expérimentés ont mis 19 % de temps en plus avec l'IA tout en se croyant 20 % plus rapides. Veracode a trouvé des failles du Top 10 OWASP dans 45 % des échantillons de code généré.

Notre lecture : le goulot d'étranglement passe de l'écriture du code à sa spécification et à sa vérification. Les équipes qui avaient déjà des tests, de l'intégration continue et de petites pull requests en profitent le plus ; c'est pourquoi DORA décrit l'IA comme un amplificateur.

Les outils et leurs trois modes

Dans l'IDE, l'agent modifie le code dans votre éditeur sous vos yeux. Dans le terminal, un agent en ligne de commande lit le dépôt, lance commandes et tests, et modifie les fichiers. Dans le cloud, vous confiez une tâche et récupérez une pull request.

Annonces des éditeurs, vérifiées le 26 septembre 2026. Un instantané d'un marché qui bouge vite.
OutilModeJalonsÀ savoir
Claude Code (Anthropic)TerminalAperçu 24 févr. 2025 ; GA mai 2025Environ 4 % des commits publics sur GitHub (févr. 2026), selon Anthropic
Codex (OpenAI)CLI open source, cloudCLI 16 avr. 2025 ; GA 6 oct. 2025Son harnais est l'Agents API (bêta, sept. 2026)
Agent de code Copilot (GitHub)Cloud : un ticket entre, une PR brouillon sort19 mai 2025 ; GA 25 sept. 2025Tourne dans GitHub Actions
CursorIDE centré sur les agentsCursor 2.0 et Composer, 29 oct. 2025Intégré à SpaceX depuis le 14 août 2026
Gemini CLI, Jules, Antigravity (Google)Terminal, cloud, IDEJuin, août et novembre 2025Gemini CLI est sous Apache 2.0
Kiro (AWS)IDE et CLI pilotés par les specsAperçu 14 juil. 2025 ; GA 17 nov. 2025Tests basés sur les propriétés issus des specs
Devin (Cognition)CloudDevin 2.0, 3 avr. 2025Agents en parallèle ; offres dès 20 $

Deux formats ouverts limitent la dépendance : AGENTS.md, un fichier Markdown d'instructions pour agents lancé en août 2025 et adopté par plus de 60 000 projets open source en décembre, et MCP pour les outils et les données (voir MCP expliqué).

Benchmarks : regardez la version et le harnais

SWE-bench Verified, le sous-ensemble validé par des humains qu'OpenAI a publié en août 2024, était le chiffre cité à chaque lancement. En février 2026, OpenAI a cessé de le publier : l'état de l'art n'était passé que de 74,9 % à 80,9 % en six mois, un audit de 138 problèmes difficiles a trouvé des tests défectueux dans 59,4 % d'entre eux, et GPT-5.2 a résolu 31 tâches jugées presque impossibles, signe de contamination. Il est absent des tableaux de lancement de Claude Opus 5.5 et de GPT-6 Astra.

Ses successeurs sont plus durs et changent plus vite. SWE-bench Pro (Scale AI, septembre 2025) compte 1 865 tâches longues issues de 41 dépôts, mais son classement public n'inclut pas encore les modèles de mi-2026. Terminal-Bench est passé de la version 1.0 à la 4.0 en 15 mois ; sur le classement officiel de la 4.0, GPT-6 Astra dans Codex mène avec 58,2 %, devant Claude Fable 5.1 dans Claude Code (57,9 %), tandis que les 66,4 % annoncés par Anthropic pour Opus 5.5 (voir notre analyse) n'y figurent pas encore. Dans le tableau DeepSWE v1.1 d'OpenAI, cinq modèles de trois éditeurs se tiennent en moins de 7 points.

Nommez donc le modèle et le harnais, le logiciel qui fait tourner l'agent ; ne comparez qu'au sein d'une même version ; et testez sur votre code. Anthropic recommande de démarrer l'évaluation d'agents avec 20 à 50 tâches tirées d'échecs réels : pour le code, des tickets clos de vos propres dépôts. La méthode est dans notre guide d'évaluation des LLM.

Ce qu'ont trouvé les études de productivité

L'étude la plus rigoureuse reste l'essai randomisé de METR, publié en juillet 2025 : 16 développeurs open source expérimentés, 246 tickets réels d'environ deux heures chacun, dans des dépôts matures de plus d'un million de lignes. Avec l'IA autorisée, surtout Cursor Pro avec Claude 3.5 et 3.7 Sonnet, les tâches ont pris 19 % de temps en plus. Les développeurs attendaient un gain de 24 % et pensaient encore, après coup, avoir gagné 20 %.

Le suivi, lancé en août 2025 et publié en février 2026, estime un gain de temps de 18 % pour les participants revenus et de 4 % pour les nouveaux, mais les deux intervalles de confiance incluent zéro. METR juge ces données peu fiables : 30 % à 50 % des participants ont écarté les tâches qu'ils ne voulaient pas faire sans IA, donc le gain réel est probablement plus élevé.

Les enquêtes montrent le même écart. Dans DORA 2025 (près de 5 000 répondants), 90 % utilisent l'IA au travail et plus de 80 % se disent plus productifs, mais 30 % font peu ou pas confiance au code généré, et l'adoption va de pair avec plus de débit mais moins de stabilité des livraisons. Dans l'enquête 2025 de Stack Overflow, seuls 14,1 % utilisaient des agents d'IA chaque jour.

Ressenti n'est pas mesure

Les développeurs de METR étaient plus lents et se sentaient plus rapides. Enquêtes, démos et chiffres d'éditeurs (OpenAI affirme que ses ingénieurs fusionnent 70 % de pull requests en plus par semaine avec Codex) montrent le possible, pas ce qui se passe dans votre équipe.

Sécurité : le code de l'IA échoue de façon connue

En 2025, Veracode a testé plus de 100 modèles sur des tâches en Java, Python, C# et JavaScript : 45 % des échantillons introduisaient une vulnérabilité du Top 10 OWASP, de 72 % en Java à 38 % en Python. La qualité fonctionnelle s'est améliorée, pas la sécurité, quelle que soit la taille du modèle.

  • Dépendances. Un modèle peut suggérer un paquet qui n'existe pas, et un attaquant peut enregistrer ce nom avant vous. Figez les versions, installez via un registre interne ou une liste autorisée, et faites de chaque nouvelle dépendance une décision humaine (voir la sécurité de la chaîne d'approvisionnement IA).
  • Secrets. Un agent voit ce que voit son terminal. Donnez-lui des identifiants éphémères au périmètre minimal, jamais ceux de production, et analysez chaque pull request à la recherche de secrets.
  • Injection de prompt. Un ticket, une page web ou un README peuvent contenir des instructions que l'agent suit, et OpenAI juge peu probable que le problème soit un jour totalement résolu (voir injection de prompt et agents).
  • Isolation. L'isolation du système de fichiers et du réseau a réduit de 84 % les demandes d'autorisation chez Anthropic, ce qui freine la validation machinale. Anthropic a aussi observé qu'environ 0,8 % des actions d'agents semblaient irréversibles : rare, mais pas nul.

Notre recommandation : les mêmes contrôles de sécurité pour toute pull request, humaine ou d'agent, et un pentest web et API externe avant d'exposer une application critique.

Ce qui change dans l'équipe

Des specs avant les prompts. Les agents travaillent mieux à partir d'une spécification courte : critères d'acceptation, fichiers concernés, ce qui ne doit pas changer. AWS a bâti Kiro autour de cette idée, et le harnais d'Anthropic pour agents de longue durée avance une fonctionnalité à la fois, après avoir vu des agents tout tenter d'un coup, se déclarer terminés trop tôt et laisser des fonctions non testées.

Les tests comme contrat. Un agent qui écrit le code et les tests peut se tromper des deux côtés de la même façon. Les tests qui définissent le comportement doivent être écrits ou validés par une personne, protégés par des code owners et jamais modifiés dans la pull request qu'ils valident.

La revue devient le goulot. Gardez des pull requests petites (une tâche, une pull request), demandez des preuves à l'agent (sortie des tests, captures, ce qu'il n'a pas fait) et étiquetez le travail des agents pour le mesurer à part. Selon Anthropic, avec l'expérience, la supervision passe de l'approbation de chaque action au suivi du travail.

Check-list avant d'activer des agents en arrière-plan

  1. Un AGENTS.md avec les commandes de build, de test et de lint, et les zones interdites.
  2. Des tests d'acceptation sur les chemins critiques, tenus par des personnes.
  3. Des contrôles en CI : tests, types, analyse statique, détection de secrets, de dépendances et de licences.
  4. Une taille maximale par pull request ; un agent ne fusionne jamais son propre travail.
  5. Des identifiants d'agent éphémères, au moindre privilège, séparés des comptes humains.
  6. Un bac à sable au réseau restreint et une étiquette sur les commits d'agents.
Notre règle

La pull request d'un agent passe les mêmes contrôles que celle d'un humain, plus un : une personne est responsable des tests qui définissent le comportement, et l'agent ne peut pas les modifier pour faire passer son code.

Gouvernance, licences et propriété intellectuelle en Colombie et en Europe

D'abord, une politique. Le modèle de capacités IA de DORA inclut une politique d'IA claire : quels outils, quels dépôts, quelles données, et qui peut activer des agents en arrière-plan. Sans elle, chacun apporte ses propres outils.

Le code est une donnée. Les dépôts contiennent des secrets d'affaires et parfois des données personnelles. Choisissez des offres qui excluent l'entraînement sur votre code, tenez les données de production hors de portée des agents et vérifiez où tourne l'inférence. En Colombie, un prestataire qui traite des données personnelles pour votre compte exige un contrat de transmission, et les transferts internationaux relèvent de l'article 26 de la loi 1581 de 2012. Dans l'UE, le RGPD s'applique, et l'article 4 modifié de l'AI Act (en vigueur depuis le 27 juillet 2026) demande aux entreprises de soutenir la maîtrise de l'IA chez leur personnel.

Paternité et licences. Le Copyright Office américain a conclu en janvier 2025 que des prompts seuls ne rendent pas un résultat d'IA protégeable : la protection exige une paternité humaine. Conservez les preuves de la contribution humaine (specs, revues, commits), lisez les clauses de propriété intellectuelle de votre éditeur et analysez les licences, car le code généré peut ressembler à du code open source existant.

Risque fournisseur. Les outils changent de propriétaire (Cursor appartient désormais à SpaceX) et l'accès peut changer pour des raisons politiques : une directive américaine de contrôle des exportations a obligé Anthropic à retirer Fable 5 à tous ses utilisateurs du 12 juin au 1er juillet 2026. Gardez les instructions dans des formats ouverts, les outils sur MCP et une seconde option testée.

Un modèle opérationnel et les indicateurs qui comptent

À suivre 4 à 6 semaines avant le déploiement des agents, puis à chaque sprint.
IndicateurPourquoi il compteComment le mesurerSignal d'alerte
Délai de mise en productionLe gain doit se voir de bout en boutDu premier commit à la productionOn code plus vite, le délai ne baisse pas
Taux d'échec des changementsDORA associe l'IA à moins de stabilitéDéploiements causant incident, retour arrière ou correctif urgentHausse après l'adoption
Temps de revueLa revue est le nouveau goulotDe l'ouverture de la pull request à son approbationFile qui s'allonge, ou approbations instantanées de gros changements
Taille des pull requestsLes petits changements sont vraiment relusMédiane des lignes modifiées, agents et humains séparésLes pull requests d'agents grossissent
ReprisesLe code presque juste se corrige plus tardRetours arrière et code réécrit sous trois semainesConcentrées dans le code des agents
Constats de sécuritéLes 45 % d'échecs de VeracodeAlertes d'analyse statique et de secrets par pull requestPlus élevés sur les pull requests d'agents
Coût par pull request fusionnéeLes agents facturent tokens et licencesConsommation exportée rapportée aux pull requests fusionnéesCroît plus vite que le débit

Déployez par étapes. Commencez là où la spécification est claire et la vérification peu coûteuse : bugs avec un test qui les reproduit, mises à jour de dépendances, écriture de tests, documentation, migrations mécaniques. Ajoutez des agents en arrière-plan une fois les contrôles et les indicateurs en place, et gardez l'architecture, le code sensible et les migrations de données sous contrôle humain étroit. Après 8 à 12 semaines, comparez avec la référence et décidez dépôt par dépôt.

Notre règle pratique quand nous construisons du logiciel sur mesure : l'agent écrit, les tests et les relecteurs décident. Pour les agents au-delà du code, lisez les agents d'IA en production.

L'essentiel

  • Les agents travaillent dans l'IDE, le terminal et le cloud, où ils transforment des tickets en pull requests : le goulot passe à la spécification et à la revue.
  • SWE-bench Verified est saturé et en partie contaminé : citez Terminal-Bench 4.0, SWE-bench Pro ou DeepSWE avec version et harnais, puis testez sur vos propres tickets.
  • Les preuves sur la vitesse sont mitigées : 19 % plus lent dans l'essai de METR de 2025, pas de conclusion ferme en 2026, et DORA associe l'IA à plus de débit mais moins de stabilité.
  • 45 % des échantillons générés ont échoué aux tests de sécurité de Veracode, quelle que soit la taille du modèle : contrôles en CI, maîtrise des dépendances et hygiène des secrets sont obligatoires.
  • Suivez délai de mise en production, taux d'échec des changements, temps de revue et taille des pull requests avant et après, et gardez des tests tenus par des humains.

Sources

  1. Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity · METR, 2025-07-10
  2. Developer productivity study: February 2026 update · METR, 2026-02-24
  3. Announcing the 2025 DORA report · Google Cloud, 2025-09-23
  4. Why we no longer evaluate SWE-bench Verified · OpenAI, 2026-02-23
  5. SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? · Scale AI (arXiv), 2025-09-21
  6. Terminal-Bench leaderboard · Terminal-Bench, 2026-09-26
  7. 2025 GenAI Code Security Report · Veracode, 2025-07-30
  8. 2025 Developer Survey: AI · Stack Overflow, 2025
  9. Copilot coding agent is now generally available · GitHub, 2025-09-25
  10. Anthropic raises $30 billion Series G (Claude Code figures) · Anthropic, 2026-02-12
  11. Cursor joins SpaceX · Cursor, 2026-08-14
  12. Measuring AI agent autonomy in practice · Anthropic, 2026-02-18

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Quel agent de code choisir pour mon équipe ?

Cela dépend du mode recherché : l'IDE pour le travail interactif, le terminal pour les ingénieurs qui vivent en ligne de commande, le cloud pour des tickets bien cadrés. Testez deux ou trois outils pendant deux semaines sur des tickets clos de vos propres dépôts, et gardez les instructions dans AGENTS.md pour pouvoir changer à moindre coût.

Les agents de code rendent-ils les développeurs plus rapides ?

Parfois, et moins qu'on ne le ressent. METR a mesuré des développeurs expérimentés 19 % plus lents en 2025 et n'a pas pu conclure en 2026 ; DORA 2025 associe l'IA à plus de débit et moins de stabilité. Mesurez votre propre délai de mise en production et votre taux d'échec des changements.

Le code généré par l'IA est-il sûr ?

Pas par défaut. Veracode a trouvé des failles du Top 10 OWASP dans 45 % des échantillons en 2025, sans amélioration avec des modèles plus grands. Traitez le code d'agent comme toute contribution externe : analyse statique, détection de secrets et de dépendances, et revue humaine des chemins critiques.

À qui appartient le code écrit par un agent ?

Cela dépend de la juridiction et de votre contrat. Le Copyright Office américain estime que des prompts seuls ne rendent pas un résultat protégeable et qu'une paternité humaine est requise. Conservez les preuves de la contribution humaine, lisez les clauses de votre éditeur sur l'entraînement et la propriété intellectuelle, et consultez votre juriste.

Des agents peuvent-ils travailler sur du code qui touche des données personnelles ?

Oui, si les données de production restent hors de leur portée. Utilisez des données de test synthétiques, sortez les secrets de l'environnement et vérifiez où tourne l'inférence : en Colombie, la loi 1581 encadre les transferts à l'étranger, et dans l'UE le RGPD s'applique.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban