Le code avec des agents : écrire devient bon marché, vérifier non
Depuis février 2025, les agents de code sont passés d'un aperçu en terminal à des travailleurs en arrière-plan qui ouvrent seuls des pull requests. Les preuves de productivité sont mitigées et les données de sécurité appellent à la prudence. Voici ce que nous recommandons de changer dans une équipe logicielle, et ce qu'il faut mesurer.
Les agents de code travaillent désormais à trois endroits : l'éditeur, le terminal et le cloud, où ils prennent un ticket et rendent une pull request. L'adoption est large, mais les preuves sur la vitesse sont mitigées : dans l'essai randomisé de METR en 2025, des développeurs expérimentés ont mis 19 % de temps en plus avec l'IA tout en se croyant 20 % plus rapides. Veracode a trouvé des failles du Top 10 OWASP dans 45 % des échantillons de code généré.
Notre lecture : le goulot d'étranglement passe de l'écriture du code à sa spécification et à sa vérification. Les équipes qui avaient déjà des tests, de l'intégration continue et de petites pull requests en profitent le plus ; c'est pourquoi DORA décrit l'IA comme un amplificateur.
Les outils et leurs trois modes
Dans l'IDE, l'agent modifie le code dans votre éditeur sous vos yeux. Dans le terminal, un agent en ligne de commande lit le dépôt, lance commandes et tests, et modifie les fichiers. Dans le cloud, vous confiez une tâche et récupérez une pull request.
| Outil | Mode | Jalons | À savoir |
|---|---|---|---|
| Claude Code (Anthropic) | Terminal | Aperçu 24 févr. 2025 ; GA mai 2025 | Environ 4 % des commits publics sur GitHub (févr. 2026), selon Anthropic |
| Codex (OpenAI) | CLI open source, cloud | CLI 16 avr. 2025 ; GA 6 oct. 2025 | Son harnais est l'Agents API (bêta, sept. 2026) |
| Agent de code Copilot (GitHub) | Cloud : un ticket entre, une PR brouillon sort | 19 mai 2025 ; GA 25 sept. 2025 | Tourne dans GitHub Actions |
| Cursor | IDE centré sur les agents | Cursor 2.0 et Composer, 29 oct. 2025 | Intégré à SpaceX depuis le 14 août 2026 |
| Gemini CLI, Jules, Antigravity (Google) | Terminal, cloud, IDE | Juin, août et novembre 2025 | Gemini CLI est sous Apache 2.0 |
| Kiro (AWS) | IDE et CLI pilotés par les specs | Aperçu 14 juil. 2025 ; GA 17 nov. 2025 | Tests basés sur les propriétés issus des specs |
| Devin (Cognition) | Cloud | Devin 2.0, 3 avr. 2025 | Agents en parallèle ; offres dès 20 $ |
Deux formats ouverts limitent la dépendance : AGENTS.md, un fichier Markdown d'instructions pour agents lancé en août 2025 et adopté par plus de 60 000 projets open source en décembre, et MCP pour les outils et les données (voir MCP expliqué).
Benchmarks : regardez la version et le harnais
SWE-bench Verified, le sous-ensemble validé par des humains qu'OpenAI a publié en août 2024, était le chiffre cité à chaque lancement. En février 2026, OpenAI a cessé de le publier : l'état de l'art n'était passé que de 74,9 % à 80,9 % en six mois, un audit de 138 problèmes difficiles a trouvé des tests défectueux dans 59,4 % d'entre eux, et GPT-5.2 a résolu 31 tâches jugées presque impossibles, signe de contamination. Il est absent des tableaux de lancement de Claude Opus 5.5 et de GPT-6 Astra.
Ses successeurs sont plus durs et changent plus vite. SWE-bench Pro (Scale AI, septembre 2025) compte 1 865 tâches longues issues de 41 dépôts, mais son classement public n'inclut pas encore les modèles de mi-2026. Terminal-Bench est passé de la version 1.0 à la 4.0 en 15 mois ; sur le classement officiel de la 4.0, GPT-6 Astra dans Codex mène avec 58,2 %, devant Claude Fable 5.1 dans Claude Code (57,9 %), tandis que les 66,4 % annoncés par Anthropic pour Opus 5.5 (voir notre analyse) n'y figurent pas encore. Dans le tableau DeepSWE v1.1 d'OpenAI, cinq modèles de trois éditeurs se tiennent en moins de 7 points.
Nommez donc le modèle et le harnais, le logiciel qui fait tourner l'agent ; ne comparez qu'au sein d'une même version ; et testez sur votre code. Anthropic recommande de démarrer l'évaluation d'agents avec 20 à 50 tâches tirées d'échecs réels : pour le code, des tickets clos de vos propres dépôts. La méthode est dans notre guide d'évaluation des LLM.
Ce qu'ont trouvé les études de productivité
L'étude la plus rigoureuse reste l'essai randomisé de METR, publié en juillet 2025 : 16 développeurs open source expérimentés, 246 tickets réels d'environ deux heures chacun, dans des dépôts matures de plus d'un million de lignes. Avec l'IA autorisée, surtout Cursor Pro avec Claude 3.5 et 3.7 Sonnet, les tâches ont pris 19 % de temps en plus. Les développeurs attendaient un gain de 24 % et pensaient encore, après coup, avoir gagné 20 %.
Le suivi, lancé en août 2025 et publié en février 2026, estime un gain de temps de 18 % pour les participants revenus et de 4 % pour les nouveaux, mais les deux intervalles de confiance incluent zéro. METR juge ces données peu fiables : 30 % à 50 % des participants ont écarté les tâches qu'ils ne voulaient pas faire sans IA, donc le gain réel est probablement plus élevé.
Les enquêtes montrent le même écart. Dans DORA 2025 (près de 5 000 répondants), 90 % utilisent l'IA au travail et plus de 80 % se disent plus productifs, mais 30 % font peu ou pas confiance au code généré, et l'adoption va de pair avec plus de débit mais moins de stabilité des livraisons. Dans l'enquête 2025 de Stack Overflow, seuls 14,1 % utilisaient des agents d'IA chaque jour.
Les développeurs de METR étaient plus lents et se sentaient plus rapides. Enquêtes, démos et chiffres d'éditeurs (OpenAI affirme que ses ingénieurs fusionnent 70 % de pull requests en plus par semaine avec Codex) montrent le possible, pas ce qui se passe dans votre équipe.
Sécurité : le code de l'IA échoue de façon connue
En 2025, Veracode a testé plus de 100 modèles sur des tâches en Java, Python, C# et JavaScript : 45 % des échantillons introduisaient une vulnérabilité du Top 10 OWASP, de 72 % en Java à 38 % en Python. La qualité fonctionnelle s'est améliorée, pas la sécurité, quelle que soit la taille du modèle.
- Dépendances. Un modèle peut suggérer un paquet qui n'existe pas, et un attaquant peut enregistrer ce nom avant vous. Figez les versions, installez via un registre interne ou une liste autorisée, et faites de chaque nouvelle dépendance une décision humaine (voir la sécurité de la chaîne d'approvisionnement IA).
- Secrets. Un agent voit ce que voit son terminal. Donnez-lui des identifiants éphémères au périmètre minimal, jamais ceux de production, et analysez chaque pull request à la recherche de secrets.
- Injection de prompt. Un ticket, une page web ou un README peuvent contenir des instructions que l'agent suit, et OpenAI juge peu probable que le problème soit un jour totalement résolu (voir injection de prompt et agents).
- Isolation. L'isolation du système de fichiers et du réseau a réduit de 84 % les demandes d'autorisation chez Anthropic, ce qui freine la validation machinale. Anthropic a aussi observé qu'environ 0,8 % des actions d'agents semblaient irréversibles : rare, mais pas nul.
Notre recommandation : les mêmes contrôles de sécurité pour toute pull request, humaine ou d'agent, et un pentest web et API externe avant d'exposer une application critique.
Ce qui change dans l'équipe
Des specs avant les prompts. Les agents travaillent mieux à partir d'une spécification courte : critères d'acceptation, fichiers concernés, ce qui ne doit pas changer. AWS a bâti Kiro autour de cette idée, et le harnais d'Anthropic pour agents de longue durée avance une fonctionnalité à la fois, après avoir vu des agents tout tenter d'un coup, se déclarer terminés trop tôt et laisser des fonctions non testées.
Les tests comme contrat. Un agent qui écrit le code et les tests peut se tromper des deux côtés de la même façon. Les tests qui définissent le comportement doivent être écrits ou validés par une personne, protégés par des code owners et jamais modifiés dans la pull request qu'ils valident.
La revue devient le goulot. Gardez des pull requests petites (une tâche, une pull request), demandez des preuves à l'agent (sortie des tests, captures, ce qu'il n'a pas fait) et étiquetez le travail des agents pour le mesurer à part. Selon Anthropic, avec l'expérience, la supervision passe de l'approbation de chaque action au suivi du travail.
Check-list avant d'activer des agents en arrière-plan
- Un AGENTS.md avec les commandes de build, de test et de lint, et les zones interdites.
- Des tests d'acceptation sur les chemins critiques, tenus par des personnes.
- Des contrôles en CI : tests, types, analyse statique, détection de secrets, de dépendances et de licences.
- Une taille maximale par pull request ; un agent ne fusionne jamais son propre travail.
- Des identifiants d'agent éphémères, au moindre privilège, séparés des comptes humains.
- Un bac à sable au réseau restreint et une étiquette sur les commits d'agents.
La pull request d'un agent passe les mêmes contrôles que celle d'un humain, plus un : une personne est responsable des tests qui définissent le comportement, et l'agent ne peut pas les modifier pour faire passer son code.
Gouvernance, licences et propriété intellectuelle en Colombie et en Europe
D'abord, une politique. Le modèle de capacités IA de DORA inclut une politique d'IA claire : quels outils, quels dépôts, quelles données, et qui peut activer des agents en arrière-plan. Sans elle, chacun apporte ses propres outils.
Le code est une donnée. Les dépôts contiennent des secrets d'affaires et parfois des données personnelles. Choisissez des offres qui excluent l'entraînement sur votre code, tenez les données de production hors de portée des agents et vérifiez où tourne l'inférence. En Colombie, un prestataire qui traite des données personnelles pour votre compte exige un contrat de transmission, et les transferts internationaux relèvent de l'article 26 de la loi 1581 de 2012. Dans l'UE, le RGPD s'applique, et l'article 4 modifié de l'AI Act (en vigueur depuis le 27 juillet 2026) demande aux entreprises de soutenir la maîtrise de l'IA chez leur personnel.
Paternité et licences. Le Copyright Office américain a conclu en janvier 2025 que des prompts seuls ne rendent pas un résultat d'IA protégeable : la protection exige une paternité humaine. Conservez les preuves de la contribution humaine (specs, revues, commits), lisez les clauses de propriété intellectuelle de votre éditeur et analysez les licences, car le code généré peut ressembler à du code open source existant.
Risque fournisseur. Les outils changent de propriétaire (Cursor appartient désormais à SpaceX) et l'accès peut changer pour des raisons politiques : une directive américaine de contrôle des exportations a obligé Anthropic à retirer Fable 5 à tous ses utilisateurs du 12 juin au 1er juillet 2026. Gardez les instructions dans des formats ouverts, les outils sur MCP et une seconde option testée.
Un modèle opérationnel et les indicateurs qui comptent
| Indicateur | Pourquoi il compte | Comment le mesurer | Signal d'alerte |
|---|---|---|---|
| Délai de mise en production | Le gain doit se voir de bout en bout | Du premier commit à la production | On code plus vite, le délai ne baisse pas |
| Taux d'échec des changements | DORA associe l'IA à moins de stabilité | Déploiements causant incident, retour arrière ou correctif urgent | Hausse après l'adoption |
| Temps de revue | La revue est le nouveau goulot | De l'ouverture de la pull request à son approbation | File qui s'allonge, ou approbations instantanées de gros changements |
| Taille des pull requests | Les petits changements sont vraiment relus | Médiane des lignes modifiées, agents et humains séparés | Les pull requests d'agents grossissent |
| Reprises | Le code presque juste se corrige plus tard | Retours arrière et code réécrit sous trois semaines | Concentrées dans le code des agents |
| Constats de sécurité | Les 45 % d'échecs de Veracode | Alertes d'analyse statique et de secrets par pull request | Plus élevés sur les pull requests d'agents |
| Coût par pull request fusionnée | Les agents facturent tokens et licences | Consommation exportée rapportée aux pull requests fusionnées | Croît plus vite que le débit |
Déployez par étapes. Commencez là où la spécification est claire et la vérification peu coûteuse : bugs avec un test qui les reproduit, mises à jour de dépendances, écriture de tests, documentation, migrations mécaniques. Ajoutez des agents en arrière-plan une fois les contrôles et les indicateurs en place, et gardez l'architecture, le code sensible et les migrations de données sous contrôle humain étroit. Après 8 à 12 semaines, comparez avec la référence et décidez dépôt par dépôt.
Notre règle pratique quand nous construisons du logiciel sur mesure : l'agent écrit, les tests et les relecteurs décident. Pour les agents au-delà du code, lisez les agents d'IA en production.
L'essentiel
- Les agents travaillent dans l'IDE, le terminal et le cloud, où ils transforment des tickets en pull requests : le goulot passe à la spécification et à la revue.
- SWE-bench Verified est saturé et en partie contaminé : citez Terminal-Bench 4.0, SWE-bench Pro ou DeepSWE avec version et harnais, puis testez sur vos propres tickets.
- Les preuves sur la vitesse sont mitigées : 19 % plus lent dans l'essai de METR de 2025, pas de conclusion ferme en 2026, et DORA associe l'IA à plus de débit mais moins de stabilité.
- 45 % des échantillons générés ont échoué aux tests de sécurité de Veracode, quelle que soit la taille du modèle : contrôles en CI, maîtrise des dépendances et hygiène des secrets sont obligatoires.
- Suivez délai de mise en production, taux d'échec des changements, temps de revue et taille des pull requests avant et après, et gardez des tests tenus par des humains.
Sources
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
- Developer productivity study: February 2026 update
- Announcing the 2025 DORA report
- Why we no longer evaluate SWE-bench Verified
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
- Terminal-Bench leaderboard
- 2025 GenAI Code Security Report
- 2025 Developer Survey: AI
- Copilot coding agent is now generally available
- Anthropic raises $30 billion Series G (Claude Code figures)
- Cursor joins SpaceX
- Measuring AI agent autonomy in practice
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Quel agent de code choisir pour mon équipe ?
Cela dépend du mode recherché : l'IDE pour le travail interactif, le terminal pour les ingénieurs qui vivent en ligne de commande, le cloud pour des tickets bien cadrés. Testez deux ou trois outils pendant deux semaines sur des tickets clos de vos propres dépôts, et gardez les instructions dans AGENTS.md pour pouvoir changer à moindre coût.
Les agents de code rendent-ils les développeurs plus rapides ?
Parfois, et moins qu'on ne le ressent. METR a mesuré des développeurs expérimentés 19 % plus lents en 2025 et n'a pas pu conclure en 2026 ; DORA 2025 associe l'IA à plus de débit et moins de stabilité. Mesurez votre propre délai de mise en production et votre taux d'échec des changements.
Le code généré par l'IA est-il sûr ?
Pas par défaut. Veracode a trouvé des failles du Top 10 OWASP dans 45 % des échantillons en 2025, sans amélioration avec des modèles plus grands. Traitez le code d'agent comme toute contribution externe : analyse statique, détection de secrets et de dépendances, et revue humaine des chemins critiques.
À qui appartient le code écrit par un agent ?
Cela dépend de la juridiction et de votre contrat. Le Copyright Office américain estime que des prompts seuls ne rendent pas un résultat protégeable et qu'une paternité humaine est requise. Conservez les preuves de la contribution humaine, lisez les clauses de votre éditeur sur l'entraînement et la propriété intellectuelle, et consultez votre juriste.
Des agents peuvent-ils travailler sur du code qui touche des données personnelles ?
Oui, si les données de production restent hors de leur portée. Utilisez des données de test synthétiques, sortez les secrets de l'environnement et vérifiez où tourne l'inférence : en Colombie, la loi 1581 encadre les transferts à l'étranger, et dans l'UE le RGPD s'applique.
D'autres analyses à lire
Claude Opus 5.5 : ce qui change pour les entreprises
Lancé le 22 septembre 2026 : moins cher qu'Opus 5, niveau Fable 5.1 selon Anthropic. Prix, benchmarks, changements techniques et cas d'usage.
CybersécuritéSécurité de la chaîne d'approvisionnement IA : modèles, paquets et serveurs MCP
Modèles qui exécutent du code, paquets hallucinés, serveurs MCP et skills malveillants : incidents 2025–2026, contrôles efficaces et obligations du CRA.
Agents et ingénierieEvals : tester un système à base de LLM
Pourquoi tester à l'intuition échoue : jeu de référence en espagnol et en français, juges LLM calibrés, seuils bloquants en CI, outils et coût des evals.
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.