Programación con agentes: escribir código se abarató, verificarlo no
Desde febrero de 2025, los agentes de código pasaron de una vista previa en la terminal a trabajadores en segundo plano que abren pull requests por su cuenta. La evidencia sobre productividad es mixta y los datos de seguridad piden prudencia. Esto es lo que recomendamos cambiar en un equipo de software y lo que conviene medir.
Los agentes de código ya trabajan en tres lugares: el editor, la terminal y la nube, donde reciben un issue y devuelven un pull request. La adopción es amplia, pero la evidencia sobre velocidad es mixta: en el ensayo aleatorizado de METR de 2025, desarrolladores experimentados tardaron un 19 % más con IA mientras creían haber ido un 20 % más rápido. Veracode encontró fallas del OWASP Top 10 en el 45 % de las muestras de código generado.
Nuestra lectura: el cuello de botella pasa de escribir código a especificarlo y verificarlo. Ganan más los equipos que ya tenían pruebas, integración continua y pull requests pequeños; por eso DORA describe la IA como un amplificador.
Las herramientas y sus tres modos
En el IDE, el agente edita dentro de tu editor mientras lo observas. En la terminal, un agente de línea de comandos lee el repositorio, ejecuta comandos y pruebas y edita archivos. En la nube, asignas una tarea y recibes un pull request.
| Herramienta | Modo | Hitos | Para tener en cuenta |
|---|---|---|---|
| Claude Code (Anthropic) | Terminal | Vista previa 24 feb. 2025; GA mayo 2025 | Cerca del 4 % de los commits públicos de GitHub (feb. 2026), según Anthropic |
| Codex (OpenAI) | CLI de código abierto, nube | CLI 16 abr. 2025; GA 6 oct. 2025 | Su arnés es la Agents API (beta, sept. 2026) |
| Agente de código de Copilot (GitHub) | Nube: entra un issue, sale un PR borrador | 19 mayo 2025; GA 25 sept. 2025 | Corre en GitHub Actions |
| Cursor | IDE centrado en agentes | Cursor 2.0 y Composer, 29 oct. 2025 | Parte de SpaceX desde el 14 ago. 2026 |
| Gemini CLI, Jules, Antigravity (Google) | Terminal, nube, IDE | Junio, agosto y noviembre de 2025 | Gemini CLI es Apache 2.0 |
| Kiro (AWS) | IDE y CLI guiados por specs | Vista previa 14 jul. 2025; GA 17 nov. 2025 | Pruebas basadas en propiedades a partir de specs |
| Devin (Cognition) | Nube | Devin 2.0, 3 abr. 2025 | Agentes en paralelo; planes desde USD 20 |
Dos formatos abiertos limitan la dependencia: AGENTS.md, un archivo Markdown de instrucciones para agentes lanzado en agosto de 2025 y adoptado por más de 60.000 proyectos de código abierto en diciembre, y MCP para herramientas y datos (ver MCP explicado).
Benchmarks: mira la versión y el arnés
SWE-bench Verified, el subconjunto validado por humanos que OpenAI publicó en agosto de 2024, era la cifra que citaba todo lanzamiento de código. En febrero de 2026 OpenAI dejó de reportarlo: el estado del arte solo había pasado de 74,9 % a 80,9 % en seis meses, una auditoría de 138 problemas difíciles encontró pruebas defectuosas en el 59,4 % y GPT-5.2 resolvió 31 tareas consideradas casi imposibles, señal de contaminación. Ya no aparece en las tablas de lanzamiento de Claude Opus 5.5 ni de GPT-6 Astra.
Sus sucesores son más difíciles y cambian más rápido. SWE-bench Pro (Scale AI, septiembre de 2025) reúne 1.865 tareas largas de 41 repositorios, pero su tabla pública aún no incluye los modelos de mediados de 2026. Terminal-Bench pasó de la versión 1.0 a la 4.0 en 15 meses; en la tabla oficial de la 4.0, GPT-6 Astra con Codex lidera con 58,2 %, por delante de Claude Fable 5.1 con Claude Code (57,9 %), mientras que el 66,4 % que Anthropic reporta para Opus 5.5 (ver nuestro análisis) todavía no figura. En la tabla de DeepSWE v1.1 de OpenAI, cinco modelos de tres proveedores quedan a menos de 7 puntos.
Así que nombra el modelo y el arnés, el software que ejecuta al agente; compara solo dentro de una misma versión, y prueba con tu código. Anthropic recomienda empezar las evaluaciones de agentes con 20 a 50 tareas sacadas de fallas reales: en código, issues cerrados de tus propios repositorios. El método está en nuestra guía de evaluación de LLM.
Qué encontraron los estudios de productividad
El estudio más riguroso sigue siendo el ensayo aleatorizado de METR, de julio de 2025: 16 desarrolladores experimentados de código abierto, 246 issues reales de unas dos horas cada uno, en repositorios maduros de más de un millón de líneas. Con IA permitida, sobre todo Cursor Pro con Claude 3.5 y 3.7 Sonnet, las tareas tomaron un 19 % más de tiempo. Los desarrolladores esperaban ir un 24 % más rápido y, al terminar, seguían creyendo que habían ganado un 20 %.
El seguimiento, iniciado en agosto de 2025 y publicado en febrero de 2026, estimó ahorros de tiempo del 18 % para quienes repetían y del 4 % para los nuevos participantes, pero ambos intervalos de confianza incluyen el cero. METR considera los datos poco fiables: entre el 30 % y el 50 % de los participantes se guardó tareas que no quería hacer sin IA, así que la ganancia real probablemente es mayor.
Las encuestas muestran la misma brecha. En DORA 2025 (casi 5.000 respuestas), el 90 % usa IA en el trabajo y más del 80 % dice ser más productivo, pero el 30 % confía poco o nada en el código generado, y la adopción va de la mano con más volumen de entregas pero menos estabilidad. En la encuesta 2025 de Stack Overflow, solo el 14,1 % usaba agentes de IA a diario.
Los desarrolladores de METR fueron más lentos y se sintieron más rápidos. Encuestas, demos y cifras de proveedores (OpenAI dice que sus ingenieros fusionan un 70 % más de pull requests por semana con Codex) muestran lo posible, no lo que pasa en tu equipo.
Seguridad: el código de IA falla de formas conocidas
En 2025, Veracode probó más de 100 modelos en tareas de Java, Python, C# y JavaScript: el 45 % de las muestras introdujo una vulnerabilidad del OWASP Top 10, desde el 72 % en Java hasta el 38 % en Python. La calidad funcional mejoró; la seguridad no, sin importar el tamaño del modelo.
- Dependencias. Un modelo puede sugerir un paquete que no existe, y un atacante puede registrar ese nombre antes. Fija versiones, instala desde un registro interno o una lista de paquetes permitidos y haz de cada dependencia nueva una decisión humana (ver seguridad de la cadena de suministro de IA).
- Secretos. Un agente ve lo que ve su terminal. Dale credenciales de corta duración y alcance mínimo, nunca las de producción, y escanea secretos en cada pull request.
- Inyección de prompts. Un issue, una página web o un README pueden traer instrucciones que el agente sigue, y OpenAI ve poco probable que el problema se resuelva del todo algún día (ver prompt injection y agentes).
- Aislamiento. El aislamiento de archivos y red redujo un 84 % las solicitudes de permiso en Anthropic, lo que frena la aprobación automática. Anthropic también vio que cerca del 0,8 % de las acciones de agentes parecían irreversibles: pocas, pero no cero.
Nuestra recomendación: las mismas barreras de seguridad para todo pull request, humano o de agente, y un pentest web y de API externo antes de exponer una aplicación crítica.
Qué cambia dentro del equipo
Specs antes que prompts. Los agentes rinden mejor con una especificación corta: criterios de aceptación, archivos en alcance y lo que no debe cambiar. AWS construyó Kiro alrededor de esa idea, y el arnés de Anthropic para agentes de larga duración avanza una funcionalidad a la vez, después de ver agentes que intentaban todo de una vez, se daban por terminados antes de tiempo y dejaban funciones sin probar.
Pruebas como contrato. Un agente que escribe el código y las pruebas puede equivocarse en ambos de la misma forma. Las pruebas que definen el comportamiento deben escribirlas o aprobarlas personas, estar protegidas por code owners y nunca cambiar en el pull request que validan.
La revisión es el cuello de botella. Mantén los pull requests pequeños (una tarea, un pull request), pide evidencia al agente (salida de pruebas, capturas, lo que no hizo) y etiqueta el trabajo de agentes para medirlo aparte. Según Anthropic, con la experiencia la supervisión pasa de aprobar cada acción a monitorear el trabajo.
Checklist antes de activar agentes en segundo plano
- Un AGENTS.md con los comandos de build, pruebas y lint, y las zonas vedadas.
- Pruebas de aceptación en las rutas críticas, a cargo de personas.
- Barreras de CI: pruebas, tipos, análisis estático y escaneo de secretos, dependencias y licencias.
- Un tamaño máximo por pull request; un agente nunca fusiona su propio trabajo.
- Credenciales de agente de corta duración y mínimo privilegio, separadas de las cuentas humanas.
- Un sandbox con red restringida y una etiqueta en los commits de agentes.
El pull request de un agente pasa las mismas barreras que el de una persona, más una: una persona es dueña de las pruebas que definen el comportamiento, y el agente no puede editarlas para que su código pase.
Gobierno, licencias y propiedad intelectual en Colombia y Europa
Primero, la política. El modelo de capacidades de IA de DORA incluye una política de IA clara: qué herramientas, qué repositorios, qué datos y quién puede activar agentes en segundo plano. Sin ella, cada quien trae sus propias herramientas.
El código es un dato. Los repositorios guardan secretos empresariales y a veces datos personales. Elige planes que excluyan el entrenamiento con tu código, mantén los datos de producción lejos de los agentes y verifica dónde corre la inferencia. En Colombia, un proveedor que trata datos personales por tu cuenta necesita un contrato de transmisión, y las transferencias internacionales se rigen por el artículo 26 de la Ley 1581 de 2012. En la Unión Europea aplica el RGPD, y el artículo 4 reformado del AI Act (vigente desde el 27 de julio de 2026) pide a las empresas apoyar la alfabetización en IA de su personal.
Autoría y licencias. La Oficina de Derechos de Autor de EE. UU. concluyó en enero de 2025 que los prompts por sí solos no hacen protegible un resultado de IA: la protección exige autoría humana. Conserva la evidencia de la contribución humana (specs, revisiones, commits), lee los términos de propiedad intelectual de tu proveedor y escanea licencias, porque el código generado puede parecerse a código abierto existente.
Riesgo de proveedor. Las herramientas cambian de dueño (Cursor ahora es de SpaceX) y el acceso puede cambiar por razones políticas: una directiva de control de exportaciones de EE. UU. obligó a Anthropic a retirar Fable 5 a todos sus usuarios del 12 de junio al 1 de julio de 2026. Mantén las instrucciones en formatos abiertos, las herramientas en MCP y una segunda opción probada.
Un modelo operativo y las métricas que importan
| Métrica | Por qué importa | Cómo medirla | Señal de alerta |
|---|---|---|---|
| Lead time de cambios | La ganancia debe verse de punta a punta | Del primer commit a producción | Se programa más rápido, pero el lead time no baja |
| Tasa de fallas por cambio | DORA asocia la IA con menos estabilidad | Despliegues que causan incidente, rollback o hotfix | Sube tras la adopción |
| Tiempo de revisión | La revisión es el nuevo cuello de botella | De pull request abierto a aprobado | Cola creciente o aprobaciones instantáneas de cambios grandes |
| Tamaño del pull request | Los cambios pequeños sí se revisan | Mediana de líneas cambiadas, agentes y personas por separado | Los pull requests de agentes crecen |
| Retrabajo | El código casi correcto se corrige después | Reversiones y código reescrito en tres semanas | Se concentra en código de agentes |
| Hallazgos de seguridad | El 45 % de fallas de Veracode | Alertas de análisis estático y secretos por pull request | Más altos en pull requests de agentes |
| Costo por pull request fusionado | Los agentes cobran tokens y licencias | Consumo exportado entre pull requests fusionados | Crece más rápido que las entregas |
Despliega por etapas. Empieza donde la especificación es clara y verificar es barato: bugs con una prueba que los reproduce, actualizaciones de dependencias, escritura de pruebas, documentación, migraciones mecánicas. Suma agentes en segundo plano cuando existan barreras y métricas, y deja la arquitectura, el código sensible y las migraciones de datos bajo control humano estrecho. A las 8 a 12 semanas, compara con la línea base y decide repositorio por repositorio.
Nuestra regla práctica cuando construimos software a la medida: el agente escribe; las pruebas y los revisores deciden. Para agentes más allá del código, lee agentes de IA en producción.
Lo esencial
- Los agentes trabajan en el IDE, la terminal y la nube, donde convierten issues en pull requests: el cuello de botella pasa a la especificación y la revisión.
- SWE-bench Verified está saturado y en parte contaminado: cita Terminal-Bench 4.0, SWE-bench Pro o DeepSWE con versión y arnés, y luego prueba con tus propios issues.
- La evidencia sobre velocidad es mixta: 19 % más lento en el ensayo de METR de 2025, sin conclusión firme en 2026, y DORA asocia la IA con más volumen y menos estabilidad.
- El 45 % de las muestras generadas falló las pruebas de seguridad de Veracode, sin importar el tamaño del modelo: barreras de CI, control de dependencias e higiene de secretos son obligatorios.
- Mide lead time, tasa de fallas por cambio, tiempo de revisión y tamaño de pull request antes y después, y deja las pruebas en manos de personas.
Fuentes
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
- Developer productivity study: February 2026 update
- Announcing the 2025 DORA report
- Why we no longer evaluate SWE-bench Verified
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
- Terminal-Bench leaderboard
- 2025 GenAI Code Security Report
- 2025 Developer Survey: AI
- Copilot coding agent is now generally available
- Anthropic raises $30 billion Series G (Claude Code figures)
- Cursor joins SpaceX
- Measuring AI agent autonomy in practice
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Qué agente de código debería usar mi equipo?
Depende del modo que necesites: IDE para trabajo interactivo, terminal para quienes viven en la línea de comandos, nube para issues bien acotados. Prueba dos o tres herramientas durante dos semanas con issues cerrados de tus propios repositorios, y guarda las instrucciones en AGENTS.md para que cambiar siga siendo barato.
¿Los agentes de código hacen más rápidos a los desarrolladores?
A veces, y menos de lo que se siente. METR midió a desarrolladores experimentados un 19 % más lentos en 2025 y no llegó a una conclusión firme en 2026; DORA 2025 asocia la IA con más volumen de entregas y menos estabilidad. Mide tu propio lead time y tu tasa de fallas por cambio.
¿El código generado por IA es seguro?
No por defecto. Veracode encontró fallas del OWASP Top 10 en el 45 % de las muestras en 2025, sin mejora con modelos más grandes. Trata el código de agentes como cualquier contribución externa: análisis estático, escaneo de secretos y dependencias, y revisión humana de las rutas críticas.
¿De quién es el código que escribe un agente?
Depende de la jurisdicción y de tu contrato. La Oficina de Derechos de Autor de EE. UU. dice que los prompts por sí solos no hacen protegible el resultado y que se requiere autoría humana. Conserva la evidencia de la contribución humana, lee los términos de tu proveedor sobre entrenamiento y propiedad intelectual, y consulta a tu abogado.
¿Pueden los agentes trabajar en código que toca datos personales?
Sí, si los datos de producción quedan fuera de su alcance. Usa datos de prueba sintéticos, saca los secretos del entorno y verifica dónde corre la inferencia: en Colombia la Ley 1581 regula las transferencias al exterior y en la Unión Europea aplica el RGPD.
Más análisis para seguir
Claude Opus 5.5: qué cambia para las empresas
Lanzado el 22 de septiembre de 2026: más barato que Opus 5, nivel Fable 5.1 según Anthropic. Precio, benchmarks, cambios técnicos y cuándo usarlo.
CiberseguridadSeguridad de la cadena de suministro de IA: modelos, paquetes y servidores MCP
Modelos que ejecutan código, paquetes alucinados, servidores MCP y skills maliciosos: incidentes 2025–2026, controles que funcionan y deberes de la CRA.
Agentes e ingenieríaEvals: cómo probar un sistema con LLM
Por qué probar a ojo falla: set de oro en español y francés, jueces LLM calibrados, gates de regresión en CI, herramientas y cuánto cuesta evaluar.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.