4/8/2026
6 min
Alberto Carrasco

¿Cuál es el mejor agente de IA?

Un estudio presentado en el congreso MSR 2026 analizó 7.156 pull requests reales de Codex, Claude Code, Cursor, Copilot y Devin. Estos son los resultados por tipo de tarea.

IAdesarrollo de softwareagentesestudios
¿Cuál es el mejor agente de IA?

Hasta ahora, elegir agente de IA para programar era cuestión de fe o de pruebas de laboratorio. Un estudio presentado en el congreso MSR 2026 hizo algo distinto: mirar 7.156 pull requests reales, enviadas a proyectos reales, y contar cuáles acabaron fusionadas. Hay ganador global. Y hay ganadores distintos según lo que le pidas.

Qué se midió exactamente

El trabajo es de Giovanni Pinna (Universidad de Trieste), Jingzhi Gong (King's College London), David Williams y Federica Sarro (University College London). Compara cinco agentes de programación: OpenAI Codex, GitHub Copilot, Devin, Cursor y Claude Code.

La métrica es la tasa de aceptación: de todas las pull requests que el agente abrió y que acabaron cerrándose, qué porcentaje terminó fusionándose en el proyecto. No es una prueba sintética. Es el veredicto de un revisor humano que decidió si ese código entraba o no.

El filtrado es exigente. Se quedaron solo con pull requests cerradas, de repositorios con licencia MIT o Apache-2.0, y que hubieran recibido al menos una revisión o comentario de alguien distinto de quien las creó. De 33.596 candidatas quedaron 7.156.

El ranking global

Codex gana con un 77,9 %. Y no es un artefacto de haber entrado en el estudio en un momento favorable: los autores repitieron el análisis restringiendo a las once semanas comunes a todos los agentes y el orden apenas se mueve. Codex sube a 79,9 %, Cursor se queda en 74,4 %, Claude Code en 72,6 %, y Devin y Copilot empatan en 68,0 %.

La columna de semanas activas merece atención. Devin lleva 32 semanas dentro del conjunto de datos y Copilot solo 11. No están medidos en el mismo periodo, y por eso los autores añadieron esa segunda comprobación.

De cada 100 pull requests que abrió Codex, casi 78 acabaron dentro del proyecto.

Resultado del estudio

Quién gana en cada tarea

Aquí es donde el ranking global deja de servir. Los autores clasificaron cada pull request por tipo de trabajo y compararon a los agentes dentro de cada categoría. El resultado no tiene un solo ganador.

Codex no gana en todas, pero es el único que nunca se hunde: su peor categoría son los tests, con 59,6 %, y la mejor las tareas de mantenimiento, con 88,6 %. Ese rango estrecho es lo que lo convierte en la apuesta segura cuando no sabes de antemano qué le vas a pedir.

Claude Code hace lo contrario. Destaca alto en documentación y en funcionalidad nueva, y se desploma escribiendo tests, hasta el 33,3 %. La diferencia entre Cursor y Claude Code en esa categoría es de 44,4 puntos, la mayor distancia entre dos agentes en todo el estudio.

El empate técnico corrigiendo errores

Merece un apartado porque el propio artículo académico no se pone de acuerdo consigo mismo. El resumen y la conclusión dicen que Cursor destaca corrigiendo errores, con un 80,4 %. La sección de resultados dice que quien lidera esa categoría es Codex, con un 83,0 %.

Donde sí hay diferencia clara es con Devin, que se queda en el 45,6 %. Es la brecha más amplia y mejor sostenida de todo el estudio.

Las únicas superioridades demostradas

Los autores hicieron 64 comparaciones cara a cara entre pares de agentes. Solo seis superaron el umbral de significancia estadística. Estas son las diferencias que el estudio demuestra, frente a las que simplemente sugiere.

Dos lecturas. La primera: Codex aparece dos veces y nunca pierde. La segunda, más útil: las seis victorias se concentran en corregir errores y crear funcionalidad. Es ahí donde de verdad importa qué agente usas. En documentación o en tareas de mantenimiento, la elección apenas mueve la aguja.

El dato que casi nadie mira

Las pull requests de GitHub Copilot reciben 4,94 revisiones cada una. Las de Codex, 1,39.

Eso significa que por cada cambio que propone Copilot, alguien tiene que sentarse a mirarlo tres veces y media más que con Codex. El estudio no afirma que una cosa cause la otra, y las diferencias pueden venir de la complejidad de las tareas o de las políticas de cada proyecto. Pero apunta a algo que no aparece en ninguna factura: el coste real de un agente no es su suscripción, son las horas de revisión que genera.

La letra pequeña

Tres cosas antes de tomar decisiones con estos números.

La muestra de Claude Code es pequeña. 139 pull requests frente a las 2.002 de Codex. Los propios autores piden interpretar sus resultados con cautela.

Aceptada no es lo mismo que buena. El estudio lo dice explícitamente: una pull request fusionada puede seguir introduciendo deuda técnica o vulnerabilidades. Nadie midió seguridad, mantenibilidad, complejidad ni defectos introducidos. De hecho, el artículo cita un trabajo longitudinal según el cual las ganancias de velocidad se concentran en los dos primeros meses de adopción, mientras que la complejidad del código se sigue acumulando después.

Los datos son de 2025. El conjunto cubre unos ocho meses, con la ventana común entre mayo y julio de ese año, y solo repositorios con más de cien estrellas. Todos estos agentes han cambiado de modelo desde entonces, algunos varias veces. El estudio dice quién iba mejor entonces, no necesariamente quién va mejor hoy.

Qué usar para qué

Traducido a decisiones:

  • Codex como agente por defecto, cuando el trabajo es variado y no quieres pensar cuál abrir.
  • Cursor cuando el encargo son tests o corrección de errores.
  • Claude Code para funcionalidad nueva y para documentar, asumiendo que la evidencia es más fina.
  • Copilot funciona, pero cuenta las horas de revisión antes de darlo por barato.
  • Devin es el único que mejora de forma sostenida con el tiempo, y lo hace además mientras asume tareas cada vez más difíciles. Hoy va por detrás; la pendiente es suya.

La conclusión que saca cualquiera que trabaje con esto a diario es que la pregunta "cuál es el mejor" está mal planteada desde el principio. La buena es: mejor para qué.

Fuente: Giovanni Pinna, Jingzhi Gong, David Williams y Federica Sarro, Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance, 23rd International Conference on Mining Software Repositories (MSR 2026). arXiv:2602.08915.

¿Hablamos de tu proyecto?

¿Te interesa automatizar tu negocio?

Reserva una demo gratuita y descubre cómo podemos ayudarte