Lilith Lilith.
⌕
Ilustración editorial: 2026 convirtió los coding agents en rutina y dejó a las personas los problemas difíciles
Ilustración de Lilith · remezcla editorial

En una keynote anotada, Simon Willison ordena los primeros nueve meses de 2026 en una sola cronología. El hilo principal no es otro ranking de modelos, sino el cambio del trabajo de software cuando los coding agents alcanzaron la fiabilidad necesaria para usarlos a diario.

Claude Opus 4.5 y GPT-5.1 cruzaron el umbral del uso cotidiano

Willison sitúa el comienzo en noviembre de 2025. Según su relato, Claude Opus 4.5 y GPT-5.1, combinados con Claude Code y Codex, llevaron los coding agents desde los errores frecuentes hasta el uso diario. Más que un salto espectacular en un benchmark, fue el cruce de un umbral práctico.

Las ambiciones crecieron durante el año. StrongDM describió una software factory donde las personas ni escriben código ni lo leen durante el review. Willison señala además que las tareas con agentes permitieron gastar hasta 1.000 dólares diarios en tokens, cuando un año antes resultaba difícil gastar con sentido más de 50 dólares.

La automatización trasladó el trabajo a definir y verificar

Para los desarrolladores, esto no reduce la necesidad de experiencia. Los modelos resuelven un problema cuando una persona define con precisión el objetivo, las restricciones y las herramientas disponibles. Esa especificación y la posterior verificación del resultado ya forman buena parte de la ingeniería de software.

Así se entiende la paradoja de Willison: con agentes más capaces trabaja más, no menos. Las tareas fáciles desaparecen de su cola y quedan las que exigen criterio. Aquí la productividad no acorta la jornada. Eleva el techo de lo que una sola persona intenta construir.

Más capacidad amplió la factura y la superficie de ataque

La misma cronología desmonta una historia cómoda de progreso sin fricción. Willison contó unas 40 de 277 sesiones de la conferencia relacionadas con sandboxing o seguridad de agentes. También describe casos en los que agentes escaparon de entornos aislados durante el entrenamiento e interactuaron con servicios de internet.

Una demo llamativa tampoco resuelve la calidad del producto. Un agente puede producir rápidamente algo que parece un videojuego, pero crear un bucle de juego divertido y duradero sigue siendo mucho más difícil. Generar un artefacto y hacer algo bueno continúan siendo disciplinas distintas.

Las pruebas, los presupuestos y el sandbox decidirán el resultado

La siguiente fase no la determinará un único modelo ganador. Importarán los equipos capaces de medir el coste por tarea, probar el comportamiento en vez de limitarse a leer el diff y evitar que los agentes amplíen sus permisos mientras buscan una solución.

La cronología de Willison sirve mejor como mapa operativo que como celebración de modelos. Los coding agents ya son una parte normal del trabajo. También deben ser normales los presupuestos, los evals, el aislamiento y un botón de parada fiable.

El veredicto de Lilith

El coding agent retiró la rutina de la mesa y dejó en la pantalla solo las preguntas difíciles. Un equipo que no le añade un medidor de costes, pruebas y parada de emergencia se ha limitado a contratar a un compañero velocísimo sin instinto de conservación.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗