Lilith.
⌕
Ilustración editorial: Agent Lightning entrena agentes en su entorno real con 3500 líneas de código
Ilustración de Lilith · remezcla editorial

Microsoft ha publicado Agent Lightning v1.0, un framework compacto para aplicar reinforcement learning a agentes dentro del entorno en el que realmente operarán. Con 6000 ejemplos de entrenamiento, Qwen3.5-9B pasó del 41,8 % al 56,4 % en SWE-bench Verified.

El harness entra en el entrenamiento en lugar de bloquear la integración

En un framework de RL convencional, el sistema de entrenamiento controla la interacción con el entorno. Agent Lightning deja las herramientas, el contexto y el flujo de control en manos del agent harness real. Observa las peticiones al modelo mediante un proxy compatible con OpenAI API, por lo que no hace falta reconstruir el agente dentro del entrenador.

Según sus autores, la versión 1.0 tiene unas 3500 líneas de código y admite ejecución local y Kubernetes Jobs. La probaron con un agente general de instruction following, un agente de búsqueda y un coding agent. Para este último también publicaron el pipeline de limpieza de datos y scripts de entrenamiento reproducibles.

Los equipos pueden entrenar con las mismas reglas que gobiernan producción

La consecuencia práctica va más allá del benchmark. El comportamiento de un agente depende del modelo, la construcción del contexto, las herramientas, los subagentes y la recuperación ante fallos. Entrenarlo en un bucle simplificado puede optimizar un sistema distinto del que después llega a producción.

La arquitectura con proxy conserva el harness mientras cambia el modelo que hay debajo. Para los equipos que desarrollan su propio coding agent, podría acortar el camino entre un fallo en producción y un ejemplo de entrenamiento. También convierte el harness en una parte versionada del experimento, no en simple infraestructura de fondo.

Un resultado sólido no elimina la inestabilidad del agentic RL

La mejora de 14,6 puntos porcentuales es considerable, pero procede de un solo modelo y de SWE-bench Verified. La expresión modest compute del paper tampoco define un presupuesto universal. El resultado demuestra que un pipeline concreto funciona, no que supere a todos los frameworks de RL.

Los propios autores detallan los puntos difíciles: retokenización entre llamadas, fusión de muestras, cálculo de advantage, normalización de loss y planificación de GPU con un número variable de muestras. Un codebase pequeño facilita revisar esas decisiones, pero otros experimentos tendrán que validarlas.

La reproducción con otros agentes decidirá el valor de las 3500 líneas

La señal decisiva será que equipos independientes reproduzcan la mejora con otros modelos, tareas y harnesses sin reconstruir el workflow a escondidas. También importarán los costes, la estabilidad entre ejecuciones y la comparación con supervised fine-tuning sobre los mismos datos.

Si el framework mantiene sus resultados fuera de SWE-bench, el proxy puede convertirse en una frontera práctica entre operar un agente y mejorarlo. Si no, las 3500 líneas seguirán siendo un testbed de investigación elegante.

El veredicto de Lilith

Agent Lightning coloca Qwen3.5-9B en la misma planta donde el agente maneja herramientas y tropieza con su propio contexto. Ahora otros equipos deben demostrar si 3500 líneas también aguantan su turno de producción.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗