Microsoft Research lanza Agent Lightning v1.0, un marco RL ligero para arneses de agentes reales
Agent Lightning v1.0 es un marco de código abierto de 3.500 líneas que entrena agentes usando sus arneses de despliegue, con soporte nativo de Kubernetes y una mejora demostrada en el rendimiento de agentes de codificación.
Publicación de la fuente original: 7 de octubre de 2026
Microsoft Research Asia ha publicado como código abierto Agent Lightning v1.0, un marco de aprendizaje por refuerzo construido alrededor del paradigma Harnessed Agentic RL. Todo el sistema consta de aproximadamente 3.500 líneas de código y se conecta directamente al arnés existente de un agente a través de un proxy LLM, eliminando la necesidad de reimplementar el agente dentro del bucle de entrenamiento.
El marco ejecuta agentes como trabajos estándar de Kubernetes, evitando servicios comerciales de sandbox, e introduce Collocated Async RL, que según los autores brinda aproximadamente un aumento de 2× en la velocidad de extremo a extremo respecto al RL sincrónico, usando menos GPU. En un experimento de agente de codificación de extremo a extremo, entrenar Qwen3.5‑9B con unas 6.000 muestras elevó Pass@1 en SWE‑bench Verified del 41,8 % al 56,4 %, una mejora de 14,6 puntos.