Microsoft Research lanza Agent Lightning v1.0, framework ligero de RL para agentes con harnesses reales

Hecho Qué ha ocurrido
Microsoft Research Asia ha publicado Agent Lightning v1.0, un framework de aprendizaje por refuerzo (RL) de código abierto de unas 3.500 líneas que permite entrenar agentes de IA usando el mismo harness con el que se despliegan, sin reimplementarlos. El sistema incluye soporte nativo para Kubernetes y un esquema de 'Collocated Async RL' que logra el doble de velocidad frente a RL síncrono con menos GPUs. En un pipeline de ejemplo sobre codificación, elevó el rendimiento de Qwen3.5-9B en SWE-bench Verified del 41,8% al 56,4% de Pass@1 usando solo unas 6.000 muestras de entrenamiento.
Resumen generado mediante IA a partir de Microsoft Research (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Reduce drásticamente el coste y la complejidad de mejorar agentes de IA en producción mediante RL, al evitar reconstruir el agente dentro del framework de entrenamiento. Esto acerca el entrenamiento con RL a equipos técnicos que ya usan harnesses existentes como Claude Code, OpenHands o Codex.
- Quién se ve afectado
- Equipos de IT, desarrollo e investigación que construyen o mejoran agentes de IA autónomos para codificación u otras tareas.
- Qué puede cambiar
- Las empresas podrán afinar agentes con RL sin reescribir su lógica de orquestación ni depender de sandboxes comerciales, usando infraestructura Kubernetes propia o en la nube.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Conviene seguir la adopción del framework por parte de la comunidad open source, posibles integraciones con otros harnesses populares y si aparecen resultados comparables en tareas distintas a codificación.
Recomendación Qué debería hacer una empresa
Equipos de IA que ya operan agentes en producción con harnesses propios deberían evaluar Agent Lightning v1.0 en los próximos 3-6 meses como alternativa de bajo coste para afinar agentes mediante RL.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Microsoft Research (fuente primaria). La referencia es siempre el artículo original.
Ver fuente original ↗aprendizaje por refuerzoagentesLLMKubernetescoding Microsoft ResearchMicrosoft Research Asia Agent Lightningagentes de IAMicrosoft ResearchRLSWE-bench
Tu opinión
0 comentarios
Relacionadas
Liquid AI lanza modelos de decisión multimodales d1 para dispositivos edge
Liquid AI publicó en Hugging Face los modelos abiertos d1-3B y d1-omni-600M, basados en sus Liquid Foundation Models, que responden con una única pasada hacia…
Por qué importaOfrece una alternativa eficiente a los LLM generativos para tareas de clasificación y decisión estructurada en dispositivos con recursos limitados…
AWS muestra cómo automatizar la remediación tras investigaciones de su agente DevOps
AWS publica una guía técnica que usa Lambda Durable Functions, EventBridge y Amazon Bedrock para convertir los informes de investigación de AWS DevOps Agent en…
Por qué importaReduce el tiempo entre detección, diagnóstico y resolución de incidentes (MTTR) manteniendo control humano sobre cambios críticos en infraestructura…
Google lanza Playground, plataforma experimental para crear videojuegos con IA mediante texto
Google Labs lanzó Playground, una plataforma que permite crear videojuegos para navegador usando prompts de texto, sin necesidad de programar. Los usuarios…
Por qué importaReduce drásticamente la barrera técnica para crear software interactivo, lo que podría democratizar el desarrollo de juegos y prototipos digitales…
Google lanza sitio web público para detectar contenido con marca de agua SynthID de múltiples proveedores de IA
Google ha lanzado SynthID.com, un sitio web que permite comprobar si una imagen, vídeo o audio contiene la marca de agua invisible SynthID, incluida la…
Por qué importaFacilita a empresas y usuarios verificar la autenticidad de contenido digital, un problema creciente con la proliferación de deepfakes y contenido…


