AWS impulsa fine-tuning por refuerzo con Lambda en Bedrock y SageMaker
Resumen En qué punto está
AWS ha desarrollado durante los últimos meses una serie de capacidades de fine-tuning por refuerzo (RFT/RLVR/RLAIF) en Bedrock y SageMaker, inicialmente para modelos Nova y luego extendidas a modelos abiertos como GPT-OSS y Qwen. La técnica usa funciones de recompensa ejecutadas en AWS Lambda para personalizar modelos con muchos menos datos etiquetados que el fine-tuning supervisado tradicional. AWS ha publicado guías con resultados concretos, incluyendo mejoras de hasta 66% en precisión y 57% en llamadas a herramientas de agentes. El desarrollo más reciente detalla patrones de diseño de funciones de recompensa multidimensionales para evitar la explotación del sistema de recompensas.
Resumen generado mediante IA a partir de las 4 noticias de la historia. Última actualización: hace 3 h.
Enviar esta historia por correo
Línea temporal
-
AWS Lambda para funciones de recompensa en personalización de Amazon Nova
AWS publica una guía técnica sobre cómo construir funciones de recompensa escalables con Lambda para fine-tuning por refuerzo de modelos Amazon Nova. La solución permite elegir entre RLVR (aprendizaje por refuerzo con…
-
AWS publica guía de fine-tuning por refuerzo en Amazon Bedrock con mejoras de hasta 66%
AWS publica una guía de mejores prácticas para fine-tuning por refuerzo (RFT) en Amazon Bedrock, que permite personalizar modelos como Amazon Nova mediante señales de recompensa en lugar de grandes conjuntos…
-
AWS SageMaker mejora agentes IA con fine-tuning por refuerzo verificable para llamadas de herramientas
AWS ha publicado un tutorial sobre fine-tuning de modelos de IA para mejorar las llamadas a herramientas en agentes mediante técnica RLVR (Reinforcement Learning with Verifiable Rewards) en SageMaker AI. El equipo…
-
AWS Bedrock amplía fine-tuning por refuerzo a modelos abiertos GPT-OSS y Qwen
AWS anunció en febrero de 2026 la extensión de su servicio Reinforcement Fine-Tuning (RFT) en Amazon Bedrock a modelos abiertos como OpenAI GPT-OSS 20B y Qwen 3 32B, tras el lanzamiento inicial con modelos Nova en…