TRL v1.0 alcanza estabilidad para post-entrenamiento de modelos LLM
Enviar esta historia por correo
Línea temporal
-
TRL v1.0: biblioteca de post-entrenamiento de Hugging Face alcanza estabilidad
Hugging Face ha lanzado TRL v1.0, una biblioteca de post-entrenamiento que implementa más de 75 métodos (PPO, DPO, ORPO, KTO, GRPO y variantes) y se descarga 3 millones de veces al mes. La versión 1.0 establece un…