Hugging Face demuestra mejora de salidas estructuradas con GRPO en modelo 350M
Línea temporal
-
Hugging Face muestra cómo GRPO mejora salidas estructuradas en un modelo de 350M parámetros
Un tutorial de Hugging Face aplica fine-tuning con GRPO y LoRA sobre LFM2.5-350M usando ~500 muestras y 100 pasos de entrenamiento, dirigido a mejorar el cumplimiento de esquemas JSON/YAML. El benchmark IFStruct pasa de…