Tecnología
GRPO
Relacionadas
LLM ×2Hugging Face ×2agentes ×1RAG ×1razonamiento ×1LoRA ×1Liquid AI ×1tool-calling ×1
Historias
Noticias
Hugging Face muestra cómo GRPO mejora salidas estructuradas en un modelo de 350M parámetros
Un tutorial de Hugging Face aplica fine-tuning con GRPO y LoRA sobre LFM2.5-350M usando ~500 muestras y 100 pasos de entrenamiento, dirigido a mejorar el…
Por qué importaDemuestra que el fine-tuning con RL de bajo coste puede mejorar sustancialmente la fiabilidad de salidas estructuradas en modelos pequeños…
Impacto bajo
Fiabilidad fuente primaria
Hugging Face
IBM Granite 4.2: modelos de razonamiento con capacidad de agentes y contexto de 512K
IBM ha lanzado Granite 4.2, una familia de modelos de lenguaje densos enfocados en razonamiento, disponibles en tres tamaños: 3B, 8B y 30B. Los modelos se…
Por qué importaGranite 4.2 representa un hito en modelos abiertos de razonamiento y capacidad de agentes autónomos, con contexto extremadamente largo y…
Impacto alto
Fiabilidad fuente primaria
Hugging Face
