Ai2 lanza Olmo-core 3, infraestructura abierta para entrenar modelos MoE a escala de billones de parámetros

Hecho Qué ha ocurrido
Ai2 presentó Olmo-core 3, una infraestructura de entrenamiento abierta para modelos de mezcla de expertos (MoE). En pruebas, el sistema escaló de 8 a 128 expertos manteniendo fijos los parámetros activos, y se benchmarkeó con más de un billón de parámetros totales, alcanzando 1,2 billones con 512 GPUs. Con MXFP8 el rendimiento de entrenamiento fue un 21% superior a BF16, y frente a su implementación anterior basada en FSDP logró 2,7 veces más rendimiento en GPUs NVIDIA B300.
Resumen generado mediante IA a partir de Hugging Face (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Reduce las barreras de coste y complejidad para entrenar modelos MoE masivos, democratizando el acceso a infraestructura que antes solo tenían grandes laboratorios. Es la base del próximo modelo Olmo, íntegramente abierto.
- Quién se ve afectado
- Laboratorios de investigación en IA, empresas de infraestructura cloud/GPU y desarrolladores de modelos open source.
- Qué puede cambiar
- Investigadores y empresas con recursos limitados podrán experimentar con arquitecturas MoE de gran escala usando una pila de entrenamiento abierta y optimizada, en vez de depender solo de Megatron-Core u otras soluciones propietarias.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar el lanzamiento del próximo modelo Olmo basado en esta infraestructura, adopción por terceros del stack en GitHub, y comparativas de rendimiento frente a Megatron-Core en producción real.
Recomendación Qué debería hacer una empresa
Equipos de IA con capacidad técnica propia pueden evaluar Olmo-core 3 en los próximos 6-12 meses para experimentar con arquitecturas MoE propias sin depender de soluciones cerradas.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Hugging Face (fuente primaria). La referencia es siempre el artículo original.
Ver fuente original ↗mixture-of-expertsMoEchipsLLM Ai2NVIDIA AI2código abiertoinfraestructura IAMoEOlmo-core
Tu opinión
0 comentarios
Relacionadas
Google DeepMind lanza SynthID Bio para marcar proteínas diseñadas por IA
Google DeepMind presentó SynthID Bio, tecnología que incrusta una marca de agua invisible en proteínas diseñadas por IA, detectable en la secuencia o…
Por qué importaBusca mitigar el riesgo de que diseños sintéticos de IA eludan los controles de bioseguridad en la síntesis de ADN y contaminen bases de datos…
Investigadores corrigen métricas de evaluación de modelos de IA para predicción de perturbaciones genéticas
Un estudio publicado en Nature Machine Learning muestra que los benchmarks previos que afirmaban que los modelos de deep learning no superan líneas base…
Por qué importaEsto revitaliza la viabilidad de usar IA para modelar el impacto transcriptómico de perturbaciones génicas, con potencial para acelerar el…
Microsoft Research desarrolla sistema de IA para predecir riesgos de clima espacial en la red eléctrica
Microsoft Research presentó un sistema de machine learning que predice riesgos de clima espacial para 66.935 subestaciones eléctricas en EEUU con 30-60 minutos…
Por qué importaLas tormentas geomagnéticas pueden dañar transformadores y equipos críticos de la red eléctrica, y un sistema de alerta temprana localizado…
Google desarrolla sistema de marca de agua para proteínas diseñadas por IA
Google ha desarrollado una herramienta para marcar con marca de agua (watermark) proteínas diseñadas por inteligencia artificial, con el objetivo de mejorar la…
Por qué importaLa IA de diseño de proteínas tiene doble uso: puede crear enzimas beneficiosas o toxinas peligrosas, y hasta ahora no existían mecanismos para…



