Streaming de pesos permite ejecutar modelos gigantes en hardware de consumo
Resumen En qué punto está
Desarrolladores independientes han logrado ejecutar modelos de lenguaje masivos (hasta 1 billón de parámetros) en hardware limitado mediante técnicas de streaming de pesos desde SSD, aprovechando arquitecturas Mixture-of-Experts que solo cargan en RAM los expertos activados. Comenzó con Qwen3.5-397B-A17B en un MacBook Pro con 48GB de RAM usando técnicas derivadas de investigación de Apple, y se extendió a Kimi K2.5 (1B parámetros) e incluso a ejecución en iPhone. Las cuantizaciones agresivas (2-4 bits) y el uso de herramientas de codificación asistidas por IA permitieron optimizar el rendimiento hasta varios tokens por segundo.
Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 5 h.
Enviar esta historia por correo
Línea temporal
-
Técnica de streaming expande acceso a modelos gigantes en hardware limitado
Desarrolladores independientes han logrado ejecutar modelos de lenguaje extremadamente grandes mediante una técnica de streaming de pesos desde almacenamiento SSD, evitando la limitación de RAM. En concreto, se han…
-
Ejecutar el modelo Qwen de 397B localmente en MacBook usando técnicas de Apple
Dan Woods consiguió ejecutar una versión personalizada del modelo Qwen3.5-397B-A17B a 5.5+ tokens/segundo en un MacBook Pro M3 Max de 48GB, usando técnicas de la investigación "LLM in a Flash" de Apple de 2023. El…