Técnica de streaming expande acceso a modelos gigantes en hardware limitado
Hecho Qué ha ocurrido
Desarrolladores independientes han logrado ejecutar modelos de lenguaje extremadamente grandes mediante una técnica de streaming de pesos desde almacenamiento SSD, evitando la limitación de RAM. En concreto, se han documentado ejecuciones de Qwen3.5-397B-A17B en 48GB de RAM, Kimi K2.5 (1 billón de parámetros, 32B activos) en 96GB de M2 Max MacBook Pro, y la misma Qwen3.5-397B-A17B en iPhone a 0.6 tokens/segundo, con optimizaciones posteriores alcanzando 1.7 tokens/segundo en M4 Max de 128GB.
Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
La técnica democratiza el acceso a modelos de frontera al permitir su ejecución en hardware de consumo sin costosas GPUs, reduciendo significativamente las barreras de entrada para investigación, desarrollo y experimentación local de IA generativa.
- Quién se ve afectado
- Desarrolladores, investigadores, startups y empresas sin acceso a infraestructura GPU de alto coste; usuarios que requieren privacidad o desconexión de servicios cloud.
- Qué puede cambiar
- Si la técnica escala, se reducirían costes operacionales de inferencia, proliferaría la experimentación local con modelos grandes, y disminuiría la dependencia de APIs comerciales; también permitiría ejecutar modelos propios offline preservando confidencialidad.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Seguimiento del refinamiento de optimizaciones mediante bucles de autoinvestigación; adopción de la técnica en frameworks populares (vLLM, Ollama); velocidad de tokens alcanzable en diferentes hardwares; impacto en demanda de GPU cloud y en disponibilidad de modelos abiertos grandes.
Recomendación Qué debería hacer una empresa
Equipos de desarrollo e investigación deben experimentar con esta técnica en los próximos 6-12 meses para evaluar viabilidad en casos de uso locales, privacidad sensible y optimización de costes de inferencia.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Simon Willison. La referencia es siempre el artículo original.
Ver fuente original ↗LLMMixture-of-Expertsinferenceedge-AI Kimimodelos localesoptimizaciónQwenstreaming-inference
Forma parte de la historia Streaming de pesos permite ejecutar modelos gigantes en hardware de consumo (2 noticias, estado: cerrada).
Tu opinión
0 comentarios
Relacionadas
Ejecutar el modelo Qwen de 397B localmente en MacBook usando técnicas de Apple
Dan Woods consiguió ejecutar una versión personalizada del modelo Qwen3.5-397B-A17B a 5.5+ tokens/segundo en un MacBook Pro M3 Max de 48GB, usando técnicas de…
Por qué importaDemuestra que modelos de escala de 397B pueden ejecutarse localmente en hardware de consumo sin sacrificar demasiado rendimiento, eliminando…
Investigadores del Instituto Whitehead crean IA que descifra señales de comunicación celular
Un equipo del Instituto Whitehead, liderado por Pulin Li y Nicholas Hutchins, desarrolló IRIS, un sistema de IA que aprende a reconocer señales químicas…
Por qué importaEsta tecnología podría acelerar la investigación biomédica y el diseño de terapias para enfermedades complejas como el asma o la fibrosis pulmonar al…
OpenAI dice haber resuelto Navier-Stokes con 10.000 agentes de IA en 88 horas, entre dudas sobre el mérito
OpenAI afirma que un sistema experimental con cerca de 10.000 agentes de IA, superior a GPT-6 Astra, resolvió en 88 horas el problema de Navier-Stokes, uno de…
Por qué importaEl caso muestra el potencial de sistemas multiagente para acelerar investigación científica compleja, pero también expone riesgos de atribución y…
OpenAI corrige sin aviso su prueba matemática para citar a investigadores españoles
OpenAI modificó silenciosamente el artículo científico donde anunciaba haber resuelto un problema del milenio, añadiendo citas a los matemáticos españoles…
Por qué importaEl caso evidencia tensiones sobre atribución y transparencia científica cuando la IA se apoya en trabajo humano previo sin reconocerlo inicialmente…


