Ir al contenido
IA para hoy
Cerrada 2 noticias · 1 fuentesdel 19 mar al 24 mar

Streaming de pesos permite ejecutar modelos gigantes en hardware de consumo

Resumen En qué punto está

Desarrolladores independientes han logrado ejecutar modelos de lenguaje masivos (hasta 1 billón de parámetros) en hardware limitado mediante técnicas de streaming de pesos desde SSD, aprovechando arquitecturas Mixture-of-Experts que solo cargan en RAM los expertos activados. Comenzó con Qwen3.5-397B-A17B en un MacBook Pro con 48GB de RAM usando técnicas derivadas de investigación de Apple, y se extendió a Kimi K2.5 (1B parámetros) e incluso a ejecución en iPhone. Las cuantizaciones agresivas (2-4 bits) y el uso de herramientas de codificación asistidas por IA permitieron optimizar el rendimiento hasta varios tokens por segundo.

Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 5 h.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta historia por correo

Se envía el resumen de la historia, qué ha cambiado y su línea temporal. La dirección se usa solo para ese envío y no se guarda.

Línea temporal

  1. Simon WillisonFiabilidad una fuente fiable

    Técnica de streaming expande acceso a modelos gigantes en hardware limitado

    Desarrolladores independientes han logrado ejecutar modelos de lenguaje extremadamente grandes mediante una técnica de streaming de pesos desde almacenamiento SSD, evitando la limitación de RAM. En concreto, se han…

  2. Simon WillisonFiabilidad una fuente fiable

    Ejecutar el modelo Qwen de 397B localmente en MacBook usando técnicas de Apple

    Dan Woods consiguió ejecutar una versión personalizada del modelo Qwen3.5-397B-A17B a 5.5+ tokens/segundo en un MacBook Pro M3 Max de 48GB, usando técnicas de la investigación "LLM in a Flash" de Apple de 2023. El…

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.