Ir al contenido
IA para hoy
Investigación Investigación

Ejecutar el modelo Qwen de 397B localmente en MacBook usando técnicas de Apple

Ejecutar el modelo Qwen de 397B localmente en MacBook usando técnicas de Apple
Foto: Sergei Starostin · Licencia Pexels · Pexels

Hecho Qué ha ocurrido

Dan Woods consiguió ejecutar una versión personalizada del modelo Qwen3.5-397B-A17B a 5.5+ tokens/segundo en un MacBook Pro M3 Max de 48GB, usando técnicas de la investigación "LLM in a Flash" de Apple de 2023. El modelo, que ocupa 209GB en disco (120GB cuantizado), se ejecutó aprovechando su arquitectura Mixture-of-Experts (MoE) para transmitir los pesos de expertos desde SSD a RAM bajo demanda. Woods utilizó Claude Code para ejecutar 90 experimentos y generar código optimizado en MLX, Objective-C y Metal, resultando en expertos cuantizados a 2 bits (actualizado a 4 bits en versión posterior) mientras mantiene 5.5GB en RAM.

Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

Demuestra que modelos de escala de 397B pueden ejecutarse localmente en hardware de consumo sin sacrificar demasiado rendimiento, eliminando dependencia de APIs en la nube y preservando privacidad de datos. Para empresas y profesionales, abre la posibilidad de usar modelos potentes sin costes recurrentes de inferencia en línea.

Quién se ve afectado
Desarrolladores, investigadores, empresas con restricciones de privacidad o latencia, y cualquier organización interesada en inferencia de IA local sin dependencia de servicios cloud.
Qué puede cambiar
La ejecución local de modelos masivos pasa de ser un ejercicio teórico a una realidad práctica en hardware de gama alta, lo que podría reducir dependencia de proveedores cloud para ciertos casos de uso y permitir despliegues privados de IA en dispositivos cliente.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

La adopción de técnicas de cuantización y streaming de pesos en aplicaciones reales; benchmarks de calidad a diferentes niveles de cuantización (2-bit vs 4-bit); disponibilidad de herramientas y librerías que generalicen este enfoque; interés de fabricantes de hardware en optimizar para este patrón.

Recomendación Qué debería hacer una empresa

Las empresas con requisitos de privacidad o latencia críticos deberían evaluar en los próximos 6-12 meses si este enfoque es viable para sus modelos y hardware disponible, monitoreando la madurez de herramientas como flash-moe y resultados de evaluaciones de calidad en dominio real.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: Simon Willison. La referencia es siempre el artículo original.

Ver fuente original ↗

LLMMixture-of-Expertscuantizaciónstreaming de pesosMLX AppleAnthropic Applecuantizacióninferencia localoptimización de hardwareQwen

Fuentes de esta historia

Esta noticia forma parte de una historia cubierta por 2 publicaciones. La fiabilidad sube cuando varias fuentes independientes la confirman.

  1. Simon Willison estás leyendo esta
    · una fuente fiable · artículo original ↗
  2. Simon Willison
    · una fuente fiable · artículo original ↗

Ver la historia completa con su línea temporal →

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Investigación 2 fuentes

Técnica de streaming expande acceso a modelos gigantes en hardware limitado

Desarrolladores independientes han logrado ejecutar modelos de lenguaje extremadamente grandes mediante una técnica de streaming de pesos desde almacenamiento…

Por qué importaLa técnica democratiza el acceso a modelos de frontera al permitir su ejecución en hardware de consumo sin costosas GPUs, reduciendo…

Impacto alto Fiabilidad una fuente fiable Relevancia 7/10 Simon Willison
Investigación

Investigadores del Instituto Whitehead crean IA que descifra señales de comunicación celular

Un equipo del Instituto Whitehead, liderado por Pulin Li y Nicholas Hutchins, desarrolló IRIS, un sistema de IA que aprende a reconocer señales químicas…

Por qué importaEsta tecnología podría acelerar la investigación biomédica y el diseño de terapias para enfermedades complejas como el asma o la fibrosis pulmonar al…

Impacto bajo Fiabilidad declaración interesada Infobae Tecno
Investigación 3 fuentes

OpenAI dice haber resuelto Navier-Stokes con 10.000 agentes de IA en 88 horas, entre dudas sobre el mérito

OpenAI afirma que un sistema experimental con cerca de 10.000 agentes de IA, superior a GPT-6 Astra, resolvió en 88 horas el problema de Navier-Stokes, uno de…

Por qué importaEl caso muestra el potencial de sistemas multiagente para acelerar investigación científica compleja, pero también expone riesgos de atribución y…

Impacto medio Fiabilidad confirmado por varias fuentes Relevancia 8/10 20minutos Tecnología
Investigación 3 fuentes

OpenAI corrige sin aviso su prueba matemática para citar a investigadores españoles

OpenAI modificó silenciosamente el artículo científico donde anunciaba haber resuelto un problema del milenio, añadiendo citas a los matemáticos españoles…

Por qué importaEl caso evidencia tensiones sobre atribución y transparencia científica cuando la IA se apoya en trabajo humano previo sin reconocerlo inicialmente…

Impacto bajo Fiabilidad confirmado por varias fuentes Relevancia 7/10 El País Tecnología