Tecnología
inferencia local
Relacionadas
edge-ai ×1Google DeepMind ×1difusión de texto ×1MoE ×1generación paralela ×1Hugging Face ×1WebGPU ×1WGSL ×1kernels GPU ×1ONNX Runtime ×1
Historias
Noticias
Hugging Face lanza 207 kernels WebGPU optimizados para IA en navegador
Hugging Face ha publicado @huggingface/kernels, una biblioteca con 207 kernels WebGPU optimizados para ejecutar modelos de IA localmente en el navegador. Cada…
Por qué importaLa inferencia local en navegador reduce latencia, coste de servidor y dependencia de APIs externas, haciendo viable desplegar IA en aplicaciones web…
DiffusionGemma: nuevo modelo abierto de Google DeepMind genera texto 4x más rápido
Google DeepMind ha lanzado DiffusionGemma, un modelo experimental abierto de 26B parámetros con arquitectura Mixture of Experts que genera texto hasta 4x más…
Por qué importaResuelve un cuello de botella crítico en aplicaciones interactivas locales: la latencia de inferencia en tiempo real. Para desarrolladores que…
