Empresa
Qwen
Relacionadas
LLM ×2Hugging Face ×2Google DeepMind ×1robótica ×1voz ×1inferencia en tiempo real ×1optimización de inferencia ×1Cerebras ×1
Historias
Noticias
Hugging Face optimiza inferencia de modelos en vLLM sin reescribir código
Hugging Face anunció una mejora en el backend de transformers para vLLM que permite ejecutar modelos de lenguaje con velocidad comparable a implementaciones…
Por qué importaReduce la barrera técnica para desplegar cualquier modelo de Hugging Face a velocidad de producción; permite a autores de modelos y equipos de ML…
Hugging Face y Cerebras logran experiencias de voz en tiempo real con Gemma 4
Hugging Face y Cerebras han presentado una demostración de pipeline de voz a voz en tiempo real utilizando el modelo Gemma 4 31B de Google DeepMind, la…
Por qué importaLa latencia predecible es crítica para que las interfaces de voz se sientan naturales y responsivas en lugar de frustrantemente lentas. Para empresas…