Taalas optimiza inferencia de Llama con hardware dedicado a 17k tokens/s
Enviar esta historia por correo
Línea temporal
-
Taalas ejecuta Llama 3.1 8B a 17.000 tokens por segundo con hardware personalizado
Taalas, startup de hardware canadiense, anunció su primer producto: una implementación de hardware personalizado de Llama 3.1 8B capaz de ejecutarse a 17.000 tokens por segundo. El modelo usa cuantización agresiva…