Ir al contenido
IA para hoy
Herramientas y productos Benchmark

AWS y NVIDIA reducen costes de inferencia de reconocimiento de voz en un 75%

AWS y NVIDIA reducen costes de inferencia de reconocimiento de voz en un 75%
Foto: Joël van der Loo · CC BY-SA 4.0 · Wikimedia Commons

Hecho Qué ha ocurrido

AWS, NVIDIA y Heidi Health han publicado un estudio técnico demostrando cómo usar NVIDIA CUDA Multi-Process Service (MPS) en Amazon EC2 reduce la infraestructura GPU necesaria para servir modelos de reconocimiento automático de voz (ASR) de 16 instancias a 4, manteniendo una latencia por debajo de un segundo y procesando 92,1 solicitudes por segundo por GPU. El método aprovecha la capacidad concurrente de MPS para ejecutar múltiples procesos simultáneamente, evitando el problema por el cual cada solicitud ASR típicamente usa solo el 15-20% de la capacidad del GPU, dejando el 80% inactivo.

Resumen generado mediante IA a partir de AWS Machine Learning Blog (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

Reduce drásticamente los costes operativos de desplegar modelos de IA en producción, lo que es crítico para empresas de servicios basados en voz como centros de atención al cliente, transcripción clínica y análisis de audio. La técnica es directamente aplicable a cualquier carga de trabajo de inferencia donde múltiples procesos pequeños comparten GPU.

Quién se ve afectado
Empresas que ejecutan modelos ASR en producción a escala (healthtech, contact centers, plataformas de transcripción, análisis de audio) y equipos de infraestructura que optimizan costes de computación GPU.
Qué puede cambiar
La validación de MPS como mecanismo de compartición GPU eficiente podría generalizar el uso de esta técnica en infraestructuras de inferencia, desplazando decisiones entre time-slicing, MIG y MPS según carga de trabajo. Para Heidi Health específicamente, permite procesar 2,4 millones de consultas clínicas semanales con un 75% menos de hardware.

Análisis generado a partir de la información disponible; no procede de la fuente.

Ilustración generada con IA por IA para hoy

Predicción Qué observar a continuación

Adopción de MPS en otros servicios de IA de AWS (SageMaker, Bedrock); extensión de estas optimizaciones a otros modelos pequeños y cargas batch; impacto en precios de instancias GPU; replicación de estos resultados con otros modelos y backends de inferencia.

Recomendación Qué debería hacer una empresa

Evaluar CUDA MPS en los próximos 3-6 meses si la empresa ejecuta múltiples cargas de ASR o inferencia ligera en GPU, especialmente en entornos multicliente. Prototipar en paralelo con arquitectura actual y medir latencia real según SLAs específicos.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: AWS Machine Learning Blog (fuente primaria). La referencia es siempre el artículo original.

Ver fuente original ↗

CUDA MPSNVIDIA Triton Inference ServerONNX RuntimeTensorRTASR AWSNVIDIAHeidi Health AWSGPUinferenciaoptimización de costesreconocimiento-de-voz

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

AWS lanza enrutamiento consciente de prefijos en SageMaker Inference para reducir latencia de LLM

Amazon SageMaker Inference introduce prefix-aware routing, una estrategia que envía peticiones con el mismo prefijo de prompt a la misma instancia para…

Por qué importaPara empresas que despliegan LLMs a escala con prompts que comparten contexto (RAG, bots con instrucciones largas, conversaciones multi-turno), esto…

Impacto medio Fiabilidad una fuente fiable AWS Machine Learning Blog

AWS añade caché de modelos en SageMaker HyperPod para reducir arranques en frío

AWS lanzó soporte de model caching en Amazon SageMaker HyperPod para inferencia, que precarga pesos de modelos e imágenes de contenedor en almacenamiento NVMe…

Por qué importaPara empresas que despliegan LLMs grandes en producción, los tiempos de arranque en frío limitan la capacidad de autoescalado real ante picos de…

Impacto medio Fiabilidad una fuente fiable AWS Machine Learning Blog

Slack lanza Slackforce Surfaces para crear informes y dashboards con IA en chats

Slack presentó Slackforce Surfaces, una función que permite generar dentro del chat informes interactivos, encuestas, dashboards, presentaciones y micrositios…

Por qué importaReduce la fricción de crear contenido visual o analítico sin salir del flujo de trabajo colaborativo, integrando datos de múltiples fuentes…

Impacto bajo Fiabilidad una fuente fiable The Verge AI

AWS integra el modelo Marengo 3.0 de TwelveLabs en Bedrock Knowledge Bases para búsqueda multimodal

AWS anunció la disponibilidad general de TwelveLabs Marengo Embed 3.0 como modelo de embeddings en Amazon Bedrock Knowledge Bases, permitiendo búsqueda…

Por qué importaSimplifica drásticamente la construcción de sistemas de búsqueda semántica en contenido audiovisual, un proceso que antes requería integrar múltiples…

Impacto medio Fiabilidad una fuente fiable AWS Machine Learning Blog