Tecnología
KV caching
Relacionadas
AWS ×2LLM ×1RAG ×1Amazon ×1Kubernetes ×1tensor parallelism ×1LMCache ×1escalado automático ×1enrutamiento inteligente ×1
Historias
Noticias
AWS SageMaker HyperPod: optimización de inferencia con auto-escalado dinámico
AWS ha publicado una guía de buenas prácticas para desplegar modelos de inferencia en Amazon SageMaker HyperPod, destacando capacidades de escalado dinámico…
Por qué importaPara equipos que despliegan modelos generativos a escala, la automatización de infraestructura y el escalado a cero pueden traducirse en ahorros…
AWS mejora el contenedor LMI con caché inteligente para inferencia de contextos extensos
AWS ha publicado actualizaciones al contenedor Large Model Inference (LMI) con soporte para LMCache, una solución de caché de pares clave-valor que reutiliza…
Por qué importaReduce significativamente los costes de inferencia en cargas de trabajo con contextos largos (millones de tokens), permitiendo procesar el doble de…