Arquitectura de caché KV multinivel de AWS para inferencia LLM rentable
Línea temporal
-
AWS combina SageMaker HyperPod y Curvine para reducir costes de inferencia en LLM
AWS ha publicado una arquitectura de caché KV multinivel para inferencia de LLM en SageMaker HyperPod que integra Curvine (sistema de ficheros distribuido basado en NVMe) como tercera capa de almacenamiento compartido…