DPD en SageMaker HyperPod mejora latencia de LLMs en alta concurrencia
Línea temporal
-
AWS optimiza inferencia de LLMs con separación de prefill y decode en SageMaker HyperPod
AWS publica cómo implementar Disaggregated Prefill and Decode (DPD) con vLLM en SageMaker HyperPod, una técnica que separa el procesamiento de prompts largos (prefill, compute-bound) del de generación de tokens (decode…