Optimización de inferencia multimodelo con LoRA en arquitecturas MoE
Enviar esta historia por correo
Línea temporal
-
AWS y vLLM optimizan la inferencia multimodelo con adaptadores LoRA en MoE
AWS ha desarrollado junto con la comunidad vLLM un kernel especializado (fused_moe_lora) para servir múltiples modelos fine-tuneados con LoRA sobre arquitecturas Mixture of Experts (MoE) de forma eficiente en GPU…