vLLM muestra cuándo separar la inferencia ayuda y perjudica
Una guía práctica mide el equilibrio entre ventajas y costes de separar el procesamiento del prompt de la generación de tokens. La latencia de cola mejora bajo carga, pero trasladar la memoria de trabajo del modelo retrasa el primer token.