vLLM montre quand séparer l'inférence aide ou pénalise
Un guide pratique mesure le compromis entre traitement des prompts et génération des tokens séparés. Les latences les plus élevées diminuent sous charge, mais transférer la mémoire de travail retarde le premier token.