vLLM zeigt, wann getrennte Bereitstellung hilft und schadet
Ein praktischer Leitfaden misst den Zielkonflikt bei der Trennung von Prompt-Verarbeitung und Token-Erzeugung. Hohe Latenzen verbessern sich unter Last, doch das Übertragen des Arbeitsgedächtnisses verzögert das erste Token.