vLLM toont wanneer gescheiden inferentie helpt en hindert

Een praktische gids meet de afweging bij het scheiden van promptverwerking en tokengeneratie. Hoge latenties verbeteren onder belasting, maar het verplaatsen van het werkgeheugen van het model vertraagt het eerste token.

6 oktober 2026 · 3 min · Martin Seckar

Strata-fork blaast IBM-AI-server nieuw leven in voor lokale LLM's

Een fork voor specifieke hardware draait Qwen3.8-Flash-Next op twee POWER9-processors en vier V100-GPU's. Dat laat zien wat modelbewuste optimalisatie uit een systeem uit 2018 kan halen.

5 oktober 2026 · 3 min · Martin Seckar