vLLM toont wanneer gescheiden inferentie helpt en hindert

Een praktische gids meet de afweging bij het scheiden van promptverwerking en tokengeneratie. Hoge latenties verbeteren onder belasting, maar het verplaatsen van het werkgeheugen van het model vertraagt het eerste token.

6 oktober 2026 · 3 min · Martin Seckar

Wagtails maand met één model besteedde helft tokens elders

Een plan om in september al het ontwikkelwerk op GLM 5.3 Flash te doen, verbruikte twee miljard tokens, maar slechts de helft ging naar dat model. Prototypes, aanbiederscapaciteit en evaluatie verklaren het verschil.

5 oktober 2026 · 3 min · Martin Seckar

Matthew Green: agentsandboxen hebben een bewaker nodig

De cryptograaf stelt dat afscherming nodig blijft, maar het moeilijkste deel van agentbeveiliging niet kan oplossen: bepalen welke informatie en instructies geautoriseerd zijn.

5 oktober 2026 · 3 min · Martin Seckar

Kevin Liao stelt agentgeheugen op basis van documenten voor

De workflow van de ontwikkelaar bewaart specificaties en besluiten in bewerkbare Markdown. Zijn betoog gaat samen met een open-sourceimplementatie, maar zonder vergelijkende benchmark.

4 oktober 2026 · 3 min · Martin Seckar

Simon Willison wil standaard bestedingslimieten voor agents

Zijn voorstel kiest voor automatisch stoppen bij een budgetgrens. De limiet verwijderen zou een expliciete keuze vereisen.

4 oktober 2026 · 2 min · Martin Seckar