Leugendetectieprobes volgen naleving in plaats van waarheid

Een preprint test acht gepubliceerde probes op taalmodellen die personages spelen die basisfeiten afwijzen. Veel falen zodra ware en onware antwoorden dezelfde prompt delen; een probe die waarheid van gehoorzaamheid leert scheiden, houdt stand.

6 oktober 2026 · 6 min · Martin Seckar

Matthew Green: agentsandboxen hebben een bewaker nodig

De cryptograaf stelt dat afscherming nodig blijft, maar het moeilijkste deel van agentbeveiliging niet kan oplossen: bepalen welke informatie en instructies geautoriseerd zijn.

5 oktober 2026 · 3 min · Martin Seckar

Dagelijks AI-overzicht – 5 oktober 2026

Sprekerdiarisatie, artikelen over modelcognitie, lokale projecten, promptpraktijken, tests uit de gemeenschap en de veiligheids- en beleidsontwikkelingen van vandaag.

5 oktober 2026 · 17 min · Martin Seckar

Zous team volgt hoe modellen interne veranderingen melden

Een gecontroleerde preprint scheidt het detecteren van een activatieverandering van het melden van de locatie. Het experiment gebruikt vaste invoertekst en beoordeelt antwoorden zonder AI-beoordelaar.

4 oktober 2026 · 4 min · Martin Seckar