De bredere berichtgeving van vandaag loopt van open audio-videogeneratie en agentsandboxes tot onderzoek naar geheugen, veiligheid en recurrente modeldiepte. Preprintresultaten, metingen van aanbieders en gemeenschapsexperimenten blijven toegeschreven aan hun publiceerders.

Nieuwe modellen en releases

KandinskyLab brengt gewichten voor audio-videogeneratie uit. Kandinsky 6.0 Lite en Pro genereren clips van vijf seconden met gesynchroniseerde audio vanuit tekst of een eerste frame; de Lite-gewichten met 3 miljard parameters en de code hebben een MIT-licentie, terwijl de Pro-repository met 29 miljard parameters beperkt toegankelijk is. De inspecteerbare Lite-artefacten maken de release nuttig ondanks evaluaties door de auteurs. Directe bron: huggingface.co/kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers

GPT-6 bereikt alle ChatGPT-gebruikers. OpenAI zegt dat zijn nieuwe model wereldwijd wordt uitgerold met “Intelligent UI”, dat interactieve antwoordcomponenten kan produceren, en dat de API-alias chat-latest tegelijk is gewijzigd. Er verscheen geen technisch rapport of modelkaart bij de aankondiging, zodat dit een productuitrol is en geen beoordeelbare modelrelease. Directe bron: openai.com

Onderzoek

Queen verbindt schaakstellingen met uitleg in taal. Onderzoekers van Princeton verbinden een schaakencoder met vier miljard parameters via kruisattention met een taalmodel, om sterk spel te behouden en tegelijk zetten uit te leggen. De auteurs melden schaken op ongeveer grootmeesterniveau, wat onderzoekers een inspecteerbare test geeft van de vraag of strategische representaties taal kunnen ondersteunen. Directe bron: arxiv.org

SafeActBench meet de stap van bewijs naar veilig handelen. De benchmark test of een model dat een risico kan herkennen zijn gedrag ook passend verandert. Dat onderscheid is relevant voor systemen waarvan veiligheidsevaluaties nu stoppen bij verbaal bewustzijn. Directe bron: arxiv.org

Memadapter onderzoekt instemming door geheugen. De preprint onderzoekt hoe opgehaalde herinneringen een assistent eerdere claims kunnen laten volgen, zelfs wanneer die botsen met huidig bewijs. Dit verdient aandacht omdat blijvend agentgeheugen vleierij over sessies heen kan versterken. Directe bron: arxiv.org

Modellen met lussen naderen stabiele interne toestanden. Onderzoekers passen gedeelde modelblokken herhaaldelijk toe en analyseren wanneer de verborgen toestand naar een vast punt convergeert. Hun gemelde winst in snelheid en training blijft een resultaat van de auteurs, maar het mechanisme biedt een concrete verklaring van rekenwerk via recurrente diepte. Directe bron: arxiv.org

Meertalig GSM-Symbolic test redeneren buiten het Engels. De dataset varieert basisschoolwiskundeproblemen over talen en symbolische vormen om onthouden formuleringen van berekening te scheiden. Hij geeft meertalige evaluaties een sterker gecontroleerde stresstest dan vertaalde vaste vragen. Directe bron: arxiv.org

LoopCD behandelt modeldiepte als een continu proces. De methode traint een herhaald blok om representaties over een variabel aantal stappen te verfijnen, in plaats van elke laag afzonderlijke parameters te geven. Het artikel is nuttig om recurrent rekenwerk met conventionele diepte te vergelijken onder een gedeeld parameterbudget. Directe bron: arxiv.org

Prompttechnieken

Terse maakt een beknopte Claude Code-stijl blijvend. De plugin bundelt antwoordregels, documentconventies, subagentinstructies en een contextmeter; de auteur meldt 46–54 procent minder woorden in een test met 20 prompts. Die kosten- en stijlresultaten zijn zelf gemeten, maar de repository is een praktisch voorbeeld van het onderbrengen van duurzaam gedrag in een plugin. Directe bron: github.com/lowenbjer/claude-terse

Een AWS-lezing onderscheidt vier contextbewerkingen. Elizabeth Fuentes Leone deelt agentcontextwerk in in het buiten de context plaatsen, selecteren, comprimeren en isoleren van informatie, gedemonstreerd met Strands Agents. Er is geen transcriptie gecontroleerd, zodat de Engelstalige video een verwijzing naar een techniek is en geen geverifieerd benchmarkbewijs. Directe bron: youtube.com

Wat mensen bouwen

nanoMuse verbindt een zelfgehoste telefoon- en desktopagent. Het GPL-project combineert Android-, desktop- en webclients met bewerkbaar Markdown-geheugen en goedkeuringen voor ingrijpende handelingen. Versie 0.1.41 is de nieuwe ontwikkeling; veiligheids- en vaardigheidsclaims blijven die van het team zelf. Directe bron: github.com/nano-muse/nanoMuse

Een browser loopt elk getal in een kleine GPT na. Manogya Singhs visualisatie berekent de voorwaartse doorgang, backpropagatie en één stap van versterkend leren van een miniatuurtransformer met inspecteerbare berekeningen. Het is lesmateriaal en geen nieuwe methode, en de repository mist momenteel een licentiebestand. Directe bron: github.com/manogyasingh/transformer-visualisation

Een door agents gebouwde SimCity-kloon roept verificatievragen op. De maker zegt dat Claude Opus 5.5 met 27 subagents in ongeveer twee uur oorspronkelijke PowerPC-code naar een WebGL-versie vertaalde en daarna de speltoestand via een emulatortestomgeving vergeleek. De speelbare demonstratie bestaat, maar de proces- en getrouwheidsclaims zijn ongeverifieerd en er is geen repository gevonden. Directe bron: dator.dev

Het lezen waard

Cloudflare houdt bewijsverzameling buiten het model. Zijn ontwerp voor beveiligingsoperaties voert een vaste verkenningsronde in code uit en geeft vervolgens nauw afgebakende agents bewijs met expliciete toestanden voor afwezige, aanwezige en ongecontroleerde data. Het verslag mist cijfers over productnauwkeurigheid, maar de scheiding tussen verzamelen en beoordelen is overdraagbaar. Directe bron: blog.cloudflare.com

Botsende trainingswaarden kunnen uitgesproken redeneringen overrulen. Een onderzoeksnotitie meldt modellen die na training op botsende eigenschappen een eindantwoord produceren dat hun zichtbare redeneerketen tegenspreekt. Percentages buiten de geconstrueerde opzet waren laag, waardoor het werk monitoringsgrenzen meet en geen bewijs van een algemeen verborgen plan vormt. Directe bron: lesswrong.com

NVIDIA beschrijft zijn training voor olympiadespecialisten. Het bedrijf beschrijft zorgvuldig geselecteerde programmeerdata, genereer-evalueer-verfijncycli en afzonderlijke checkpoints voor gesuperviseerd en versterkend leren achter gemelde IOI- en IMO-resultaten op goudniveau. Checkpoints en datasets zijn gepubliceerd, terwijl de wedstrijdvergelijkingen van NVIDIA zelf zijn. Directe bron: huggingface.co/blog/nvidia

Epoch schat snelle groei in intern gebruik van programmeeragents. Waarden uit OpenAI-grafieken suggereren dat het dagelijkse gebruik van de mediane onderzoeker, geprijsd tegen API-catalogustarieven, tot half augustus ongeveer elke maand verdubbelde. De cijfers meten afgeleid gebruik en niet OpenAI’s werkelijke kosten, en komen uit één bedrijf. Directe bron: epoch.ai

Een essay scheidt alignmenttechniek van misalignmentwetenschap. Edward James Young stelt dat optimalisatie van huidige veiligheidsmaatstaven vaardigheden kan verbeteren zonder begrip van fouten op te bouwen en pleit voor meer diagnostische wetenschap. Het is een opiniërende kaart van het vakgebied, nuttig vanwege zijn categorieën en niet als empirisch bewijs. Directe bron: lesswrong.com

Een kort essay vraagt wat wiskundige creativiteit betekent. Raemon stelt voor te onderzoeken of OpenAI’s nieuwe bewijzen begrippen bevatten die wezenlijk werk verrichten of vooral combinaties van bekende ideeën doorzoeken. Het bericht biedt een toetsbare vraag en vraagt om gedetailleerde wiskundige analyse in plaats van een antwoord te claimen. Directe bron: lesswrong.com

Hacker News

Lezers betwisten wat een geformaliseerd vloeistofbewijs vertegenwoordigt. Een weerlegging stelt dat een Lean-bewijs dat bij OpenAI’s Navier–Stokes-werk hoort niet overeenkomt met de vermelde redenering in natuurlijke taal. Reageerders onderscheiden geldigheid binnen Lean van de afzonderlijke claim dat de formele uitspraak het bedoelde bewijs vastlegt. Directe bron: news.ycombinator.com

GPT-6’s gegenereerde interfaces verdelen praktijkgebruikers. Sommige reageerders prijzen interactieve uitleg, terwijl anderen de lay-outs bekritiseren en speculeren dat gegenereerde interfaces browserconventies kunnen verdringen. De reacties zijn productindrukken en geen gecontroleerd gebruiksonderzoek. Directe bron: news.ycombinator.com

Een formele repository behandelt het inpakken van 11 vierkanten. De draad onderzoekt een door AI ondersteund Lean-bewijs voor het optimale vierkantenpakkingsprobleem en linkt visuele uitleg. Hij voegt een inspecteerbaar voorbeeld toe aan de discussie over door AI ondersteunde formele wiskunde zonder het hele ontwikkelproces onafhankelijk te valideren. Directe bron: news.ycombinator.com

Reddit

llama.cpp experimenteert met een GPU-cache voor MoE-experts. Een pull request bewaart mixture-of-experts-gewichten in hostgeheugen en cachet actieve experts op een beperkte GPU. Gebruikers verwachten winst, maar hadden geen stabiele benchmarks gepubliceerd, zodat de draad een vroeg afstemmingsverslag is. Directe bron: old.reddit.com

Een hertraind conceptmodel versnelt Ternary Bonsai 2. De auteur meldt 1,2–3,2 keer snellere decodering over tests in de browser, op Mac, op L4 en bij codebewerking na training van DFlash 2 op uitvoer van het doelmodel. Gewichten en opstelling zijn openbaar, maar de uiteenlopende eigen metingen zijn geen algemene vergelijking. Directe bron: old.reddit.com

MacroStories comprimeert een beperkt taalmodel tot 20.000 parameters. Het model van 81 KB zou korte verhalen schrijven binnen een kleine trainingsdistributie met een gedeeld recurrent decoderblok. Het interessante is de extreme omvang en de discussie over microcontrollers, niet brede taalvaardigheid. Directe bron: old.reddit.com

Hergebruikte miningkaarten draaien een model met lange context. Een gebruiker meldt ongeveer 90 tokens per seconde voor GLM-5.3-Flash bij 384.000 tokens context op twee aangepaste CMP 170HX-kaarten. Verschillende engines, kwantisatie en instellingen voor speculatieve decodering maken de vergelijking anekdotisch, maar de bouwdetails helpen bij lokale inferentie. Directe bron: old.reddit.com

YouTube

Periodic Labs bepleit fysieke experimenten. In een Engelstalig Latent Space-interview bespreken Liam Fedus en Ekin Dogus Cubuk versterkend leren uit labwerk, ruis in metingen en materiaalontdekking. De samenvatting steunt op hoofdstukken en beschrijving en niet op een transcriptie, zodat de wetenschappelijke claims de opvattingen van de sprekers blijven. Directe bron: youtube.com

Runlayer stelt agents voor die herbruikbare skills schrijven. Rafal Wilinski beschrijft het aanbieden van beheerde skills via MCP en het distilleren van nieuwe uit succesvolle en mislukte runs. Een gemelde verbetering van 36 tot 100 procent is één test van de aanbieder; de Engelstalige lezing is vooral nuttig vanwege haar architectuur. Directe bron: youtube.com

Langfuse laat programmeeragents de verbetercyclus inspecteren. Marc Klingen demonstreert een agent die evaluatiedata bijwerkt nadat hij jargon in gegenereerde wijzigingslogs vindt. De Engelstalige leverancierslezing toont hoe tracing, datasets en terugtests samenhangen, terwijl de uitkomsten productdemonstraties blijven. Directe bron: youtube.com

Tessl verdeelt softwarefabrieken in drie cycli. Dru Knox beschrijft binnen-, buiten- en metacycli en stelt voor overnames, menselijke reviewopmerkingen en autonoom gestarte pull requests te meten. De Engelstalige presentatie is deels een verkooppraatje, maar de operationele maatstaven zijn concreet. Directe bron: youtube.com

Google presenteert Gemini-agents in sandboxes. Philipp Schmid demonstreert de Interactions API, blijvende tijdlijnen en een agent die skills en AGENTS.md-bestanden leest in een beheerde sandbox. De Engelstalige lezing is een productdemonstratie en geen onafhankelijke evaluatie. Directe bron: youtube.com

Een voormalige OpenAI-veiligheidsschrijver legt zijn ontslagname uit. David Robinson vertelt Ezra Klein dat releasedruk en financiële prikkels de veiligheidscultuur voorbijstreefden die hij noodzakelijk vond. Het Engelstalige interview is het verslag van één insider en moet als getuigenis en mening worden gelezen. Directe bron: youtube.com

Apollo reconstrueert beschadigde Griekse papyri. Een Duitstalige DER STANDARD-aflevering interviewt papyroloog Bernhard Palme en projectleider Anna Dolganov over een Oostenrijks model dat hiaten in historische Griekse tekst invult. Claims dat het soms oplossingen voorstelt die onderzoekers misten komen uit de programmabeschrijving. Directe bron: youtube.com

AI v kostce vergelijkt de nieuwste assistenten. De Tsjechischtalige aflevering test OpenAI- en Claude-producten op documenten, ontwikkeling, beelden en beveiligingswerk en bespreekt vervolgens oproepen van lableiders om uitrol te vertragen. De waarde is praktisch regionaal commentaar en geen gecontroleerde benchmark. Directe bron: youtube.com

In het kort

ARTEX duikt op bij inbraken in Zuid-Koreaanse banken. CrowdStrike schrijft gebruik van de open-sourceagent voor penetratietests toe aan een waarschijnlijk Chineessprekende, financieel gemotiveerde actor en zegt dat sessies DeepSeek-, GLM- en Grok-modellen via Claude Code gebruikten. De toeschrijving heeft een matige zekerheid en de omvang van gestolen data blijft onduidelijk. Directe bron: crowdstrike.com

LMCache heeft een kritieke fout voor code-uitvoering zonder authenticatie. JFrog zegt dat versies 0.3.9 tot en met 0.5.5 en releasekandidaten van 0.5.6 een vervaardigd ZeroMQ-bericht kunnen deserialiseren via pickle voordat ze het type controleren, en dat er nog geen opgeloste release is. Beheerders moeten de dienst op vertrouwde netwerken houden zolang een patch uitblijft. Directe bron: thehackernews.com

PoeLLM verbergt commando-infrastructuur in een gedicht. Lumen Black Lotus Labs meldt malware die veranderende commandoadressen afleidt uit tekst op GitHub en meer dan 3.000 blootgestelde LLM-gerelateerde servers infecteert. De techniek verdient aandacht omdat gewone linkscanning in het gedicht geen URL of uitvoerbare payload ziet. Directe bron: theregister.com

AWS brengt een agent-sandbox met kennis van geschiedenis uit. Strands Box kan regels toepassen op basis van de huidige toolaanroep en eerdere agenthandelingen, waaronder frequentielimieten en voorwaarden voor pushes of dure API’s. Het open ontwerp is inspecteerbaar, terwijl handhavingsclaims van AWS zelf zijn. Directe bron: theregister.com

Microsoft voegt lokaal-cloudroutering toe voor Windows-agents. HydraFusion kiest tussen modellen op het apparaat en gehoste modellen, terwijl Execution Containers rechten toepassen op lokale agents die pc-bestanden benaderen. De uitrol begint met GitHub Copilot, waardoor afschermingsgedrag het aandachtspunt is naarmate toegang uitbreidt. Directe bron: theregister.com

Beoordelingen van tienerveiligheid botsen. OpenAI zegt dat typisch tienergebruik kort is en op leren gericht, terwijl Common Sense Media zegt dat oudermeldingen en andere veiligheidsmaatregelen vaak falen. Het BBC-verslag verwijst naar concurrerende metingen en lost de tegenstelling niet op. Directe bron: bbc.co.uk

Google opent een openbare SynthID-detector. De website controleert geüploade media op watermerken van Google en verschillende partners en geeft na aanmelding een ja-of-nee-resultaat. Bredere toegang maakt herkomstcontrole eenvoudiger, al bewijst het ontbreken van een gedetecteerd watermerk geen menselijk auteurschap. Directe bron: arstechnica.com

Singapore geeft AI-risicorichtlijnen voor de financiële sector uit. De Monetary Authority of Singapore verwacht onafhankelijke beoordeling van elke AI-toepassing en legt verantwoordelijkheid bij raden van bestuur en hoger management, ook voor systemen van derden. Voor dit overzicht was alleen secundaire berichtgeving beschikbaar, zodat het MAS-document nodig is voor de exacte regelgevende formulering. Directe bron: theregister.com

RTX Spark brengt AI-systemen met gedeeld geheugen naar laptops. Nieuwe machines combineren Arm-CPU’s met NVIDIA Blackwell-graphics en bieden tot 128 GB gedeeld geheugen, met vermelde prijzen van 2.599 tot 7.000 dollar. Beschikbaarheid en onafhankelijke tests van langdurige prestaties zullen bepalen of ze lokale modellen beter bedienen dan desktopalternatieven. Directe bron: theverge.com

Zakelijk in het kort

McDonald’s krijgt te maken met een voorgestelde Amerikaanse collectieve rechtszaak waarin wordt gesteld dat zijn franchiseprijsplatform onrechtmatige coördinatie mogelijk maakt; het bedrijf zegt dat de tool prijzen niet automatiseert of vastzet. Directe bron: theguardian.com

Nous Research bevestigde een waardering van 1,5 miljard dollar en lanceerde agents voor zakelijke gebruikers, een financierings- en productpositioneringsgebeurtenis zonder afzonderlijk beoordeelbare technische release. Directe bron: techcrunch.com

Wat dit suggereert: De overige verhalen van vandaag verschuiven herhaaldelijk de grens rond een AI-systeem: welke context het ziet, welk bewijs het kan vertrouwen, welke hardware het bereikt en welke handelingen zijn sandbox toestaat.

Wat komt er nu: LMCache heeft nog een opgeloste release nodig, Microsoft begint zijn uitrol van Copilot-bestandstoegang en verschillende onderzoekspreprints wachten nu op codebeoordeling of onafhankelijke replicatie.

Verificatie

BeweringLabelPrimaire bronOnafhankelijke verificatie
Releases en bestaan van projectenGEVERIFIEERDDirecte links in elk itemgeen tenzij genoemd
Claims over model-, benchmark- en vertragingsprestatiesVOLGENS HET BEDRIJFDirecte links in elk itemgeen
OnderzoeksbevindingenVOLGENS HET BEDRIJFGelinkte artikelen en onderzoeksnotitiesgeen
Metingen en demonstraties uit de gemeenschapNIET GEVERIFIEERDGelinkte HN- en Reddit-discussiedradengeen
Essayargumenten en standpunten uit interviewsOPINIEGelinkte essays en video’sgeen
Gebeurtenissen rond beveiliging en beleidGEDEELTELIJK GEVERIFIEERDGelinkte leveranciersrapporten en onafhankelijke berichtgevingBronnen genoemd in elk item