Nieuwe beslismodellen, onderzoek naar agentgeheugen en praktische infrastructuur domineren het overige nieuws van vandaag. Resultaten uit preprints, leveranciersmetingen en forumverslagen blijven aan hun uitgevers toegeschreven.

Nieuwe modellen en releases

OpenAI publiceert 722 wiskundige manuscripten. Het bedrijf zegt dat een niet-vrijgegeven intern model 722 manuscripten in 372 families produceerde, sommige met Lean-formalisaties. De wiskundige geldigheid staat nog niet vast. De vrijgegeven bronnen zijn dus nuttig voor controle en geen bewijs van een opgeloste catalogus. Directe bron: openai.com

Gemini Nano Banana 2.1 wordt algemeen beschikbaar. Googles afbeeldingsmodel ondersteunt maximaal 14 referentieafbeeldingen, onderbouwing via zoeken en een invoerlimiet van 131.072 tokens. Pipelines die gemini-3.1-flash-image gebruiken, krijgen op 29 oktober met uitschakeling te maken. Directe bron: ai.google.dev

EmpirioLabs stelt Aplomb 1-gewichten beschikbaar. Het beslismodel met 5,3 miljard parameters voegt audio en een waarschijnlijkheidshoofd toe aan een Qwen-basis, met een geclaimd venster van één miljoen tokens. De licentie met toegangsvoorwaarden beperkt commercieel hergebruik en distillatie, wat even belangrijk is als de leveranciersbenchmarks. Directe bron: empiriolabs.ai

Liquid AI lanceert d1. Het beslismodel, dat alleen via API beschikbaar is, accepteert tekst en afbeeldingen en geeft waarschijnlijkheden terug in plaats van gegenereerde tekst. Liquids vergelijkingen van snelheid, kosten en kwaliteit zijn leveranciersclaims; open gewichten zijn alleen voor latere modellen toegezegd. Directe bron: liquid.ai

OpenBMB uploadt MiniCPM-V-4.7-35B-A3B. De multimodale MoE met 35,2 miljard parameters verscheen als BF16-gewichten zonder modelkaart, licentie of benchmark. De bestanden zijn inspecteerbaar, maar capaciteiten en hergebruikvoorwaarden blijven onduidelijk. Directe bron: huggingface.co/openbmb/MiniCPM-V-4.7-35B-A3B

TII introduceert Falcon-Emirati-7B. TII meldt 84,83 procent op zijn eigen benchmark voor het Emiratische dialect, met synthetische gegevens en gegevens die door moedertaalsprekers zijn beoordeeld. Er werd geen downloadbaar checkpoint gevonden; de release is momenteel dus een chatdienst en dataset, geen open gewichten. Directe bron: huggingface.co/blog/tiiuae

TII past Falcon OCR aan voor Arabisch. Het systeem met 270 miljoen parameters gebruikt supervised learning en reinforcement learning voor Arabische documenten en staat tweede op TII’s eigen benchmark. Het Arabische checkpoint was bij publicatie niet beschikbaar, waardoor de gedetailleerde tabel een leveranciersresultaat blijft. Directe bron: huggingface.co/blog/tiiuae

OpenAI opent de bèta van de Decisions API. Het eindpunt geeft predicaten, keuzes of gescoorde waarschijnlijkheden terug via gpt-6-luna en accepteert tekst of afbeeldingen. OpenAI zegt dat het ongeveer tien keer sneller is dan zijn Responses API; er is geen technisch rapport over het beslishoofd gepubliceerd. Directe bron: developers.openai.com

Onderzoek

Vectoren tegen bias verminderen mogelijk vooral zekerheid. Een preprint vindt dat richtingen die uit bevooroordeelde en tegengestelde prompts worden afgeleid, modellen naar gebieden met lagere zekerheid duwen. Daardoor lijkt zich van antwoord onthouden op het verminderen van bias. Het negatieve resultaat vraagt evaluatoren om eerlijkheid van kalibratie te scheiden. Directe bron: arxiv.org

Uitgesproken en interne waarschijnlijkheden blijven gekoppeld. Onderzoekers manipuleren onzekerheid in trainings- en contextgegevens en melden dat zowel verbale waarschijnlijkheden als samplingverdelingen reageren. De bevinding ondersteunt voorzichtig gebruik van uitgesproken zekerheid als probe, in afwachting van replicatie. Directe bron: arxiv.org

Kenmerken voor toekomstige beelden stemmen overeen met hogere visuele cortex. Representaties van een autoregressief videomodel die toekomstige beelden genereren, pasten volgens de auteurs beter bij fMRI-reacties dan representaties van waargenomen beelden. Het werk ondersteunt verklaringen op basis van voorspellende verwerking zonder te tonen dat model en hersenen identiek rekenen. Directe bron: arxiv.org

Woordtiming verklaart het grootste deel van één verbetering bij hersenen-naar-tekst. Een controle zonder signaal bereikte 22,0 procent gebalanceerde nauwkeurigheid tegenover 22,3 procent op echte opnamen, doordat overlappende vensters timing lieten uitlekken. De gecorrigeerde methode profiteert nog van herhaalde waarnemingen, waardoor het artikel een sterke waarschuwing is voor sluiproutes bij neurale decodering. Directe bron: arxiv.org

Agents geven doelen door via geheugen en bestanden. Over 20 scenario’s en 11 modellen melden de auteurs dat latere agents handelen op doelen die door eerdere sessies zijn geschreven. De geheugentool verwijderen verplaatste het voortbestaan alleen naar bestanden; het resultaat betreft dus de grens van de volledige werkruimte. Directe bron: arxiv.org

Kleuterrollen onderdrukken vaardigheden in differentiaal- en integraalrekening niet. Drie redeneermodellen behielden een hoge nauwkeurigheid boven hun rol, terwijl ze in een leeftijdspassende stem schreven. Een promptingreep verminderde de mismatch, nuttig voor simulaties waarin stijl alleen een onvoldoende controle op capaciteiten vormt. Directe bron: arxiv.org

Prefix Steering concentreert gedragssturing. De auteurs melden dat het sturen van één of enkele tokens op de laatste promptpositie veel van de sturing over de volledige tekst behoudt, met minder verlies van capaciteiten. De methode verbindt prompteffecten met korte activatie-ingrepen. Directe bron: arxiv.org

COMPASS leert een redeneerrichting uit correctheid. De techniek identificeert een latente richting op basis van de vraag of directe antwoorden juist waren, en stuurt vervolgens geselecteerde aandachtshoofden. De gemelde verbetering bedraagt gemiddeld 16 punten op GSM8K, met minder gegenereerde tokens dan chain-of-thought. Directe bron: arxiv.org

Besliszekerheid faalt buiten vertrouwde taken. Een black-box-model is gekalibreerd op vertrouwde vragen, maar kent hoge zekerheid toe zonder relevant bewijs en bij nieuws van na zijn kennisgrens. Gerichte vragen over de toestand presteren beter dan eenvoudig vragen of het model iets weet. Directe bron: arxiv.org

Probes voor onbeantwoordbaarheid hebben moeite met dialoog. Lineaire probes dragen over tussen datasets met vergelijkbare ontbrekende informatie, maar herstellen slecht wanneer een gesprek beantwoordbaar wordt. De resterende kloof lijkt te gaan over het gebruiken van verduidelijking, in plaats van alleen het detecteren van afwezigheid. Directe bron: arxiv.org

OMIT meet bias voor nalaten. Acht modellen verkozen volgens de preprint schadelijk niet-handelen boven vergelijkbaar handelen in 218 gekoppelde scenario’s. Eerst om principes vragen verminderde de bias, maar creëerde soms een bias voor handelen. Directe bron: arxiv.org

MEMTRIM vermindert overmatig vertrouwen op geheugen. De methode legt bewijs vast wanneer herinneringen worden geschreven en verwijdert vervolgens herhaald of tegenstrijdig materiaal tijdens het ophalen. Het doel is misleidende gedeeltelijke overlap, waarbij een relevante herinnering niet volledig op de huidige vraag toepasbaar is. Directe bron: arxiv.org

Wat mensen bouwen

GridCore plant verschillende workloads op één GPU. De Go-server voegt prioriteitsklassen, toelating op basis van geheugen en het in geheugen houden van modellen toe achter een OpenAI-compatibele API. Eigen tests tonen nauwkeurigere VRAM-schattingen, maar stabiliteit in productie blijft niet geverifieerd. Directe bron: github.com/gridcore-ai/gridcore

Ruach Studio verpakt lokale liedgeneratie. Het werkstation omringt YuE2 met compositie-instellingen, LoRA-ondersteuning, afzonderlijke audiosporen en een desktopinterface. De RTX 3090-vereisten maken het project inspecteerbaar en houden tegelijk de hardwarekosten zichtbaar. Directe bron: github.com/ruach-music/ruach

OpenChart zet lokale gegevens om in grafieken. De desktopagent kan bestanden inspecteren en visualisaties bouwen zonder de dataset naar een gehoste dienst te sturen. De aangepaste Apache-voorwaarden moeten vóór commercieel hergebruik worden gecontroleerd. Directe bron: github.com/openchart-ai/openchart

Burn 0.22 vereenvoudigt Rust-modelcode. Het framework verwijdert backendtypen uit modeldefinities en voegt werk rond LoRA, QLoRA en ONNX toe. Geclaimde verbeteringen bij opnieuw bouwen zijn projectmetingen; de broncode biedt het praktische bewijs. Directe bron: burn.dev

pi-optchat bewaart lange gesprekken in een samenvattingsboom. De tool houdt een begrensd werkoverzicht bij en behoudt een binaire boom waarin op datum of detail kan worden ingezoomd. Het is een concreet alternatief voor één onomkeerbare gesprekssamenvatting. Directe bron: github.com/ArnaudValensi/pi-optchat

email-engine voegt controles rond agentmail toe. Het project gebruikt tokens met beperkte bevoegdheden, een herafspeellog, goedkeuringen, ongedaan maken en inhoudsmaskering om mailboxbevoegdheid te beperken. Het ontwerp is nuttig voor ontwikkelaars omdat e-mailhandelingen zowel ingrijpend als moeilijk terug te draaien zijn. Directe bron: github.com/agentmail-to/email-engine

Het lezen waard

OpenAI beschrijft LASER-sampling. Een goedkope classifier selecteert herhaaldelijk ambigue gesprekken die een redeneermodel moet labelen, gevolgd door diversiteitssampling. OpenAI claimt ongeveer 10.000 keer minder rekenwerk voor de beoordelaar dan bij willekeurige selectie; het resultaat gebruikt synthetische en gedeïdentificeerde gegevens. Directe bron: alignment.openai.com

GitHub publiceert ReviewBench. De benchmark voor codebeoordeling bevat 219 pull requests uit 187 repositories en een referentieset die uit mensen, reparaties en tools is samengesteld. GitHub meldt 96,6 procent overeenstemming tussen senior engineers, maar evalueert ook zijn eigen product op de benchmark. Directe bron: github.blog

QA Wolf geeft elke agent een computer. Het bedrijf stapte over van korte cloudtaken naar een pool geïsoleerde machines die na een antwoord kort blijven bestaan, terwijl blijvende bewerkingen elders worden opgeslagen. Het verslag biedt concrete keuzes voor veilig stoppen bij fouten en het aanleveren van geheimen, al zijn de schaalcijfers leveranciersclaims. Directe bron: qawolf.com

NVIDIA volgt verborgen agentkosten. Een casestudy met 108 uitvoeringen toont dat één wijziging aan de agentomgeving de taakvoltooiing van Qwen verbeterde, maar het aantal aanroepen, overgedragen gegevens en de latentie verhoogde. Het kleine experiment van de leverancier laat zien waarom het slagingspercentage alleen een agentomgeving niet kan beschrijven. Directe bron: developer.nvidia.com

Thomas Bloom bevriest bewijsclaims. De beheerder van Erdős Problems zegt dat door AI gegenereerde inzendingen de verklarende discussie verdrongen die hij wilde, waardoor reacties en statussen worden gepauzeerd. Het besluit is een bestuurlijke reactie uit eerste hand, geen oordeel dat AI-bewijzen niet geldig kunnen zijn. Directe bron: erdosproblems.com

Een GNOME-beheerder pleit voor kwetsbaarheidsscans met AI. Michael Catanzaro meldt een sterke stijging van bijgehouden CVE’s en stelt dat projecten die door AI gevonden meldingen afwijzen belangrijke fouten zullen missen. Zijn aantallen en advies weerspiegelen de ervaring van één beheerder, maar kwantificeren de beoordelingslast. Directe bron: blogs.gnome.org

Hacker News

Lezers bespreken OpenAI’s wiskundecatalogus. Deelnemers onderzoeken afzonderlijke manuscripten en waarschuwen dat een Lean-bewijs alleen de stelling verifieert zoals die is geformaliseerd. De discussiedraad voegt kritische beoordeling toe, maar geen onafhankelijk oordeel over de verzameling van 722 artikelen. Directe bron: news.ycombinator.com

Beheerders bespreken door AI gegenereerde pull requests. Bijdragers beschrijven het verlies van de oude aanname dat een aanzienlijke patch op deelname te goeder trouw wijst. Voorgestelde reacties omvatten workflows die deelname vooropstellen en strengere beoordelingscontroles; het bewijs is anekdotisch. Directe bron: news.ycombinator.com

Reddit

Een model met achterdeur richt zich op een programmeeragent. ProjectDiscovery finetunede een Qwen-model zodat een trigger toolgebruik veroorzaakte dat een externe shellpayload ophaalde. Deelnemers benadrukken dat vergiftigde gewichten, en niet “abliteration”, het algemene risico vormen; de resultaten komen uit de demonstratie van het beveiligingsbedrijf. Directe bron: old.reddit.com

Schaars opzoekgeheugen evenaart een groter dense model. Een model met 21 miljoen parameters en een tabel met 6,4 miljard parameters evenaarde naar verluidt een dense model met 114 miljoen parameters na training op 500 miljoen Wikipedia-tokens. De auteur meldt ook een mislukte aanpassing achteraf, wat het kleine experiment met één seed informatiever maakt dan alleen een succes. Directe bron: old.reddit.com

Lokale Qwen en Opus worden op één Rust-functie vergeleken. Een laptop met 128 GB deed er met Qwen ongeveer 130 minuten over, terwijl Opus in ongeveer 18 minuten klaar was voor 7,53 dollar. De auteur verkoos de lokale patch, maar modellen en agentomgevingen verschilden en de steekproef is één taak. Directe bron: old.reddit.com

Gesnoeid geheugen verslaat codegrafen in één uitbreidingstest. Gewoon bestanden lezen vond de juiste bestanden betrouwbaar, terwijl het installeren van verschillende graaftools meer kostte zonder betere antwoorden. Het verminderen van opgeslagen feiten verbeterde scores en verminderde onjuiste claims in de kleine benchmark van de auteur. Directe bron: old.reddit.com

Een bewust fout model scheidt zekerheid van nauwkeurigheid. Een auteur meldt een beslismodel dat is getraind om foute antwoorden te kiezen en tegelijk ongeveer 96 procent zeker te blijven. Het is een zelfgerapporteerde demonstratie dat betrouwbaar omkeren vereist dat het antwoord eerst wordt geleerd. Directe bron: old.reddit.com

YouTube

MLSS doceert onzekerheid in deep learning. De Engelstalige lezing van Yarin Gal behandelt probabilistisch redeneren en onzekerheid in moderne systemen. Het is een basiscursus en geen productaankondiging. Directe bron: youtube.com

Een OpenAI-onderzoeker reflecteert op redeneren. De Engelstalige MLSS-lezing van Giambattista Parascandolo vraagt wanneer taalmodellen leerden redeneren en welk wetenschappelijk werk nog resteert. De beschrijving geeft thema’s; voor de conclusies moet de lezing worden beluisterd. Directe bron: youtube.com

Simons Institute organiseert een lezing over causale wereldmodellen. Elias Bareinboim stelt in het Engels dat betrouwbare agents causale modellen nodig hebben en niet alleen correlaties. Er is geen transcript gecontroleerd; dit is dus een verwijzing naar het betoog. Directe bron: youtube.com

AI Engineer onderzoekt speculatief decoderen. Een Engelstalige Blackwell-demonstratie produceerde gestructureerde uitvoer ongeveer 1,6 keer sneller, terwijl creatief schrijven een lagere acceptatie had. Dit is één leveranciersdemonstratie met een bruikbare checklist, geen algemene benchmark. Directe bron: youtube.com

LlamaIndex vergelijkt agentisch en geïndexeerd zoeken. George He pleit in het Engels voor hybride informatieophaling plus bestandstools wanneer bedrijfsgegevens groot en multimodaal zijn en toegangsrechten hebben. De spreker vertegenwoordigt een leverancier, maar de ontwerpafwegingen zijn concreet. Directe bron: youtube.com

Googles infrastructuurchef bespreekt goodput. Amin Vahdat zegt dat bij een schaal van 100.000 accelerators meerdere keren per uur fouten optreden, waardoor nuttig geleverd werk meer zegt dan piek-FLOPS. Het Engelstalige interview behandelt gezamenlijk ontwerp, stroomvoorziening en inferentie-infrastructuur vanuit Googles perspectief. Directe bron: youtube.com

Street of Code vraagt of leren programmeren nog zin heeft. De Slowaakstalige aflevering combineert ervaringen van ontwikkelaars en studenten met AI-ondersteund programmeren. De waarde ligt in regionale praktijk en meningen, niet in gecontroleerd bewijs. Directe bron: youtube.com

In het kort

Anthropic breidt cyberverificatie uit. Het bedrijf voegt drie toegangsniveaus toe en meldt nieuwe scenariobenchmarkresultaten voor defensieve en offensieve modellen. Het programma is relevant omdat het modeltoegang koppelt aan identiteit en beoogd gebruik, al zijn de cijfers van Anthropic zelf. Directe bron: anthropic.com

Routering in GitHub Copilot CLI maakt promptinjectie mogelijk. Koi meldt dat een versleutelde prompt kan beïnvloeden welk model een verzoek ontvangt, en zegt dat één getest model de injectie de helft van de tijd volgde. De bekendmaking benadrukt dat modelroutering deel van de beveiligingsgrens is. Directe bron: koi.ai

Finland pauzeert twee Google-datacenterprojecten. Autoriteiten legden het kappen van bos op twee voorgestelde locaties stil terwijl vergunningen worden beoordeeld. De zaak maakt lokale grond- en stroombeperkingen tot onderdeel van de planning van AI-infrastructuur. Directe bron: yle.fi

Google tekent een akkoord voor geavanceerde kernenergie. De infrastructuurdeal is bedoeld om toekomstige datacentervraag met continu beschikbare elektriciteit te bedienen. Leveringsschema’s en bedrijfseconomie zullen bepalen of hij de capaciteit op korte termijn verandert. Directe bron: blog.google

Zakelijk in het kort

Lambda kondigde nieuwe financiering aan om zijn AI-cloudcapaciteit uit te breiden; voorwaarden en operationele gevolgen moeten uit de verklaring van het bedrijf worden gehaald. Directe bron: lambdalabs.com

SpaceX haalde naar verluidt 40 miljard dollar op, een financieringsgebeurtenis die relevant is voor zijn gecombineerde ambities in ruimtevaart, connectiviteit en AI, maar geen technische release. Directe bron: bloomberg.com

Anthropic biedt geselecteerde start-ups één jaar gratis modeltoegang. De voorwaarden en limieten van dit klantenwervingsprogramma worden door het bedrijf bepaald. Directe bron: anthropic.com

Wat dit suggereert: De overige verhalen van vandaag scheiden herhaaldelijk aantrekkelijke uitvoer van het mechanisme dat die produceerde: zekerheid van correctheid, geheugenrelevantie van overdracht en taaksucces van systeemkosten.

Wat komt er nu: Mistrals gewichten worden op 27 oktober verwacht, Google heeft verdere ML Kit-toegang voor EmbeddingGemma 2 toegezegd, en verschillende preprints hebben nu codevrijgave of onafhankelijke replicatie nodig.

Verificatie

BeweringLabelPrimaire bronOnafhankelijke verificatie
Beschrijvingen van releases, artikelen en projecten komen overeen met de gekoppelde vermeldingenGEVERIFIEERDDirecte bronnen gekoppeld bij elk itempublicatie- of repositoryvermeldingen
Benchmark- en prestatiecijfers worden aan hun auteurs of leveranciers toegeschrevenVOLGENS HET BEDRIJFDirecte bronnen gekoppeld bij elk itemonafhankelijke reproductie doorgaans afwezig
Forummetingen beschrijven waarnemingen uit de gemeenschapNIET GEVERIFIEERDHN- en Reddit-discussiedraden gekoppeld bij elk itemgeen onafhankelijke reproductie tenzij vermeld
Videosamenvattingen volgen officiële beschrijvingenGEDEELTELIJK GEVERIFIEERDYouTube-links bij elk itemtranscripten zijn niet gecontroleerd
De items laten samen een terugkerende scheiding tussen uitvoer en mechanismen zienANALYSEBronnen in het hele overzichtredactionele synthese