<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Modellen on AI News Daily</title><link>https://ai-news-daily.xyz/nl/tags/models/</link><description>Recent content in Modellen on AI News Daily</description><image><title>AI News Daily</title><url>https://ai-news-daily.xyz/images/og-default.png</url><link>https://ai-news-daily.xyz/images/og-default.png</link></image><generator>Hugo -- 0.148.2</generator><language>nl</language><lastBuildDate>Tue, 06 Oct 2026 04:09:31 +0200</lastBuildDate><atom:link href="https://ai-news-daily.xyz/nl/tags/models/index.xml" rel="self" type="application/rss+xml"/><item><title>Reflection toont Beam voordat het de gewichten vrijgeeft</title><link>https://ai-news-daily.xyz/nl/posts/reflection-toont-beam-voordat-het-de-gewichten-vrijgeeft/</link><pubDate>Tue, 06 Oct 2026 04:09:31 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/reflection-toont-beam-voordat-het-de-gewichten-vrijgeeft/</guid><description>Het mixture-of-experts-model met 501 miljard parameters is alleen via vroege toegang beschikbaar. Volgens Reflection volgen de gewichten, een technisch rapport en ontwikkelaarstools later in oktober.</description><content:encoded><![CDATA[<p>Reflection AI heeft Beam aangekondigd, een model met 501 miljard parameters voor programmeren en agentwerk, maar ontwikkelaars kunnen de gewichten nog niet inspecteren of uitvoeren.</p>
<p>Het Californische AI-bedrijf beschrijft Beam als een schaars mixture-of-experts-model: het bevat 501 miljard parameters, maar activeert er 23 miljard per token. Voor vroege toegang is registratie nodig; de gewichten, licentie, modelkaart, het technische rapport en de ontwikkelaarstools zijn nog niet beschikbaar.</p>
<p>Voor een ontwikkelaar die een open model kiest, is dat onderscheid van belang. Een model met open gewichten (open-weight model) kan worden getest op eigen workloads, aangepast en uitgerold zonder afhankelijkheid van de dienst van de maker; een aankondiging en benchmarktabel bieden nog geen basis voor die controles.</p>
<p>Reflection zegt Beam te hebben getraind op 23,8 biljoen tokens en vervolgens gedurende vier weken meer dan 100 miljoen reinforcement-learningtrajecten te hebben uitgevoerd op 10.500 NVIDIA GB300-GPU&rsquo;s. Die cijfers beschrijven een uitzonderlijk grote training, maar het bedrijf heeft het technische rapport nog niet vrijgegeven dat nodig is om de samenstelling van de data of de evaluatieopzet te onderzoeken.</p>
<p>De eigen tabel van het lab geeft Beam scores van 80,9 op SWE-bench Verified en 80,1 op Terminal-Bench 2.1. Daarin staat Beam ook achter Kimi K3, GLM-5.3 en Qwen 3.8-Max op de meeste vermelde tests. Reflection vergelijkt vooral de efficiëntie: het zegt dat Beam resultaten bereikt die vergelijkbaar zijn met die van GLM-5.2, met drie tot vier keer minder rekenwerk voor inferentie, op basis van zijn eigen schatting van het aantal drijvendekommabewerkingen.</p>
<p>Die claim kan voor teams die betalen voor lange agentsessies meer betekenen dan een kleine voorsprong op een benchmark. Schaarse activering vermindert het rekenwerk per token, al vereist het volledige model nog altijd voldoende geheugen en infrastructuur om honderden miljarden parameters op te slaan en beschikbaar te stellen.</p>
<p>Reflection zegt dat Beam de laatste veiligheidstests ondergaat. Het bedrijf wil de gewichten, het technische rapport, de modelkaart en de ontwikkelaarsbestanden later in oktober 2026 publiceren; het heeft geen specifieke releasedatum gegeven.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Reflection heeft Beam aangekondigd en de registratie voor vroege toegang geopend</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://reflection.ai/blog/introducing-beam" rel="noopener">Aankondiging van Reflection</a></td>
          <td>geen nodig voor de handeling van het bedrijf</td>
      </tr>
      <tr>
          <td>Beam heeft in totaal 501 miljard parameters en 23 miljard actieve parameters per token</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://reflection.ai/blog/introducing-beam" rel="noopener">Aankondiging van Reflection</a></td>
          <td>geen; de gewichten en het rapport zijn nog niet beschikbaar</td>
      </tr>
      <tr>
          <td>Voor de training zijn gedurende vier weken 23,8 biljoen tokens en meer dan 100 miljoen RL-trajecten op 10.500 GB300-GPU&rsquo;s gebruikt</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://reflection.ai/blog/introducing-beam" rel="noopener">Aankondiging van Reflection</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Beam behaalde 80,9 op SWE-bench Verified en 80,1 op Terminal-Bench 2.1</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://reflection.ai/blog/introducing-beam" rel="noopener">Aankondiging van Reflection</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Reflection schat dat de resultaten vergelijkbaar zijn met die van GLM-5.2, met 3–4 keer minder rekenwerk voor inferentie</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://reflection.ai/blog/introducing-beam" rel="noopener">Aankondiging van Reflection</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>De gewichten, het rapport, de modelkaart en de ontwikkelaarsbestanden zijn voor later in oktober 2026 toegezegd</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://reflection.ai/blog/introducing-beam" rel="noopener">Aankondiging van Reflection</a></td>
          <td>geen nodig voor het genoemde tijdschema</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>Modellen adresseren feiten op volgorde van vermelding</title><link>https://ai-news-daily.xyz/nl/posts/modellen-adresseren-feiten-op-volgorde-van-vermelding/</link><pubDate>Tue, 06 Oct 2026 04:08:31 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/modellen-adresseren-feiten-op-volgorde-van-vermelding/</guid><description>Een preprint vindt een gedeelde interne richting die taalmodellen naar het eerste, tweede of latere feit in een passage wijst. Een vraag langs die richting verschuiven kan veranderen welk feit het model ophaalt.</description><content:encoded><![CDATA[<p>Taalmodellen lijken feiten in een passage deels te vinden aan de hand van de volgorde waarin die feiten zijn vermeld, volgens een nieuw onderzoek naar interpreteerbaarheid.</p>
<p>Yufa Zhou testte Qwen-, Gemma- en Llama-modellen op korte lijsten met feitelijke uitspraken, gevolgd door vragen. De interne vraagtoestanden van de modellen vormden een herhaalbaar patroon voor het eerste, tweede en latere feit, ook wanneer de namen en onderwerpen veranderden.</p>
<h2 id="why-it-matters">Waarom dit ertoe doet</h2>
<p>Voor een onderzoeker die wil begrijpen hoe een model informatie ophaalt, levert het resultaat een concreet mechanisme op, in plaats van nog een correlatie tussen activaties en antwoorden. Dezelfde interne richting kon experimenteel worden verschoven, waardoor een vraag over één feit een ander feit uit de passage ophaalde.</p>
<p>Het artikel noemt deze posities “feitadressen”. Neem een context waarin staat dat Alice een appel eet en Bob een peer. Een vraag over Alice en een vraag over Bob verschillen binnen het model langs een richting die samenhangt met de volgorde waarin de feiten zijn vermeld. Toen de onderzoeker de richting van het eerste naar het tweede feit toevoegde aan een vraag over het eerste feit, antwoordde het model vaak met de inhoud van het tweede.</p>
<p>Die ingreep is het sterkste bewijs van het onderzoek. Een classifier kan veel patronen in verborgen toestanden ontdekken zonder te laten zien dat een model ze gebruikt. Het antwoord veranderen door het voorgestelde adres te veranderen, biedt causale steun voor het mechanisme, al gebruiken de tests gecontroleerde feitenlijsten in plaats van lange, natuurlijke documenten.</p>
<p>Bij 64 nieuwe woordverzamelingen selecteerde de ingreep het bedoelde feit in ongeveer vijf op de zes gevallen voor Qwen, ongeveer de helft voor Gemma en ongeveer één op de drie voor Llama. De exacte percentages waren respectievelijk 84,1 procent, 53,9 procent en 36,2 procent. Die verschillen laten zien dat de richting tussen modelfamilies werd gedeeld, maar niet in elke familie even betrouwbaar was.</p>
<h2 id="de-adressen-nemen-weinig-interne-ruimte-in">De adressen nemen weinig interne ruimte in</h2>
<p>Zhou meldt dat de feitadressen in een deelruimte met lage rang liggen. Eenvoudig gezegd hebben de modellen geen afzonderlijke, losstaande richting nodig voor elke mogelijke positie; een kleine verzameling richtingen beschrijft een groot deel van het volgordepatroon.</p>
<p>Het eerstgenoemde feit was voor de modellen ook gemakkelijker te bereiken dan latere feiten. Dat lijkt op een primacy-effect in het menselijke geheugen, maar het experiment stelt niet vast dat mensen en transformers hetzelfde mechanisme gebruiken. Het identificeert een meetbare asymmetrie in de geteste modellen.</p>
<p>Het patroon verscheen in lagen voorbij het midden van het model en bij groottes van 1,5 miljard tot 32 miljard parameters. Checkpoints uit de training suggereerden dat het vroeg ontstond en niet pas na uitgebreide instructietraining. De code die bij de preprint is vrijgegeven, maakt de gecontroleerde ingrepen inzichtelijk.</p>
<p>De beperkte opzet is ook de belangrijkste beperking. Lijsten met eenvoudige feiten isoleren de volgorde helder, terwijl echte prompts koppen, herhaalde verwijzingen, tools en tegenstrijdige uitspraken bevatten. Het artikel laat zien dat de volgorde van vermelding onder gecontroleerde omstandigheden als adres kan dienen; het laat niet zien dat die volgorde het ophalen van informatie in gewone agenttranscripten domineert.</p>
<p>Zhou diende de preprint op 1 oktober 2026 in. Het volgende bewijs zal moeten komen van het reproduceren van de ingreep op minder regelmatige documenten en van tests die nagaan of een andere documentstructuur dezelfde interne richtingen verandert.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Vraagtoestanden zijn bij Qwen, Gemma en Llama georganiseerd volgens de volgorde van feiten</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2610.00910" rel="noopener">Preprint van Zhou</a></td>
          <td>geen; resultaat uit een preprint</td>
      </tr>
      <tr>
          <td>Het toevoegen van een ordinale vector kan een vraag naar een ander feit leiden</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2610.00910" rel="noopener">Preprint van Zhou</a></td>
          <td>geen; experiment van de auteur</td>
      </tr>
      <tr>
          <td>Overdracht naar 64 woordverzamelingen bereikte 84,1 procent voor Qwen, 53,9 procent voor Gemma en 36,2 procent voor Llama</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2610.00910" rel="noopener">Preprint van Zhou</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Feitadressen liggen in een deelruimte met lage rang en geven het eerste feit een voordeel</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2610.00910" rel="noopener">Preprint van Zhou</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Het patroon verschijnt bij 1,5 miljard tot 32 miljard parameters en vormt zich vroeg in de pretraining</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2610.00910" rel="noopener">Preprint van Zhou</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Code voor reproductie is openbaar</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/MasterZhou1/order-of-mention" rel="noopener">Repository voor de volgorde van vermelding</a></td>
          <td>repository beschikbaar</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>EasyCommand zet Engels lokaal om in Bash</title><link>https://ai-news-daily.xyz/nl/posts/easycommand-zet-engels-lokaal-om-in-bash/</link><pubDate>Tue, 06 Oct 2026 04:06:31 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/easycommand-zet-engels-lokaal-om-in-bash/</guid><description>De open-sourcetool voor de opdrachtregel bevat llama.cpp en levert twee kleine gefinetunede modellen mee. De auteur heeft ook de trainingsset met 401.975 paren en de benchmarkcode vrijgegeven.</description><content:encoded><![CDATA[<p>EasyCommand zet Engelse verzoeken om in Bash-opdrachten met een klein model dat op een CPU draait. De prompt en de voorgestelde opdracht blijven op de computer van de gebruiker.</p>
<p>Ontwikkelaar Max Trivedi heeft de opdrachtregelapplicatie <code>ec</code>, twee modelfamilies en een dataset met 401.975 ontdubbelde paren van verzoeken en opdrachten vrijgegeven. De applicatie bevat llama.cpp, toont de voorgestelde opdracht en kan vóór uitvoering om bevestiging vragen.</p>
<p>Voor een ontwikkelaar die af en toe hulp bij een shellopdracht nodig heeft, neemt lokale uitvoering een API-aanroep weg uit een gevoelig deel van de workflow. Daar staat directe verantwoordelijkheid tegenover: het project waarschuwt dat een aannemelijke opdracht toch fout kan zijn en raadt aan te beginnen in de modus die alleen een voorbeeld toont.</p>
<p>De vrijgegeven modellen bouwen voort op Qwen2.5-Coder-1.5B-Instruct en Qwen3-0.6B. Beide zijn beschikbaar als GGUF-bestanden voor lokale inferentie, samengevoegde BF16-checkpoints en LoRA-adapters voor verdere training. De modellen en dataset gebruiken de Apache 2.0-licentie; de applicatie en benchmarkcode gebruiken MIT.</p>
<p>Trivedi zegt dat het model met 1,5 miljard parameters 212 van de 300 opgaven oploste in een bijgewerkte versie van de ALFA-benchmark voor de omzetting van Engels naar shellopdrachten, tegenover 191 voor het eerdere nl2sh-systeem. Dit is een vergelijking door de auteur met verschillende modelprompts en instellingen, geen resultaat op een onafhankelijke ranglijst.</p>
<p>De release is bijzonder bruikbaar doordat hij behalve het model ook de tekortkomingen bevat. Trivedi zegt dat de vlakke dataset de historische weging uit de training niet reproduceert en geen officiële testverdeling heeft. Hij raadt aan hele taakfamilies apart te houden in plaats van parafrases willekeurig te verdelen; anders zouden vrijwel identieke opdrachten in zowel training als evaluatie terecht kunnen komen.</p>
<p>De tool richt zich op GNU/Linux Bash, niet op alle shells of besturingssystemen. De repository van EasyCommand is nu openbaar, en de auteur vraagt gebruikers tests bij te dragen die onbetrouwbare overdracht en ontbrekende ondersteuning voor opdrachten blootleggen.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>EasyCommand draait lokaal, bevat llama.cpp en toont opdrachten vóór uitvoering</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://dirac.run/posts/easycommand" rel="noopener">Projectbeschrijving</a></td>
          <td><a href="https://github.com/dirac-run/ec" rel="noopener">openbare repository</a></td>
      </tr>
      <tr>
          <td>De release bevat 401.975 ontdubbelde Engels/Bash-paren</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://dirac.run/posts/easycommand" rel="noopener">Projectbeschrijving</a></td>
          <td>dataset gekoppeld vanuit de repository</td>
      </tr>
      <tr>
          <td>De modellen zijn afgeleid van Qwen2.5-Coder-1.5B en Qwen3-0.6B</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://dirac.run/posts/easycommand" rel="noopener">Projectbeschrijving</a></td>
          <td>modelbestanden gekoppeld vanuit de repository</td>
      </tr>
      <tr>
          <td>Het model met 1,5 miljard parameters scoorde 212/300 tegenover 191/300 voor nl2sh</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://dirac.run/posts/easycommand" rel="noopener">Projectbeschrijving</a></td>
          <td>geen; benchmark uitgevoerd door de auteur</td>
      </tr>
      <tr>
          <td>De modellen en data gebruiken Apache-2.0; de applicatie en benchmarkcode gebruiken MIT</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://dirac.run/posts/easycommand" rel="noopener">Projectbeschrijving</a></td>
          <td>licentiebestanden in de repository</td>
      </tr>
      <tr>
          <td>De dataset heeft geen officiële testverdeling en behoudt de historische weging niet</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://dirac.run/posts/easycommand" rel="noopener">Projectbeschrijving</a></td>
          <td>toelichting van de auteur</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>4MT-VLM: visiemodellen verliezen locaties na rotatie</title><link>https://ai-news-daily.xyz/nl/posts/4mt-vlm-visiemodellen-verliezen-locaties-na-rotatie/</link><pubDate>Tue, 06 Oct 2026 04:02:31 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/4mt-vlm-visiemodellen-verliezen-locaties-na-rotatie/</guid><description>Een preprint past een klinische test voor ruimtelijk geheugen aan voor 16 visietaalmodellen. Alle herkennen een landschap vanuit de bestudeerde hoek, maar de meeste vervallen tot gokken zodra de camera beweegt.</description><content:encoded><![CDATA[<p>Visietaalmodellen herkennen een landschap vanuit de hoek waarin ze het voor het eerst zagen, maar de meeste kunnen het niet aanwijzen zodra de camera beweegt. Dat blijkt uit 4MT-VLM, een nieuwe benchmark die is aangepast van een klinische test voor ruimtelijk geheugen.</p>
<p>Markus Frey van Fraunhofer IAIS, een Duits instituut voor toegepast onderzoek, gaf 16 open en gesloten modellen de puzzel die bij menselijke patiënten wordt gebruikt: bestudeer een met de computer weergegeven landschap met vier bergtoppen en vind het vervolgens tussen vier vergelijkbare landschappen die vanuit een nieuwe hoek worden getoond. Een menselijke vrijwilliger loste ongeveer vier van de vijf gedraaide opgaven op. De meeste modellen deden het niet beter dan gokken.</p>
<h2 id="why-it-matters">Waarom dit ertoe doet</h2>
<p>Een robotica-engineer die een visietaalmodel als ogen van een mobiele robot gebruikt, heeft precies deze vaardigheid nodig: een kamer herkennen nadat de robot zich heeft omgedraaid. De preprint vindt dat grotere modellen noch gedetailleerdere instructies die vaardigheid leveren.</p>
<h2 id="herkenning-blijft-overeind-rotatie-mislukt">Herkenning blijft overeind, rotatie mislukt</h2>
<p>De benchmark past de Four Mountains Test aan, die clinici gebruiken omdat scores dalen bij schade aan de hippocampus en in een vroeg stadium van de ziekte van Alzheimer. Kleuren, texturen en belichting veranderen bij elke opgave tussen de studieafbeelding en de testafbeeldingen. Daardoor is zelfs een opgave zonder rotatie niet op te lossen door pixels te vergelijken. Frey behandelt de nauwkeurigheid op die ongedraaide opgaven als controle of een model de locatie überhaupt kan herkennen.</p>
<p>De modellen slagen voor die controle en falen vervolgens bij de rotatie. GPT-5.6 Luna van OpenAI beantwoordde elke ongedraaide opgave correct, maar slechts 31 procent van de gedraaide opgaven, waarbij gokken één op vier oplevert. Over alle 16 modellen samen was 135 graden de slechtste hoek: de nauwkeurigheid zakte daar duidelijk onder het kansniveau.</p>
<p>Een halve draai van 180 graden, de grootste verandering, scoorde beter dan 135 graden. Frey interpreteert dat als een teken dat de modellen een beeldtruc gebruiken, zoals vergelijken met een spiegelbeeld van de scène, en geen interne kaart draaien. De menselijke vergelijking komt van één deelnemer. Dat volstaat om te laten zien dat de taak oplosbaar is, maar niet om een menselijk gemiddelde te geven.</p>
<h2 id="grotere-modellen-herkennen-meer-maar-draaien-niet-beter">Grotere modellen herkennen meer, maar draaien niet beter</h2>
<p>Schaal verbeterde de herkenning en liet de rotatieprestaties gelijk. Binnen Alibaba&rsquo;s Qwen2.5-VL-familie, van 3 miljard tot 72 miljard parameters, steeg de nauwkeurigheid zonder rotatie van 30 naar 75 procent, terwijl de nauwkeurigheid met rotatie op of onder het kansniveau bleef. De InternVL3.5-familie herhaalde het patroon van 1 miljard tot 38 miljard parameters. Van 14 modellen met open gewichten tot 235 miljard parameters beantwoordde geen enkel meer dan 31 procent van de gedraaide opgaven correct, en een “denkende” variant scoorde hetzelfde als zijn standaardtegenhanger.</p>
<p>Instructies dichtten de kloof niet. Frey testte Qwen2.5-VL-32B met zes prompts, waaronder expliciete procedures zoals het landschap van recht boven voorstellen of de opvallendste bergtop als anker gebruiken. Bij alle zes bleef het model onder het kansniveau.</p>
<h2 id="meer-afstand-tussen-foute-antwoorden-onthult-een-grove-kaart">Meer afstand tussen foute antwoorden onthult een grove kaart</h2>
<p>Het meest informatieve experiment veranderde alleen de foute antwoorden. Frey mat in meters hoe ver de bergtoppen van twee landschappen uit elkaar liggen na de best mogelijke rotatie. Vervolgens tekende hij de drie afleiders opnieuw met verder afwijkende indelingen, terwijl het doel en de hoeken identiek bleven.</p>
<p>De dichtstbijzijnde afleider van ongeveer 7 meter naar ongeveer 31 meter afstand verplaatsen, bracht Gemini 3.8 Flash van Google bij gedraaide opgaven van 39 naar 85 procent en GPT-5.6 Luna van 31 naar 55 procent. Geen enkel open model verbeterde in statistisch betekenisvolle mate.</p>
<p>Dat is het bewijs van het artikel dat frontiermodellen enig besef van de indeling hebben, maar alleen met lage resolutie. Een model zonder kaart zou niet profiteren van meer afstand tussen de afleiders, en een model met een kaart op menselijk niveau zou geen 30 meter scheiding nodig hebben. Het effect lijkt op een stad herkennen vanuit een vliegtuigraam, maar de eigen straat niet.</p>
<p>De fouten wijzen in dezelfde richting. Iemand die verkeerd antwoordt, kiest doorgaans de afleider waarvan de indeling het dichtst bij het doel ligt. De foute antwoorden van de modellen waren bijna gelijk verdeeld over nabije en verre afleiders, alsof de indeling geen rol speelde bij de keuze.</p>
<h2 id="een-synthetische-test-van-één-auteur">Een synthetische test van één auteur</h2>
<p>De landschappen zijn synthetische weergaven, en Frey merkt op dat pretraining op vergelijkbare gerenderde scènes sommige modellen zou kunnen bevoordelen. Het aantal parameters van gesloten modellen is niet bekendgemaakt; het bewijs over schaal berust dus alleen op open modellen. De preprint, op 30 september 2026 op arXiv geplaatst, heeft één auteur en linkt niet naar code of een dataset.</p>
<p>Frey zegt dat meer menselijke deelnemers worden getest. Dat zal een passende vergelijkingsgroep bieden voor de score van 82 procent die de vrijwilliger op gedraaide opgaven behaalde.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>4MT-VLM past de Four Mountains Test aan; 500 opgaven over 100 gegenereerde landschappen, 16 modellen getest</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen; eigen benchmark van de auteur</td>
      </tr>
      <tr>
          <td>Het uiterlijk wordt bij elke hoek opnieuw bepaald tussen studie- en testafbeeldingen</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen; methodebeschrijving</td>
      </tr>
      <tr>
          <td>Eén menselijke deelnemer beantwoordde 100% van de ongedraaide en 82% van de gedraaide opgaven correct</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen; slechts één deelnemer</td>
      </tr>
      <tr>
          <td>GPT-5.6 Luna: 100% zonder rotatie, 31% met rotatie; kansniveau is 25%</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Gezamenlijke nauwkeurigheid bij 135 graden is 15,0% (48/320), onder het kansniveau; 23% bij 180 graden</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Modellen gebruiken een beeldtruc, zoals vergelijken met een spiegelbeeld</td>
          <td>ANALYSE</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>interpretatie van het 135/180-gradenpatroon door de auteur</td>
      </tr>
      <tr>
          <td>Qwen2.5-VL van 3 miljard tot 72 miljard parameters: zonder rotatie 30% tot 75%, met rotatie 29%, 31%, 18%, 20%</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Geen model met open gewichten (1 miljard tot 235 miljard parameters) overschrijdt 31% met rotatie; de denkende variant evenaart de instructievariant op 19% met rotatie</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Zes instructiestijlen laten Qwen2.5-VL-32B op 13,8% tot 23,8% staan, allemaal onder het kansniveau</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Mediane afstand tot de dichtstbijzijnde afleider van 6,8 m naar 31,4 m: Gemini 3.8 Flash van 39% naar 85%, GPT-5.6 Luna van 31% naar 55%</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Geen open model verandert significant bij meer afstand tussen de afleiders</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Modelfouten zijn 30/37/33 verdeeld over de dichtstbijzijnde, middelste en verste afleider; de mens koos de dichtstbijzijnde bij 10 van de 14 fouten</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Frontiermodellen hebben een grove representatie van de indeling</td>
          <td>ANALYSE</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>gevolgtrekking uit het resultaat met afleiderafstanden</td>
      </tr>
      <tr>
          <td>Preprint van één auteur geplaatst op 30 september 2026; auteur bij Fraunhofer IAIS; geen code of data gekoppeld</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">arXiv-vermelding</a></td>
          <td>arXiv-metadata en e-maildomein van de auteur</td>
      </tr>
      <tr>
          <td>Meer menselijke deelnemers worden geëvalueerd</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.39238" rel="noopener">Preprint van Frey</a></td>
          <td>geen</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>bilibili breidt Index-Translate uit met lokale builds</title><link>https://ai-news-daily.xyz/nl/posts/bilibili-breidt-index-translate-uit-met-lokale-builds/</link><pubDate>Mon, 05 Oct 2026 04:01:30 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/bilibili-breidt-index-translate-uit-met-lokale-builds/</guid><description>De open vertaalfamilie heeft nu GGUF-, FP8- en NVFP4-pakketten, een gratis compatibele API en vier openbare benchmarks. De prestatiecijfers blijven eigen metingen van de ontwikkelaar.</description><content:encoded><![CDATA[<p>bilibili voegde op 3 en 4 oktober officiële gekwantiseerde builds, een gratis openbare interface en vier evaluatiesets toe aan Index-Translate. Daarmee werden de onlangs vrijgegeven vertaalmodellen een praktischer pakket voor lokaal en gehost gebruik.</p>
<p>De familie vertaalt tekst tussen 150 talen en aanvaardt instructies over terminologie, opmaak en stijl. De gewone tekstmodellen zijn beschikbaar met 2 miljard en 9 miljard parameters en als preview met 35 miljard parameters. Het grootste is een mixture-of-experts-model dat ongeveer 3 miljard parameters per token activeert.</p>
<p>De belangrijkste verandering voor lokale gebruikers is de verpakking. GGUF-versies richten zich nu op llama.cpp, FP8-builds op vLLM en NVFP4-builds op nieuwere Blackwell-GPU&rsquo;s. Het project publiceert die formaten voor de tekstmodellen, de modellen met controle over lettergrepen en de modellen voor lange documenten. De spraakmodellen hebben ook gekwantiseerde pakketten, al bevatten de GGUF-repositories alleen de onderliggende tekstmodellen en niet de volledige spraakpipeline.</p>
<p>Het nieuwe gehoste eindpunt biedt de 35B-A3B-preview via een interface die compatibel is met de chat-API van OpenAI. Daarmee kunnen ontwikkelaars het model testen zonder eerst geschikte hardware te regelen. De repository noemt het eindpunt gratis, maar belooft geen serviceniveau of prijzen op lange termijn.</p>
<p>Index-Translate is meer dan een zinsvertaler. De client kan JSON- en markdownstructuren behouden, een woordenlijst afdwingen en een bepaalde toon vragen. Verwante pakketten vertalen spraak, streven naar een gevraagd aantal lettergrepen voor nasynchronisatie of nemen context mee door een lang document. Deze functies richten zich op de lastige delen van vertaling in productie die een algemene prompt als “vertaal dit” vaak mist.</p>
<p>bilibili gaf ook benchmarkmateriaal voor instTrans, MEME, SandGlass en NativeLong vrij, met evaluatiescripts. Daardoor is het testontwerp inspecteerbaar, maar de gepubliceerde scores zijn nog altijd eigen metingen van de ontwikkelaar. In het technische rapport behaalt het previewmodel 0,8794 op FLORES COMET-22 en 76,76 bij de WMT26-beoordelaar. Die laatste gebruikt GPT-5.6-Sol als evaluator en mag dus niet als een onafhankelijke menselijke vergelijking worden gelezen.</p>
<p>De oorspronkelijke modelfamilie verscheen op 30 september; dit is geen lancering van een nieuw basismodel. Het nieuws is dat ze binnen vier dagen de uitrolformaten, het testeindpunt en de evaluatiebestanden kreeg die nodig zijn om van een modelaankondiging naar iets te gaan dat ontwikkelaars daadwerkelijk kunnen uitproberen.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Openbare API en vier benchmarks vrijgegeven op 4 oktober; gekwantiseerde builds vrijgegeven op 3 oktober</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/bilibili/Index-Translate" rel="noopener">Projectrepository</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Tekstmodellen omvatten 150 talen en ondersteunen beperkingen voor terminologie, opmaak en stijl</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/bilibili/Index-Translate" rel="noopener">Projectrepository</a></td>
          <td><a href="https://huggingface.co/IndexTeam/Index-Translate-35B-A3B-preview" rel="noopener">Modelkaart</a></td>
      </tr>
      <tr>
          <td>GGUF-, FP8- en NVFP4-pakketten en hun gedocumenteerde runtime-doelen</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/bilibili/Index-Translate" rel="noopener">Projectrepository</a></td>
          <td>afzonderlijke pakketlinks vermeld in de repository</td>
      </tr>
      <tr>
          <td>Previewmodel heeft in totaal 35 miljard en ongeveer 3 miljard actieve parameters</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://huggingface.co/IndexTeam/Index-Translate-35B-A3B-preview" rel="noopener">Modelkaart</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>FLORES COMET-22 0,8794 en WMT26-beoordelaar 76,76</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.40181" rel="noopener">Technisch rapport</a></td>
          <td>geen; rapport gebruikt GPT-5.6-Sol als beoordelaar voor WMT26</td>
      </tr>
      <tr>
          <td>Nieuwe pakketten maken de familie praktischer om lokaal of via een gehost eindpunt te testen</td>
          <td>ANALYSE</td>
          <td><a href="https://github.com/bilibili/Index-Translate" rel="noopener">Projectrepository</a></td>
          <td>gevolgtrekking uit vrijgegeven bestanden; langdurige beschikbaarheid van het eindpunt niet vastgesteld</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>Voorbeelden versterken een symbolisch circuit dat al bestaat</title><link>https://ai-news-daily.xyz/nl/posts/voorbeelden-versterken-een-symbolisch-circuit-dat-al-bestaat/</link><pubDate>Mon, 05 Oct 2026 03:59:30 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/voorbeelden-versterken-een-symbolisch-circuit-dat-al-bestaat/</guid><description>Een onderzoek naar interpreteerbaarheid vindt hetzelfde pad voor abstractie, inductie en ophalen voordat de nauwkeurigheid met enkele voorbeelden stijgt. Dat suggereert dat demonstraties bestaande mechanismen versterken in plaats van een nieuw algoritme te bouwen.</description><content:encoded><![CDATA[<p>Wanneer een taalmodel een patroon leert uit verschillende voorbeelden in zijn prompt, kan het lijken alsof het ter plekke een nieuwe procedure heeft samengesteld. Een mechanistisch onderzoek van onafhankelijk onderzoeker Melissa Wessel biedt een andere verklaring voor één familie symbolische taken: de procedure is al aanwezig in het model, en voorbeelden versterken geleidelijk het signaal dat erdoorheen loopt.</p>
<p>De preprint volgt een circuit met drie fasen bij prompts met nul tot tien demonstraties. Hij vindt dezelfde kernroute wanneer de nauwkeurigheid laag is en wanneer die bijna perfect is. De aandachtshoofden verschijnen niet plotseling wanneer het model het patroon “begrijpt”. Hun causale bijdrage groeit.</p>
<p>Dit is een beperkt experiment, geen algemene theorie over leren in de context. Maar het maakt van een aantrekkelijke metafoor — voorbeelden activeren latente mechanismen — iets waarin onderzoekers kunnen ingrijpen en dat ze kunnen testen.</p>
<h2 id="van-tokens-naar-variabelen-en-terug">Van tokens naar variabelen en terug</h2>
<p>De taak gebruikt abstracte patronen van drie tokens, zoals ABA of ABB. De tokens zijn willekeurig, zodat het model niet op hun gewone betekenis kan vertrouwen. Het moet afleiden welke positie naar het antwoord moet worden gekopieerd.</p>
<p>Eerder werk identificeerde drie fasen. Symbolische abstractiehoofden vertalen concrete tokens naar variabelen. Symbolische inductiehoofden werken met dat abstracte patroon. Ophaalhoofden zetten de voorspelde variabele weer om naar het vereiste token. Wessel volgt deze structuur in Gemma 2-2B, Llama 3.1-8B en Qwen 3-4B, waarbij alleen het aantal demonstraties verandert.</p>
<p>In Gemma 2-2B begint de nauwkeurigheid op 17 procent met één voorbeeld, bereikt ze 93 procent met vier en 99 procent met tien. Toch detecteert causale mediatieanalyse de drie fasen al bij één voorbeeld. De belangrijke hoofden blijven grotendeels aanwezig bij opeenvolgende promptlengtes, terwijl de causale bijdrage van een afzonderlijk hoofd tussen één en tien voorbeelden tot achtvoudig groeit.</p>
<p>De interpretatie is kwantitatief en niet architecturaal: extra voorbeelden versterken een bestaand pad in plaats van een volledig ander pad in te schakelen.</p>
<h2 id="het-signaal-tussen-prompts-verplaatsen">Het signaal tussen prompts verplaatsen</h2>
<p>Detectie alleen kan correlatie met een mechanisme verwarren. Daarom verplaatst het artikel ook interne activaties tussen uitvoeringen. Activaties uit tien voorbeelden invoegen in een prompt met één voorbeeld verhoogt Gemma&rsquo;s nauwkeurigheid van 17 naar 88 procent. Bij nul voorbeelden verhoogt het invoegen van de inductie- en ophaalfasen de nauwkeurigheid voor één patroon van 1 naar 56 procent; willekeurige hoofden buiten het circuit laten die onder 1 procent.</p>
<p>De duidelijkste ingreep gebruikt een “functievector”: een vaste activatie die is samengesteld uit hoofden die door de causale analyse zijn geïdentificeerd. Die invoegen bij nul voorbeelden verhoogt de nauwkeurigheid van 1 naar 86 procent op de ABA-regel. Wanneer de latere ophaalhoofden worden uitgeschakeld, daalt dat herstel naar 13 procent.</p>
<p>Die afhankelijkheid is de sleutel. De vector werkt niet als een op zichzelf staand antwoord of een algemene impuls voor het netwerk. Hij kan de inductiefase grotendeels vervangen doordat het latere ophaalmechanisme beschikbaar blijft om de uitvoer te lezen.</p>
<h2 id="een-bruikbaar-resultaat-binnen-een-klein-domein">Een bruikbaar resultaat binnen een klein domein</h2>
<p>Het onderzoek laat leren in de context minder lijken op het schrijven van een nieuw programma tijdens inferentie, en meer op het aanleveren van invoer aan een programma dat tijdens de training is ingebouwd. Als die opvatting generaliseert, zouden de grenzen van een model bij leren met enkele voorbeelden afhangen van de circuits in zijn gewichten en van de vraag of een prompt ze kan bereiken.</p>
<p>Het artikel laat niet zien dat alle demonstraties zo werken. De centrale taak is in wezen een kleine relationele tabel met een kopieerbewerking. Een controle met analogieën tussen letterreeksen vindt een vergelijkbare topologie, maar wordt niet voor elk model of met het volledige programma van activatie-ingrepen herhaald. De analysemethode selecteert bovendien componenten die twee regels onderscheiden en kan daardoor gedeelde infrastructuur missen.</p>
<p>Het resultaat is het sterkst als concreet mechanisme voor één eenvoudige capaciteit: voorbeelden kunnen een stabiel symbolisch pad versterken lang voordat het gedrag laat zien dat het pad er is.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Het onderzoek volgt abstractie-, inductie- en ophaalfasen in Gemma 2-2B, Llama 3.1-8B en Qwen 3-4B</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.36265" rel="noopener">Preprint</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Gemma&rsquo;s nauwkeurigheid stijgt van 17 procent bij één voorbeeld naar 99 procent bij tien; de bijdrage per hoofd groeit tot achtvoudig</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36265" rel="noopener">Preprint</a></td>
          <td>geen; experimenten van de auteur</td>
      </tr>
      <tr>
          <td>Activatie-ingrepen met tien voorbeelden verhogen de nauwkeurigheid bij één voorbeeld naar 88 procent, en ingrepen bij nul voorbeelden verhogen 1 procent naar 56 procent</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36265" rel="noopener">Preprint</a></td>
          <td>geen; experimenten van de auteur</td>
      </tr>
      <tr>
          <td>Injectie van een functievector verhoogt ABA-nauwkeurigheid bij nul voorbeelden van 1 procent naar 86 procent, waarna die na uitschakeling van ophaalhoofden naar 13 procent daalt</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36265" rel="noopener">Preprint</a></td>
          <td>geen; experimenten van de auteur</td>
      </tr>
      <tr>
          <td>Demonstraties versterken voor deze taken een bestaand circuit in plaats van een nieuw te bouwen</td>
          <td>ANALYSE</td>
          <td><a href="https://arxiv.org/abs/2609.36265" rel="noopener">Preprint</a></td>
          <td>interpretatie van causale ingrepen in het artikel</td>
      </tr>
      <tr>
          <td>Generalisatie naar rijker abstract redeneren blijft open</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.36265" rel="noopener">Preprint</a></td>
          <td>vermelde beperking</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>Strata-fork blaast IBM-AI-server nieuw leven in voor lokale LLM's</title><link>https://ai-news-daily.xyz/nl/posts/strata-fork-hergebruikt-ibm-ai-server-voor-lokale-llms/</link><pubDate>Mon, 05 Oct 2026 03:58:30 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/strata-fork-hergebruikt-ibm-ai-server-voor-lokale-llms/</guid><description>Een fork voor specifieke hardware draait Qwen3.8-Flash-Next op twee POWER9-processors en vier V100-GPU&amp;#39;s. Dat laat zien wat modelbewuste optimalisatie uit een systeem uit 2018 kan halen.</description><content:encoded><![CDATA[<p>Een ontwikkelaar uit de gemeenschap heeft de Strata-inferentie-engine aangepast voor de AC922 van IBM, een server uit 2018 waarvan de twee POWER9-processors rechtstreeks met vier Nvidia V100-accelerators van 16 GB zijn verbonden. Het resultaat is minder een algemene vervanging voor llama.cpp dan een casestudy over het benutten van de topologie van een ongebruikelijke machine voor een modern mixture-of-experts-model.</p>
<p>De fork draait een gekwantiseerde Qwen3.8-Flash-Next, een model met 125 miljard parameters waarvan het schaarse ontwerp slechts een klein deel van de experts per token activeert. Strata houdt veelgebruikte experts op de GPU&rsquo;s en de volledige verzameling experts in het systeemgeheugen. Die opzet past bij de AC922, omdat zijn CPU&rsquo;s en GPU&rsquo;s NVLink 2.0-verbindingen met hoge bandbreedte delen en niet uitsluitend via gewone PCIe communiceren.</p>
<p>De ontwikkelaar voegde een gebied met vastgezette geheugenpagina&rsquo;s toe voor elke CPU-socket, plaatste experts rekening houdend met de niet-uniforme geheugenindeling van de machine en liet een anders ongebruikte naburige GPU gegevens ophalen via zijn eigen NVLink. Andere wijzigingen omvatten FP16-Volta-tensorcorekernels, laagverdeling met pipelining en specifieke vector- en threadafhandeling voor POWER9.</p>
<p>Op vier V100&rsquo;s bereiken de eigen metingen van het project een piek van 7.357 tokens per seconde bij het lezen van een prompt met 135.000 tokens. Een prompt met 252.000 tokens wordt verwerkt met 7.089 tokens per seconde, wat 35,5 seconden duurt. Greedy generatie bereikt 113 tokens per seconde bij JSON, 103 bij code en 84 bij lopende tekst. Bij een hergebruikte context van 252.000 tokens verschijnt het eerste vervolg-token na 0,26 seconden, waarna de generatie met 60 tokens per seconde verloopt.</p>
<p>Die cijfers zijn metingen van de bouwer op één gespecialiseerde server, geen algemeen toepasbare benchmark. De snelheid van promptverwerking varieert sterk met de promptlengte, en het type gegenereerde tekst verandert de decodeersnelheid. De repository beschrijft de fork als experimenteel en niet ondersteund door het oorspronkelijke Strata-project.</p>
<p>Toch illustreert het project een steeds bruikbaarder aanpak voor lokale inferentie: optimaliseren rond een specifiek model en een specifieke geheugenhiërarchie, in plaats van te eisen dat één algemene engine elke machine hetzelfde behandelt. De AC922 is oude, energie-intensieve zakelijke apparatuur, maar de CPU-GPU-verbindingen blijven uitzonderlijk krachtig. Een model met duizenden experts geeft die verbindingen nuttig werk.</p>
<p>De code is onder de MIT-licentie van Strata gepubliceerd op de <code>ac922</code>-branch van de fork, met notities over het bouwen, de kwaliteit en benchmarks. Sommige wijzigingen kunnen uiteindelijk naar het oorspronkelijke project gaan, maar de directe waarde is inspecteerbare techniek voor eigenaars van hardware waarop gangbare inferentieprojecten zich zelden richten.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>De fork richt zich op een AC922 met twee POWER9-CPU&rsquo;s, vier V100-GPU&rsquo;s van 16 GB en NVLink 2.0</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/eelgaev/Strata-AC922" rel="noopener">Repository</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>NUMA-bewuste plaatsing van experts, per socket gebieden met vastgezette geheugenpagina&rsquo;s, ophalen via naburige GPU&rsquo;s en Volta/POWER9-kernels</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/eelgaev/Strata-AC922" rel="noopener">Repository</a></td>
          <td>code en technische notities aanwezig; niet onafhankelijk uitgevoerd</td>
      </tr>
      <tr>
          <td>Piek bij prefill van 7.357 tokens/s en 7.089 tokens/s bij 252.000 tokens</td>
          <td>GEMELD DOOR DE GEMEENSCHAP</td>
          <td><a href="https://github.com/eelgaev/Strata-AC922" rel="noopener">Repository</a></td>
          <td>geen; benchmark van de bouwer</td>
      </tr>
      <tr>
          <td>Decoderen bereikt 113 tokens/s bij JSON en 84 bij lopende tekst</td>
          <td>GEMELD DOOR DE GEMEENSCHAP</td>
          <td><a href="https://github.com/eelgaev/Strata-AC922" rel="noopener">Repository</a></td>
          <td>geen; benchmark van de bouwer</td>
      </tr>
      <tr>
          <td>De fork is experimenteel en wordt niet door het oorspronkelijke project ondersteund</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://github.com/eelgaev/Strata-AC922" rel="noopener">Repository</a></td>
          <td>expliciete opmerking in de repository</td>
      </tr>
      <tr>
          <td>Inferentie voor specifieke hardware kan opnieuw waarde halen uit een oudere gespecialiseerde geheugentopologie</td>
          <td>ANALYSE</td>
          <td><a href="https://github.com/eelgaev/Strata-AC922" rel="noopener">Repository</a></td>
          <td>gevolgtrekking uit implementatie en metingen</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>Wagtails maand met één model besteedde helft tokens elders</title><link>https://ai-news-daily.xyz/nl/posts/wagtails-maand-met-een-model-besteedde-helft-tokens-elders/</link><pubDate>Mon, 05 Oct 2026 03:57:30 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/wagtails-maand-met-een-model-besteedde-helft-tokens-elders/</guid><description>Een plan om in september al het ontwikkelwerk op GLM 5.3 Flash te doen, verbruikte twee miljard tokens, maar slechts de helft ging naar dat model. Prototypes, aanbiederscapaciteit en evaluatie verklaren het verschil.</description><content:encoded><![CDATA[<p>Thibaud Colas van het kernteam van Wagtail probeerde in september zijn ontwikkelwerk met één efficiënt open model te doen: GLM 5.3 Flash. Zijn gebruikslog registreert twee miljard tokens. Slechts één miljard ging naar het gekozen model.</p>
<p>Dat maakt het experiment bruikbaarder dan een probleemloos succesverhaal. Het doelmodel zelf kostte volgens Colas ongeveer 68 dollar en naar schatting 4 kWh elektriciteit. Het werk over de hele maand kwam op ongeveer 35 kWh in plaats van de geplande 10 kWh, doordat prototypes, problemen met aanbieders en bewuste modelevaluatie verkeer elders heen stuurden.</p>
<p>De grootste mislukking kwam van een via “vibe coding” gebouwd prototype van Wagtails experimentele Model Context Protocol-server. Colas zegt dat de keuze van het verkeerde model voor die taak vrijwel in één nacht 450 miljoen tokens, ongeveer 150 dollar en 5 kWh verbruikte. Het prototype werkte, maar het uit de hand gelopen gebruik laat zien hoe snel een agentisch experiment een zorgvuldig gekozen budget kan domineren.</p>
<p>Infrastructuur was de tweede beperking. Colas meldt slechtere prestaties van GLM 5.3 Flash en schrijft die toe aan beperkte capaciteit bij onafhankelijke inferentieaanbieders. Hij verplaatste werk naar alternatieven, waaronder DeepSeek V4.1 Flash en Qwen 3.8 Flash. Voor een team dat de grootste labs probeert te vermijden, wordt modelbeschikbaarheid een deel van modelkwaliteit: een sterk checkpoint is geen betrouwbare keuze voor productie als het eindpunt bij veel vraag vertraagt.</p>
<p>Een deel van het gebruik buiten het doelmodel was bewust. Wagtail ontwikkelt een eigen taakbenchmark, dus het team moest verschillende modellen draaien in plaats van alleen voor de dagelijkse uitvoer te optimaliseren. Colas stelt nu voor de regel van één model te reserveren voor meer dan de helft van het normale productiewerk, terwijl onderzoek en ontwikkeling vrij blijven om alternatieven te vergelijken.</p>
<p>Hij blijft positief over GLM 5.3 Flash. De lange context, ondersteuning voor beeld en beschikbaarheid bij verschillende aanbieders maakten het model bruikbaar voor Wagtail-ontwikkeling, interfacewerk, documentatie en evaluatie. Die beoordeling is zijn ervaring en geen gecontroleerde vergelijking.</p>
<p>De bredere les is methodologisch. Tokentotalen alleen verbergen of gebruik uit gepland productiewerk, onbedoelde lussen of noodzakelijke evaluatie kwam. Een bruikbaar operationeel dashboard heeft minstens kosten, energie, modelidentiteit en taakuitkomst nodig. Het heeft ook lokale, voortdurende metingen nodig: het dure prototype werd pas zichtbaar nadat het al een kwart van het totale aantal tokens van de maand had verbruikt.</p>
<p>Dit is een zelfgerapporteerde maand van één team, geen bewijs dat GLM 5.3 Flash of open modellen in het algemeen een bepaald bedrag kosten. Prijzen van aanbieders, energieschattingen en taaksamenstellingen verschillen. Het verslag toont wel een foutpatroon waarmee rekening moet worden gehouden: het modelbudget kan kloppen terwijl de omringende workflow het ondermijnt.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Het gebruik in september bedroeg twee miljard tokens, waarvan één miljard op GLM 5.3 Flash</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://wagtail.org/blog/one-month-on-glm-53-flash/" rel="noopener">Verslag van Wagtail</a></td>
          <td>geen; gebruiksdashboard van de auteur</td>
      </tr>
      <tr>
          <td>Het aandeel van het doelmodel kostte ongeveer 68 dollar en 4 kWh; de hele maand gebruikte ongeveer 35 kWh</td>
          <td>GEMELD DOOR DE GEMEENSCHAP</td>
          <td><a href="https://wagtail.org/blog/one-month-on-glm-53-flash/" rel="noopener">Verslag van Wagtail</a></td>
          <td>geen; schattingen van de auteur</td>
      </tr>
      <tr>
          <td>Het prototype verbruikte 450 miljoen tokens, ongeveer 150 dollar en 5 kWh</td>
          <td>GEMELD DOOR DE GEMEENSCHAP</td>
          <td><a href="https://wagtail.org/blog/one-month-on-glm-53-flash/" rel="noopener">Verslag van Wagtail</a></td>
          <td>geen; metingen van de auteur</td>
      </tr>
      <tr>
          <td>Capaciteit bij aanbieders dwong tot overstappen op andere modellen</td>
          <td>GEMELD DOOR DE GEMEENSCHAP</td>
          <td><a href="https://wagtail.org/blog/one-month-on-glm-53-flash/" rel="noopener">Verslag van Wagtail</a></td>
          <td>geen; diagnose van de auteur</td>
      </tr>
      <tr>
          <td>GLM 5.3 Flash was bruikbaar voor verschillende ontwikkeltaken bij Wagtail</td>
          <td>OPINIE</td>
          <td><a href="https://wagtail.org/blog/one-month-on-glm-53-flash/" rel="noopener">Verslag van Wagtail</a></td>
          <td>beoordeling van één praktijkdeskundige</td>
      </tr>
      <tr>
          <td>Model, kosten, energie en uitkomst moeten samen worden gemeten</td>
          <td>ANALYSE</td>
          <td><a href="https://wagtail.org/blog/one-month-on-glm-53-flash/" rel="noopener">Verslag van Wagtail</a></td>
          <td>gevolgtrekking uit de gemelde foutpatronen</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>Aleph Alpha geeft Kolibri met open gewichten vrij</title><link>https://ai-news-daily.xyz/nl/posts/aleph-alpha-geeft-kolibri-met-open-gewichten-vrij/</link><pubDate>Sun, 04 Oct 2026 09:27:37 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/aleph-alpha-geeft-kolibri-met-open-gewichten-vrij/</guid><description>Het Duits-Engelse redeneermodel wordt geleverd met Apache-2.0-gewichten en instructies voor inferentie. Het kleine aantal actieve parameters laat de geheugenbehoefte nog altijd groot.</description><content:encoded><![CDATA[<p>Aleph Alpha, een Duitse AI-ontwikkelaar, bracht op 3 oktober Kolibri uit. Daarmee werd een Duits-Engels redeneermodel beschikbaar als downloadbare gewichten onder de Apache 2.0-licentie.</p>
<p>Kolibri gebruikt een mixture of experts: elk token activeert een klein deel van een veel groter netwerk. De modelkaart documenteert redeneerinstellingen, toolaanroepen en een serverinterface die compatibel is met de chat-API van OpenAI.</p>
<p>Voor een ontwikkelaar die Duitse documenten verwerkt, biedt de release een inspecteerbaar model dat op infrastructuur onder eigen beheer kan draaien. Aleph Alpha concentreert zich bewust op Duits en Engels, met onder meer een tokenizer die voor de Duitse woordstructuur is ontworpen, in plaats van op brede meertalige dekking.</p>
<p>De geheugenbehoefte is aanzienlijk. Kolibri activeert ongeveer 3,5 miljard parameters per token, maar de circa 78 miljard parameters moeten nog altijd worden opgeslagen. Het FP8-checkpoint neemt ongeveer 78 GB in beslag; de kaart noemt twee A100-GPU&rsquo;s van 80 GB of één H200 onder de minimale configuraties.</p>
<p>Aleph Alpha zegt contexten van ongeveer één miljoen tokens te hebben gevalideerd, maar raadt voor efficiënte inferentie en complexe taken een kwart daarvan aan. De oorspronkelijke trainingslengte voor lange context is het kleinere getal. Het onderscheid is nuttig bij de planning van een uitrol: de grootste toegestane invoer is een gedocumenteerde uitbreiding, met een afzonderlijk advies voor dagelijks gebruik.</p>
<p>De eigen tests van het bedrijf laten ongelijkmatige sterke punten zien. Kolibri scoort hoog op wedstrijdwiskunde, terwijl Qwen3.8 27B het overtreft op de algemene Engelse en Duitse maatstaven van de kaart. Dit zijn evaluaties van beide modellen door Aleph Alpha, geen onafhankelijke vergelijking.</p>
<p>Inferentie vereist het inferentiepakket van Aleph Alpha, dat een Kolibri-plugin voor vLLM biedt. De kaart bevat opdrachten om redeneren en het ontleden van toolaanroepen in te schakelen. Aanroepers kunnen een laag, gemiddeld of hoog redeneerniveau kiezen of het uitschakelen. De kaart noemt assistenten onder menselijke controle en documentworkflows als beoogde toepassingen. Het FP8-checkpoint en een afzonderlijk BF16-checkpoint zijn nu beschikbaar.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Release op 3 oktober; focus op Duits en Engels; downloadbare Apache-2.0-gewichten</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://huggingface.co/Aleph-Alpha/Kolibri-1" rel="noopener">Bron</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>78.103.074.560 totale en 3.457.573.120 actieve parameters; FP8-geheugengebruik van ongeveer 78 GB; gedocumenteerde GPU-configuraties</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://huggingface.co/Aleph-Alpha/Kolibri-1" rel="noopener">Bron</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Oorspronkelijke context 262.144; gevalideerde uitbreiding 1.048.576; advies maximaal 262.144</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://huggingface.co/Aleph-Alpha/Kolibri-1" rel="noopener">Bron</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Algemeen EN/DE: Kolibri 75,5/70,8, Qwen3.8 27B 80,2/79,9; AIME 2025 EN 96,9</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://huggingface.co/Aleph-Alpha/Kolibri-1" rel="noopener">Bron</a></td>
          <td>geen; alle modellen geëvalueerd door Aleph Alpha</td>
      </tr>
      <tr>
          <td>Tokenizerontwerp; vLLM-plugin, redeneerinstellingen, toolparser en OpenAI-compatibele API; beoogd gebruik met menselijke controle; BF16-checkpoint</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://huggingface.co/Aleph-Alpha/Kolibri-1" rel="noopener">Bron</a></td>
          <td>geen; gedocumenteerde interfaces en beoogde toepassingen, geen uitvoeringstests</td>
      </tr>
      <tr>
          <td>Lokale uitrol geeft ontwikkelaars die Duitse documenten verwerken controle over infrastructuur</td>
          <td>ANALYSE</td>
          <td><a href="https://huggingface.co/Aleph-Alpha/Kolibri-1" rel="noopener">Bron</a></td>
          <td>gevolgtrekking uit downloadbare gewichten en inferentiedocumentatie</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item><item><title>Georgia Tech-team verlengt het volgen van modelverwijzingen</title><link>https://ai-news-daily.xyz/nl/posts/georgia-tech-team-verlengt-het-volgen-van-modelverwijzingen/</link><pubDate>Sun, 04 Oct 2026 09:25:37 +0200</pubDate><guid>https://ai-news-daily.xyz/nl/posts/georgia-tech-team-verlengt-het-volgen-van-modelverwijzingen/</guid><description>Een kleine getrainde ingreep verbetert Qwen3-8B sterk op synthetische verwijzingsketens. De preprint herleidt de verandering tot de manier waarop middelste lagen informatie tussen regels doorgeven.</description><content:encoded><![CDATA[<p>Een team van het Georgia Institute of Technology meldt dat een zeer kleine getrainde ingreep Qwen3-8B veel langere ketens van variabeleverwijzingen laat volgen, terwijl de oorspronkelijke modelgewichten vastgezet blijven.</p>
<p>Zehao Jin, Ruixuan Deng en Junran Wang testen prompts met toewijzingen, zoals een variabele die naar een andere variabele verwijst, die uiteindelijk naar een woord verwijst. Het model moet dat woord terugvinden door de keten te volgen.</p>
<p>Voor een onderzoeker die een model aanpast, isoleert het resultaat een nuttige vraag: weerspiegelen zwakke prestaties ontbrekende berekeningen of het niet gebruiken van berekeningen die al in het netwerk beschikbaar zijn? In deze gecontroleerde taak maakt een verandering in de manier waarop een vroege laag informatie aan latere lagen aanbiedt een groot verschil.</p>
<p>De preprint van het team, ingediend op 29 september, meldt dat Qwen3-8B bij ketens met 24 toewijzingen van ongeveer één correct antwoord op zes naar bijna uitsluitend correcte antwoorden gaat. De vergelijking gebruikt nauwkeurigheid van exacte antwoorden op synthetische programma&rsquo;s; de ingreep is specifiek voor deze taak getraind.</p>
<p>De toegevoegde component is een low-rank adaptation met rang acht, of LoRA, toegepast op de verborgen toestand van het model in één laag. Alleen de kleine matrices van de aanpassing en een schaalfactor worden getraind. Vastgezette aandacht en andere modellagen blijven informatie tussen posities verplaatsen.</p>
<p>De taak scheidt het volgen van verwijzingen van het ophalen van feiten. De eerste toewijzingen bevatten zelfstandige naamwoorden van één token, latere toewijzingen verwijzen naar eerdere variabelen, en de prompt eindigt met een vraag naar de waarde van één variabele. Variabelenamen, zelfstandige naamwoorden en de bevraagde keten worden willekeurig gekozen.</p>
<p>Het artikel onderscheidt ook kiezen uit de beginwaarden van het als eerste rangschikken van het exacte antwoord over het volledige vocabulaire. De belangrijkste Qwen-verbetering gebruikt de moeilijkere maat voor exacte antwoorden. Dat is relevant omdat verschillende andere experimenten een keuzescore gebruiken; die scores beschrijven andere tests.</p>
<h2 id="de-ingreep-start-een-estafette-door-bestaande-lagen">De ingreep start een estafette door bestaande lagen</h2>
<p>De auteurs volgen hoe elke regel informatie krijgt over de keten waartoe hij behoort. In het ongewijzigde model stopt dat proces na enkele regels; latere berekeningen kunnen een waarde kopiëren zonder de keten ver genoeg uit te breiden.</p>
<p>Na aanpassing verzamelt een regel informatie uit eerdere regels en geeft die verder door via een kort interval van middelste lagen. De auteurs noemen dit een estafette. Aandacht voor de bovenliggende regel blokkeren verstoort het proces en levert interventiebewijs voor het voorgestelde mechanisme.</p>
<p>Plaatsing is van belang. Dezelfde aanpassing voorbij een modelspecifieke grens verplaatsen neemt veel van het voordeel weg, omdat de nuttige berekeningen in de middelste lagen niet meer op de ingreep volgen. Een meting op vastgezette modellen schat die grens met bescheiden precisie in apart gehouden tests.</p>
<p>De auteurs onderzoeken ook modellen die lagen in lussen herhalen. In die omstandigheden maakt de aanpassing extra lussen nuttig over een aanzienlijk bereik, al keren de verbeteringen in sommige experimenten uiteindelijk om. De resultaten met de langste verwijzingsketens gebruiken een specifieke regelvolgorde en passen de aanpassing in elke lus toe.</p>
<p>Een afzonderlijk vraag-antwoordexperiment biedt bewijs over de plaatsing van de aanpassing, maar het artikel stelt niet vast dat dezelfde estafette daar de verbetering verklaart. De hoofdopzet levert de relevante alinea&rsquo;s aan, en de aanpassingen worden voor elke taakindeling getraind.</p>
<p>Het centrale resultaat blijft scherp begrensd: een kleine verandering kan het volgen van verwijzingen binnen deze modellen verlengen. Effecten op algemeen modelgedrag en betrouwbaarheid bij uitrol vereisen afzonderlijke evaluatie. Het team biedt code en een interactieve demonstratie van de verwijzingsketentaak.</p>
<h2 id="verification">Verificatie</h2>
<table>
  <thead>
      <tr>
          <th>Bewering</th>
          <th>Label</th>
          <th>Primaire bron</th>
          <th>Onafhankelijke verificatie</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>Auteurs Jin, Deng en Wang bij het Georgia Institute of Technology; preprint van 29 september</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>geen</td>
      </tr>
      <tr>
          <td>Exacte Qwen3-8B-nauwkeurigheid op ketens van 24 regels: van 15,5 procent naar 99 procent; oorspronkelijke gewichten vastgezet; taakgetrainde ingreep met rang 8 en 65.537 toegevoegde parameters</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>geen; synthetische taaktest van de auteurs</td>
      </tr>
      <tr>
          <td>Willekeurige verwijzingsketens; exacte nauwkeurigheid tegenover keuzenauwkeurigheid; aanpassing van laaginvoer en vastgezette communicatiecomponenten</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>geen; taak- en methodesecties</td>
      </tr>
      <tr>
          <td>Estafette in de middelste lagen; ingreep in aandacht voor de bovenliggende regel; late plaatsing verliest voordeel; schatting van plaatsing op apart gehouden gegevens heeft bescheiden precisie</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>geen; causale tests begrenzen het algoritme, maar identificeren het niet uniek</td>
      </tr>
      <tr>
          <td>Verbeteringen en uiteindelijke omkering in modellen met lussen; langste tests gebruiken niveauvolgorde en aanpassing in elke lus; taakspecifieke vraag-antwoordtests met juiste referentiealinea&rsquo;s</td>
          <td>VOLGENS HET BEDRIJF</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>geen; resultaten en beperkingen</td>
      </tr>
      <tr>
          <td>Een kleine ingreep maakt anders ongebruikte berekeningen voor verwijzingsvolging zichtbaar in de geteste opzet</td>
          <td>ANALYSE</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>gevolgtrekking uit vergelijking met vastgezette gewichten, beperkt tot geteste taken</td>
      </tr>
      <tr>
          <td>Algemeen gedrag en betrouwbaarheid bij uitrol buiten de aangetoonde reikwijdte; openbare code en interactieve demo</td>
          <td>GEVERIFIEERD</td>
          <td><a href="https://arxiv.org/abs/2609.36585" rel="noopener">Bron</a></td>
          <td>geen; vermelde beperkingen en links naar bestanden</td>
      </tr>
  </tbody>
</table>
]]></content:encoded></item></channel></rss>