# Epoch vindt dat agents tekortschieten bij open werk

> Zes modellen deden afgebakende programmeer- en analysetaken beter dan onderzoeksoordelen, huisstijl en experimentontwerp in een evaluatie gebaseerd op Epoch AI's eigen werk.

- URL: https://ai-news-daily.xyz/nl/posts/epoch-vindt-agents-tekortschieten-bij-open-werk/
- Published: 2026-10-09
- Tags: agents, essays, research
- Author: Gegenereerd door AI (this text was generated by AI; see https://ai-news-daily.xyz/nl/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/nl/)

Geavanceerde agents voltooiden goed afgebakende delen van Epoch AI's werk betrouwbaar, maar schoten tekort wanneer taken afhankelijk waren van impliciete normen, onderzoeksoordelen of experimentontwerp.

Het onderzoeksinstituut zonder winstoogmerk gaf zes modellen 11 echte taken uit zijn grafische, data-, software- en onderzoekswerkprocessen. Claude Fable 5.1 en GPT-6 Astra voerden de evaluatie in grote lijnen aan, maar geen van beide kon zonder ingrijpen van begin tot eind werk van Epoch-kwaliteit produceren.

**Waarom dit ertoe doet:** Een manager die bepaalt waar agents in kenniswerk passen, krijgt weinig houvast aan benchmarks met één exact antwoord. Epochs resultaten plaatsen de resterende kloof bij het kiezen van een goede vraag, het leren van lokale normen en het herkennen dat een experiment het verkeerde heeft gemeten.

## Echte tools legden beoordelingsfouten bloot

Epoch gaf elk model de context die het een nieuwe medewerker zou geven, waaronder repositories, ontwerpreferenties en toegang tot tools zoals Figma, Google Drive en websites voor satellietbeelden. Modellen draaiden op hun hoogste beschikbare redeneerinstellingen en kregen tijdens een taak geen hulp. Een Epoch-medewerker beoordeelde elk resultaat vervolgens aan de hand van categoriegebonden criteria.

De testreeks omvatte vijf soorten werk: grafisch ontwerp, korte data-analyse, interactieve dataverkenners, datacenteronderzoek en onderzoeksontwerp. Sommige objectieve controles stonden naast subjectieve criteria. Door die combinatie kon de evaluatie eigenschappen meenemen zoals aansluiting bij het publiek en de waarde van een experiment, die geautomatiseerde benchmarks meestal vermijden.

Fable 5.1 en GPT-6 Astra waren het betrouwbaarst bij programmeren, berekenen en computergebruik. Een eenvoudige taak om de vormgeving van een grafiek aan te passen werd verwijderd omdat Fables uitvoer de norm van het instituut haalde, en Epoch zegt dat het veel van die stap nu intern automatiseert. Kimi K3 en Qwen 3.8 Max, met open gewichten, hadden vaker moeite met zowel afgebakend werk als de open onderdelen.

De fouten werden duidelijker wanneer een taak veel verdedigbare routes bood. Modellen hadden ruim voldoende voorbeelden van Epochs visuele en redactionele stijl, maar kopieerden oppervlakkige kenmerken zonder af te leiden waarom ze werden gebruikt. Astra koos een natuurkundig onderwerp dat Epoch te beperkt vond voor zijn algemene AI-publiek; Fable produceerde diagrammen en samenvattingen met veel meer informatie dan de publicatie doorgaans bevat.

Onderzoeksontwerp liet de moeilijkere grens zien. Astra stelde een veelbelovende vraag voor over waarom agents niet van ervaring leren en voerde vervolgens een pilot uit waarin veel antwoorden door een lage tokenlimiet werden afgebroken. Het merkte die afbreking op en herhaalde het experiment, maar presenteerde gevoeligheid voor de limiet alsnog als een inhoudelijk resultaat. Epochs kritiek is dat de fout in de opzet de onderzoeksvraag niet beantwoordde.

Dit bewijs voegt iets toe dat gewone vaardigheidsscores missen. Een systeem kan de tools bedienen, de code schrijven en het resultaat berekenen en toch een onbruikbaar onderwerp kiezen of een artefact als bevinding behandelen. Die fouten ontstaan waar werk wordt afgebakend en geïnterpreteerd, wat ook het punt is waarop juistheid moeilijk automatisch te beoordelen wordt.

De vergelijking heeft belangrijke beperkingen. Epoch draaide elk model slechts eenmaal per taak, gebruikte één menselijke beoordelaar per uitvoer en beoordeelde werk volgens zijn eigen normen. De zes modellen gebruikten ook verschillende agentomgevingen, zodat een sterkere browser- of toolintegratie het resultaat kan hebben beïnvloed. Het rapport kan het best worden gelezen als een reeks waargenomen faalwijzen, niet als een algemene ranglijst van arbeidsautomatisering.

Epoch wil resultaten toevoegen wanneer nieuwe modellen verschijnen. Dat maakt het project een nuttige longitudinale test: de doorslaggevende verandering zal een model zijn dat de ongeschreven normen van de organisatie leert en zijn eigen gebrekkige experiment afwijst, in plaats van alleen een benchmarkscore te verhogen.

## Verificatie {#verification}

| Bewering | Label | Primaire bron | Onafhankelijke verificatie |
|---|---|---|---|
| Epoch evalueerde zes modellen op 11 taken uit vijf categorieën van zijn eigen werk | GEVERIFIEERD | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| Modellen kregen taakcontext en tools, draaiden zonder ingrijpen en werden handmatig beoordeeld | GEVERIFIEERD | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| Fable 5.1 en GPT-6 Astra voerden de evaluatie in grote lijnen aan | VOLGENS HET BEDRIJF | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| Epoch verwijderde een taak voor grafiekvormgeving nadat Fable 5.1 zijn norm haalde | VOLGENS HET BEDRIJF | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| Modellen met open gewichten maakten in deze testreeks meer fouten op afgebakende taken | VOLGENS HET BEDRIJF | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| Astra's pilot telde afgebroken antwoorden mee en presenteerde later gevoeligheid voor tokenlimieten als resultaat | VOLGENS HET BEDRIJF | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| De evaluatie gebruikte één run per taak, één beoordelaar per uitvoer en verschillende agentomgevingen | GEVERIFIEERD | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
| Epoch wil resultaten van nieuwe modellen toevoegen | GEVERIFIEERD | [Epoch-rapport](https://epoch.ai/publications/can-ai-automate-epoch) | geen |
