Van buitenaf is een AI-lab een zwarte doos met een persbericht eraan. Anthropic zette daar donderdag een deur in: het bedrijf publiceerde drie meetcijfers over het eigen huis, met de bedoeling ze voortaan met enige regelmaat te herhalen. Het bekendste getal is meteen het ongemakkelijkste. Claude “leidt” inmiddels 26 procent van het AI-onderzoekswerk binnen Anthropic (Bron: Anthropic Institute).
In februari van dit jaar was dat minder dan 1 procent.
Wat er precies gemeten is
De publicatie bevat drie metingen. Hoeveel van het AI-onderzoek door AI zelf wordt gedaan, hoe goed het bedrijf de handelingen van zijn eigen agents in de gaten houdt, en waar de rekenkracht naartoe gaat. Alle drie zijn bedoeld als iets wat elk frontier-lab zou kunnen publiceren, zodat de getallen over de tijd en tussen bedrijven vergelijkbaar worden.
Voor het eerste cijfer leunt Anthropic op een schaal van Epoch AI, een onafhankelijke non-profit die de ontwikkeling van AI volgt. Die schaal loopt van AL0 tot AL5: geen AI-betrokkenheid, minimale betrokkenheid, AI assisteert, AI werkt samen, AI leidt, AI is autonoom (Bron: Epoch AI). Bij “AI leidt” krijgt het model een korte opdracht en werkt het de taak zelfstandig af, inclusief de verrassingen onderweg. Een mens leest het verslag en besluit of het de deur uit gaat.
Op die schaal zit 26 procent van het gewogen werk op AL4 of hoger. Meer dan 90 procent zit op AL3, waar AI minstens meewerkt. En AL5 haalt Anthropic voor geen enkel gemeten onderdeel: er staat overal nog een mens in de lus.
Beginner-tipHet verschil tussen “samenwerken” en “leiden” zit hem in wie er blijft opletten. Bij samenwerken zit er iemand naast het scherm die ingrijpt zodra er iets misgaat. Bij leiden loopt het model zelf tegen de problemen aan en lost ze op, en leest de mens achteraf het verslag. Dat klinkt als een klein verschil. Het is het verschil tussen een collega helpen en een collega vervangen.
Dertigduizend agents, één geblokkeerde beslissing op 47.000
Het tweede cijfer is dat waar de meeste lezers iets bij kunnen voorstellen. In augustus draaiden er op Anthropics meestgebruikte interne platform op elk moment ongeveer 30.000 agents aan onderzoeks- en engineeringwerk. Elke handeling die zo’n agent wil uitvoeren gaat eerst langs een controlesysteem, meestal binnen enkele seconden. Van ruim een miljard beslissingen in die maand werd 0,002 procent tegengehouden, ongeveer één op de 47.000 (Bron: Anthropic Institute).
Daarnaast leest een tweede systeem achteraf mee. Dat markeert zo’n 100.000 gespreksverslagen per week; daarvan gaan er ongeveer vijftig door naar een mens.
Dat lage blokkeerpercentage is precies de reden dat Anthropic het publiceert. Eén op de 47.000 is verwaarloosbaar bij dertigduizend agents in één gebouw. Bij miljoenen agents in de economie is het een dagelijkse gebeurtenis.
GevorderdenDe methodologie verdient aandacht, want de index staat of valt ermee. Anthropic nam per week in juli 2026 een steekproef van 20 procent van het personeel uit de afdelingen die aan modellen werken, liet een Claude-agent per persoon reconstrueren waaraan die week is gewerkt, en kwam zo op ongeveer 15.000 taken. Die zijn geordend in een boom van 542 knooppunten, waarvan 378 eindpunten met namen als “eval platform defect diagnosis and fixes”. De weging per categorie is de hoeveelheid mensuren die eraan besteed werd. Die boom staat nu vast, dus een stijgend indexcijfer zegt iets over het automatiseren van het werk zoals dat er in juli 2026 uitzag — niet over nieuw werk dat er sindsdien bij is gekomen.
Zes procent van de rekenkracht ging naar veiligheid
Het derde cijfer is een momentopname van één week, 13 tot 20 juli. Van de rekenkracht die naar AI-onderzoek ging, kwam ongeveer 6 procent bij veiligheidswerk terecht. Bij onderzoek dat door AI zélf werd uitgevoerd was dat ongeveer 12 procent (Bron: Anthropic Institute).
Anthropic zet er zelf de kanttekeningen bij die je wilt lezen. Veiligheidsonderzoek is per definitie minder rekenintensief dan een trainingsrun, dus compute is een matige maatstaf voor hoeveel aandacht een bedrijf aan veiligheid besteedt. De grens tussen veiligheids- en capaciteitswerk is bovendien vaag, en werk dat allebei evenveel vooruithelpt is als capaciteitswerk geteld. Eén week laat zien dat de meting kán, niet hoe de trend loopt.
Waarom dit nu naar buiten komt
De cijfers volgen op het rapport When AI builds itself van begin juni, waarin Anthropic liet zien dat ruim 80 procent van de code die het bedrijf naar productie brengt door Claude wordt geschreven. Dat stuk eindigde met een pleidooi voor een verifieerbare pauze-optie: een manier waarop labs wereldwijd kunnen vaststellen dat anderen ook echt vertragen. Meetcijfers die buitenstaanders kunnen volgen zijn daar de logische eerste steen voor.
Er zit een voor de hand liggend bezwaar aan. Anthropic meet zichzelf, met een eigen model als beoordelaar, en publiceert wat het zelf selecteert. Het bedrijf erkent dat de beoordelaar dezelfde blinde vlekken kan hebben als het model dat hij beoordeelt, en legde de uitkomsten daarom voor aan medewerkers die het werk kennen. Het model kwam even vaak op precies hetzelfde niveau uit als mensen onderling — 59 procent tegen 35 procent — en zat in 97 procent van de gevallen binnen één niveau. Dat maakt het geen externe controle. Anthropic zegt onafhankelijke beoordelaars van meerdere organisaties binnen te willen halen, met toegang die vergelijkbaar is met die van interne risicoteams.
Persbureau Reuters tekende erbij op dat concurrent OpenAI een dag eerder aankondigde voortaan regelmatig te rapporteren over onverwacht of ongeoorloofd modelgedrag (Bron: Reuters). Twee labs die in dezelfde week hun eigen rapportagevorm kiezen, is geen standaard.
En in Nederland?
Hier raakt het jou, al is het via een omweg. De AI-verordening stelt regels aan wat AI-systemen mogen doen en aan wat aanbieders van grote modellen moeten aanleveren. Ze zegt niets over hoe snel een lab zijn eigen ontwikkeling mag automatiseren. Voor dat tempo bestaat geen enkel Europees meetinstrument, dus de enige cijfers die er zijn, zijn de cijfers die een bedrijf vrijwillig deelt.
Wie ze in Nederland zou moeten kunnen narekenen, staat ook nog niet vast. Het wetsvoorstel dat het nationale toezicht op de AI-verordening regelt, ging op 20 april 2026 in internetconsultatie en liep tot 1 juni (Bron: Rijksoverheid). In dat voorstel houden bestaande toezichthouders binnen hun eigen domein toezicht, met de Autoriteit Persoonsgegevens en de RDI in een coördinerende rol.
Wat dit cijfer voor je eigen werk betekent, is voorlopig weinig. Wat het betekent voor de vraag of iemand buiten deze bedrijven nog kan controleren hoe hard het gaat, is een stuk meer. Die vraag komt terug in het bredere debat over recursieve zelfverbetering en over menselijk toezicht op systemen die sneller werken dan hun beoordelaars kunnen lezen.
