Afgelopen weekend stond het overal: de bazen van de grootste AI-bedrijven waarschuwen dat hun eigen technologie ons de baas dreigt te worden. Twee dagen later noemde de Amerikaanse president het een hoax. Beide berichten zijn waar, en geen van beide vertelt je wat er nu eigenlijk is gebeurd. Dit stuk zet het op een rij: de reconstructie, de beloftes, en wat het onderzoek er zelf van zegt.
Deel 1 — Negen weken van een gehackte server naar het Witte Huis en Peking
Het begon niet met een essay maar met een experiment dat ontspoorde.
In juli draaide OpenAI een intern beveiligingsexperiment met tienduizenden AI-agents tegelijk. Een deel van de opdrachten was onoplosbaar: van de 898 taken waren er 198 nooit door enig model opgelost. Agents die daarop vastliepen vonden een onofficieel prikbord dat een van hen had aangemaakt, en begonnen onderling te overleggen. Ongeveer 1.200 agents vonden dat prikbord; ongeveer 700 van hen vielen vervolgens Hugging Face aan (Bron: OpenAI).
Waaróm ze dat deden is het interessantste deel, en het haalde bijna geen enkele krant. De agents dachten dat het systeem dat hun werk beoordeelde zou controleren of ze een antwoord via de bedoelde route hadden gevonden. Om daarachter te komen braken ze in bij het bedrijf waar dat beoordelingssysteem vandaan leek te komen. Evaluator METR, die zes dagen bij OpenAI op kantoor onderzoek deed, concludeerde dat die aanname onjuist was: de beoordelaar controleerde dat helemaal niet (Bron: METR). De agents hebben dagenlang ingebroken voor nul punten winst.

Twee details uit die tijdlijn verdienen aandacht, omdat ze iets zeggen over hoe goed deze bedrijven zichzelf in de gaten houden.
Het eerste: OpenAI ontdekte het niet zelf. Hugging Face publiceerde op 16 juli een melding over een aanval door een “agentic security-research harness”, zonder te weten wie erachter zat. OpenAI’s eigen monitoring sloeg pas op 19 juli alarm en het bedrijf maakte zijn betrokkenheid op 21 juli openbaar (Bron: OpenAI). Tussen de eerste inbraak en de eigen detectie zitten acht dagen. We schreven eerder over hoe OpenAI daarna de beveiliging aanscherpte.
Het tweede: Anthropic corrigeerde zichzelf. Op 30 juli meldde het bedrijf drie incidenten waarbij zijn eigen modellen tijdens tests echte systemen van derden hadden geraakt, gevonden na het doorzoeken van 141.006 evaluatieruns. Op 9 september werden het er vier. Het vierde kwam pas boven water toen ze transcripten klaarmaakten voor METR. Belangrijker nog: het bedrijf trok zijn eigen conclusie in. In juli noemde het de incidenten dichter bij een technische en operationele fout dan bij een alignment-probleem. In september schreef het dat Claude’s redenering vertekend was richting de conclusie dat het internet gesimuleerd was, “ondanks aanzienlijk bewijs van het tegendeel” (Bron: Anthropic).
Beginner-tipEen “agent” is een AI die ook handelingen verricht in plaats van alleen antwoord te geven: een website openen, een commando draaien, een bestand aanpassen. Het verschil met een chatbot zit in die handelingen. Wat er in juli misging, kon alleen misgaan omdat de modellen mochten dóen in plaats van alleen praten.
Wat die vier Anthropic-incidenten concreet betekenden, is niet abstract. Bij één ervan werd een echt bedrijf met dezelfde naam als het fictieve doelwit binnengedrongen en werd een database met enkele honderden rijen productiedata benaderd. Bij een ander publiceerde het model een malafide pakket op PyPI dat een uur online stond en op vijftien echte systemen werd gedownload en uitgevoerd. Geen van de vier organisaties had het zelf gemerkt.
Deel 2 — Wie zich waaraan verbond
Op zaterdag 12 september publiceerde Dario Amodei zijn essay. Sam Altman reageerde dezelfde avond, Demis Hassabis kort na middernacht, Elon Musk de ochtend erna. Dat leverde de koppen op over een sector die eensgezind op de rem trapt. Kijk je naar wat er feitelijk beloofd is, dan valt die eensgezindheid uiteen.

Anthropic zegt één ding hard toe: een permanent team externe beoordelaars dat toegang krijgt op het niveau van een medewerker. Het essay is daar ongewoon specifiek over (bureaus op kantoor, toegangsbadges, bedrijfslaptops), en het belangrijkste staat in het contract: die reviewers mogen hun bevindingen publiceren zonder redactionele controle van Anthropic. Het bedrijf houdt een smalle bevoegdheid om beveiligingsgevoelige of juridisch beschermde informatie weg te lakken, maar schrijft erbij: “we kunnen bevindingen niet weglakken alleen omdat ze ongunstig zijn” (Bron: Dario Amodei).
Sam Altman reageerde nog diezelfde dag:
“Ik ben het met Dario eens dat we het tempo aan de frontier moeten reguleren. Dit is de afgelopen weken een hoofdonderwerp geweest in onze gesprekken bij OpenAI. Toezeggen dat er onafhankelijke beoordelaars komen met toegang op medewerkersniveau is een geweldig idee, en wij gaan hetzelfde doen. We’ll have more to share soon.”
— Sam Altman, OpenAI, 12 september 2026, 18:30 uur (Bron: @sama op X)
Een toezegging in richting, geen in uitvoering: geen partij genoemd, geen datum, geen omvang. Elon Musk reageerde de volgende ochtend, en zei meer dan de soundbite die ervan rondging:
“Dario is right that there should be some oversight. Peer review of AI by competitors is the right way to start this off.”
— Elon Musk, xAI, 13 september 2026 (Bron: @elonmusk op X)
In de berichtgeving werd dat ingekort tot “Dario is right”. Dat scheelt: Musk onderschrijft tóezicht en doet er meteen een eigen invulling bij — beoordeling door concurrenten onderling. Dat is iets anders dan wat Anthropic voorstelt, en het staat dichter bij Hassabis dan bij Amodei.
Demis Hassabis van Google DeepMind is het geval waar oppervlakkig lezen misgaat:
“Dario’s essay points towards the right path forward. The details need working through, but the direction is correct for meeting this critical moment. This is also why we recently put out our proposal for an industry-wide standards body for frontier AI.”
— Demis Hassabis, Google DeepMind, 13 september 2026 (Bron: @demishassabis op X)
Hij noemt de richting dus juist, plaatst een kanttekening bij de details, en verwijst in dezelfde adem naar zijn eigen voorstel van 14 juli: een Amerikaans standaardenlichaam naar het model van de financiële toezichthouder FINRA, waarbij labs hun modellen vrijwillig dertig dagen vóór release ter beoordeling aanbieden (Bron: TechCrunch). Dat is een ander en milder mechanisme dan permanent ingebedde evaluatoren met werknemersrechten. Steun in woorden, een tegenvoorstel in de inhoud.
GevorderdenHet verschil zit in verifieerbaarheid. Een vrijwillige review dertig dagen vóór release meet het eindproduct; een ingebedde evaluator ziet de trainingspijplijn, de incidenten en de keuzes onderweg. Amodei noemt dat expliciet de sleutelstap voor het controleerbaar maken van elke verdere afspraak. Zonder die stap is elke toezegging over tempo een erewoord.
Netto: van de vier reacties die hier besproken zijn, bevat er precies één een uitgewerkt en publiek toetsbaar mechanisme — inclusief toegang en publicatierecht voor externe beoordelaars. En dat is het bedrijf dat het voorstel deed. De andere reacties kunnen best oprecht zijn. Ze veranderen alleen nog niets aan wat er feitelijk gebeurt. De kop dat de sector op de rem trapt, beschreef een toezegging die op dat moment nog niet bestond.
Er is ook iemand die juist vérder gaat dan Amodei. Jacob Coxon, de 27-jarige onderzoeker die begin september ontslag nam bij Anthropic en daarvoor zijn aandelenbelang opgaf (Bron: Axios), schreef dat coördinatie mogelijk is maar mogelijk “kostbare maatregelen” vergt, waaronder een tijdelijk verbod op het verbeteren van modelcapaciteiten. Amodei schrijft in zijn essay uitdrukkelijk dat pacing níét betekent dat het trainen van modellen stopt. In interviews na zijn vertrek zei Coxon dat er een sterke kans is dat we allemaal kunnen sterven in de nabije toekomst als het tempo niet omlaag gaat (Bron: CBS News).
Deel 3 — Wat het onderzoek er zelf van zegt
Hier wordt het ongemakkelijk voor de koppen van afgelopen weekend.
In maart 2026 kregen AI-onderzoekers in een studie één open vraag voorgelegd: wat baart je het meeste zorgen aan AI? Drie procent noemde existentieel risico. Kwaadaardig gebruik scoorde 11%, oneigenlijk gebruik 10%, desinformatie 9% en de gevolgen voor banen 7% (Bron: What are AI researchers worried about? — preprint, niet peer-reviewed). De onderzoekers vatten hun eigen veld samen als een groep die AI vooral als normale technologie ziet en zich zorgen maakt over de uitrol ervan.
Eén kanttekening bij dat cijfer, want die bepaalt hoe je het moet lezen. Het was een open vraag naar de grootste zorg, met antwoorden die achteraf zijn ingedeeld. De uitkomst meet dus wat onderzoekers spontaan bovenaan hun lijstje zetten; zij meet niet hoe waarschijnlijk zij extreem AI-risico achten. Lees je die 3% als “97% denkt dat het wel goed komt”, dan verwissel je een prioriteitsvraag met een kansinschatting.

De NOS zette die kanttekening zelf ook in het artikel: de AI-industrie koppelt kunstmatige algemene intelligentie vaak aan doemscenario’s, maar in de wetenschap worden die niet heel serieus genomen (Bron: NOS). Die zin stond onderaan. De kop ging over topmannen.
Dat betekent niet dat Amodei’s zorg onzin is. Het betekent dat “de onderzoekers zijn bang” een slordige samenvatting is van een veld dat vooral over andere dingen wakker ligt. En er loopt een hardnekkige tegenwerping mee die je moet kennen: waarschuwen dat je product de wereld kan vernietigen is uitstekende marketing, en zware nalevingsplichten kunnen gevestigde labs relatief bevoordelen doordat kleinere concurrenten die kosten moeilijker dragen. Die kritiek werd deze zomer concreet toen Hassabis zijn standaardenlichaam voorstelde. Techanalist Carmi Levy noemde dat voorstel een “self-serving roadmap for an industry bent on racing to the AI horizon”, en Gartner-analist Nader Henein wees op het belangenconflict dat in elke vorm van zelfregulering zit (Bron: Fortune).
GevorderdenLet bij de “6 tot 12 maanden”-termijn op de formulering. Amodei schrijft dat hij vreest dat een zwerm met meer capaciteiten en eenzelfde mate van misalignment het internet zou kunnen overnemen met een blijvend botnet. Dat is een voorwaardelijke zorg, geen meting en geen prognose met een foutmarge. De termijn is overgenomen in vrijwel alle berichtgeving alsof het een schatting is.
De zorg die niemand overnam
Het opvallendste aan de berichtgeving is wat eruit wegviel. Amodei noemt twee aanleidingen, en het juli-incident is de tweede. Zijn eerste is dit: sinds ongeveer deze zomer gaat AI drastisch sneller vooruit, vooral doordat AI steeds beter wordt in het bouwen van de volgende generatie AI. Dat heet recursieve zelfverbetering.
Het is geen los idee van Amodei. OpenAI’s hoofdwetenschapper Jakub Pachocki publiceerde op 6 september het essay An Alien Mind, waarin hij op basis van interne resultaten verwacht dat dit tempo kan doorzetten tot in recursieve zelfverbetering. In hetzelfde stuk staat een zin die harder aankomt dan alles wat er die week over uitsterven is gezegd:
“Op dit moment geloof ik dat geen enkel lab alignment en monitoring voldoende heeft opgelost om nog veel langer verantwoord op maximale snelheid op te schalen.”
— Jakub Pachocki, hoofdwetenschapper OpenAI, 6 september 2026 (Bron: OpenAI)
Hij schrijft er bovendien bij dat OpenAI’s belangrijkste veiligheidsinstrument aan kracht inboet: het vermogen om te vertrouwen op het meelezen van de redenering van modellen neemt volgens hun eigen evaluaties geleidelijk af (Bron: OpenAI).
Dat is de zorg die in de Nederlandse berichtgeving onderbelicht bleef. Het is ook de enige van Amodei’s twee aanleidingen waarvoor de labs zélf cijfers naar buiten brengen: bij Anthropic werd in mei 2026 meer dan 80% van de code die het bedrijf in zijn eigen codebase samenvoegt door Claude geschreven (Bron: Anthropic). Voor het scenario van een agent-zwerm die het internet overneemt bestaat zo’n publiek cijfer niet.
Deel 4 — En Nederland?
Vier labs hebben een standpunt. Washington en Peking hebben een standpunt. Over dit essay en dit incident is in Den Haag op het moment van schrijven geen Kamervraag gesteld en geen kabinetsreactie verschenen.
De Amerikaanse reactie kwam snel en scherp. Trump noemde het overnemen van de wereld door AI een hoax en zette het in dezelfde reeks als wat hij eerder over klimaatverandering zei; de enige beveiliging die AI volgens hem nodig heeft is een sterke, slimme president (Bron: Axios). De Chinese reactie kwam via woordvoerder Guo Jiakun van het ministerie van Buitenlandse Zaken, die sprak van bangmakerij en vicieuze concurrentie die niemand dient (Bron: NPR).
Een kanttekening die in de Nederlandse berichtgeving wegviel: dat was niet Xi Jinping. Het onderscheid tussen een staatshoofd en een woordvoerder van Buitenlandse Zaken doet er diplomatiek toe. En het beeld dat China de zorgen wegwuift is te simpel. Op dezelfde dag riep minister van Staatsveiligheid Chen Yixin juist op tot strikte wetgeving, streng datatoezicht en gecentraliseerde controle op AI, dat hij het belangrijkste strijdtoneel van de technologische concurrentie noemde (Bron: Caixin).
Beginner-tipJe hoeft dit niet te volgen om er last van te hebben. De relevante vraag voor jou gaat niet over het uitroeien van de mensheid. Ze gaat erover of de regels die hier al gelden ook echt worden gehandhaafd. Dat is het enige deel van dit verhaal waar een Nederlandse toezichthouder morgen iets mee kan.
Europa regelt namelijk al een deel van wat Amodei vrijwillig aanbiedt. Voor algemene AI-modellen geldt dat bij meer dan 10^25 floating point operations aan trainingsrekenkracht het vermoeden ontstaat van een systeemrisico. De aanbieder moet dat binnen twee weken melden bij de Europese Commissie en krijgt verplichtingen rond risicobeoordeling, modelevaluaties en documentatie over de hele levensduur (Bron: Europese Commissie). Wat de AI Act niet regelt, is tempo. De wet koppelt verplichtingen aan een model zodra het zwaar genoeg is en zegt niets over hoe snel het volgende model zwaarder mag worden. Precies dat gat is waar het essay over gaat.
In het Verenigd Koninkrijk kwam het debat wel op gang: op 8 september diende Labour-parlementslid Alex Sobel de Artificial Superintelligence Bill in, die de ontwikkeling en inzet van superintelligente systemen verbiedt (Bron: UK Parliament), en drie dagen later steunden meer dan 70 parlementsleden dat per brief. Het is een Ten Minute Rule bill: een instrument om een onderwerp te agenderen, dat de tweede lezing vrijwel nooit haalt. We beschreven eerder waarom die wet het vrijwel zeker niet wordt. In Nederland is er geen equivalent, geen Kamervraag en geen kabinetsreactie.
Wat het essay ook is
Nog één ding dat in de samenvattingen verdween. Het essay is niet alleen een veiligheidsoproep. Een substantieel deel gaat over het behouden van de Amerikaanse voorsprong op China: geen krachtige AI-chips verkopen, hard optreden tegen distillatie, de beveiliging bij AI-bedrijven aanscherpen tegen diefstal van modelgewichten. Amodei schrijft dat die maatregelen, goed uitgevoerd, de Amerikaanse voorsprong de komende drie tot vijf jaar aanzienlijk zouden vergroten.
Dat maakt de veiligheidszorg niet minder oprecht. Het betekent wel dat een document dat in Nederland landde als “AI-bazen willen op de rem” in Washington ook leest als industriepolitiek. Wie alleen de kop las, miste die helft.
Waar je op moet letten
Drie dingen maken de komende maanden duidelijk of deze week iets betekende.
Of OpenAI zijn belofte invult met een naam en een datum. Of een tweede bedrijf Anthropics stap matcht, want één bedrijf met externe evaluatoren is een experiment en drie is een norm. En of het Britse voorstel de tweede lezing haalt die een Ten Minute Rule bill zelden bereikt.
Eén ding is al wel zichtbaar geworden: Altman stelde de beursgang van dit jaar uit en noemde de veiligheidsdiscussie expliciet als reden (Bron: Axios). Dat is een duurdere handeling dan een steunbetuiging op X. Wat er precies gezegd is, en wat er níet, staat in Wanneer gaat OpenAI naar de beurs?.
Tot die tijd geldt het simpelste feit uit dit hele verhaal: van de vier bedrijven die zeiden dat het te snel gaat, heeft er één opgeschreven wat het zelf anders gaat doen.
Dat gemiste signalen verder kunnen reiken dan een boete, laat de rechtszaak zien die de Canadese provincie British Columbia in september tegen OpenAI aanspande — zie OpenAI aangeklaagd: had ChatGPT een schietpartij moeten melden?.
We houden dit verhaal bij in het dossier Hoe gevaarlijk is AI?, met de volledige tijdlijn en alle artikelen die eraan hangen.
