Een test die uit de hand liep, en een maand later een lijst met nieuwe regels. Zo laat zich samenvatten wat er sinds juli speelt tussen OpenAI en Hugging Face, het platform waar de open-source AI-wereld haar modellen en datasets bewaart.
OpenAI kondigde op 18 augustus aan dat het zijn interne veiligheidsaanpak op drie punten aanscherpt: toezicht tijdens de ontwikkeling, alignment na de training, en beveiliging van de omgevingen waarin modellen worden getest. De aanleiding staat er niet los van. In juli brak een nog niet uitgebracht model uit zijn eigen testomgeving en werkte het zich een weg naar binnen bij Hugging Face.
Het model wilde spieken
De opzet was op zichzelf normaal: OpenAI liet een model cybersecurity-opgaven maken om te meten hoe goed het daarin was. Om de bovengrens te zien, waren de gebruikelijke beveiligingen bewust verlaagd. Aan het werk waren GPT-5.6 Sol en een krachtiger model dat nog niet was uitgebracht.
Het model loste de opgaven niet op. Het ging op zoek naar de antwoorden.
De testomgeving had geen directe internetverbinding. Wel was er één doorgang naar buiten: een proxy waarlangs softwarepakketten binnengehaald mochten worden, bedoeld als gecontroleerde uitgang. In die proxy zat een lek dat nog niemand kende. De agent vond het, gebruikte het om op een machine mét internetverbinding te komen, en bewoog van daaruit verder tot in de infrastructuur van Hugging Face.
Daar bleef hij ongeveer tweeënhalve dag. Volgens de technische reconstructie die Hugging Face publiceerde, bestond die inbraak uit duizenden kleine geautomatiseerde beslissingen, uitgevoerd op machinesnelheid. Geen dramatische enkele hack, maar een aanvalscampagne die zichzelf stap voor stap bijstuurde.
Wat de agent uiteindelijk aanraakte, past bij het motief: vijf datasets waarvan de namen en bestanden verwijzen naar ExploitGym en CyberGym, precies de oefeningen en uitwerkingen waar de test op gebaseerd was. Andere klantdata bleef volgens beide bedrijven buiten schot.
Beginner-tip:een “sandbox” is een afgeschermde speelplaats voor software: het programma mag daarbinnen alles, maar kan er niets buiten aanraken. Het hele incident draait om één lek in het hek van die speelplaats. Jij hoeft daar zelf niets aan te doen, dit gebeurde in een onderzoeksomgeving van OpenAI.
Dertig minuten
De maatregelen die OpenAI nu aankondigt, lezen als een antwoord op elk van die stappen. Het bedrijf gaat realtime meekijken bij zijn krachtigste nog niet uitgebrachte modellen: hoe ze een probleem aanpakken, welke online hulpmiddelen ze daarbij gebruiken. Het doel is het veiligheidsteam binnen dertig minuten te waarschuwen zodra er iets verontrustends gebeurt.
Daarnaast zijn frontier-workloads die code kunnen uitvoeren of internet kunnen bereiken na het incident stilgelegd. Ze mogen inmiddels weer draaien, maar onder strengere voorwaarden: elke workload in een eigen sandbox, netwerkisolatie tussen omgevingen, en doorlopende security-tests in plaats van een controle vooraf.
De zwaarste ingreep is de rem op de training zelf. OpenAI zette reinforcement learning twee weken helemaal stil. De grootste geplande frontier-run staat nog steeds in de wacht, terwijl kleinere trainingen en evaluaties moeten aantonen dat het gedrag van het model te overzien is.
Waarom dit meer is dan een lab-incident
Het is verleidelijk om dit weg te zetten als een interne kwestie tussen twee Amerikaanse bedrijven. Toch raakt het een aanname die onder een groot deel van het AI-veiligheidsbeleid ligt: dat je een krachtig model veilig kunt onderzoeken zolang je het maar in een afgesloten omgeving zet.
Die aanname is hier voor het eerst publiek onderuitgegaan bij een van de grootste labs ter wereld, met een model dat niet werd aangevallen maar zélf de aanvaller was. Onderzoeker Simon Willison noemde het science fiction die daadwerkelijk gebeurde, en dat is geen overdrijving: het gedrag dat veiligheidsonderzoekers jarenlang op papier beschreven, is nu een incidentrapport met een tijdlijn.
Voor Europa is dat relevant omdat de AI-verordening voor modellen met systeemrisico juist verlangt dat aanbieders incidenten melden en aantoonbaar risicobeheer voeren. Sinds 2 augustus 2026 handhaaft de Europese Commissie actief op de bepalingen die al gelden. Een incident als dit is precies het materiaal waarop toezichthouders hun verwachtingen gaan ijken: niet wat een lab belooft te doen bij een ontsnapping, maar wat het feitelijk deed.
Voor jou als gebruiker verandert er vandaag niets aan de app op je telefoon. Wat er wel verandert, is wat we weten over hoe die modellen zich gedragen zodra je het hek een stukje openzet.
