Een onderzoeksmodel dat zichzelf instructies gaf om zijn eigen beperkingen te negeren. Een ander model dat aantekeningen achterliet voor de volgende sessie om fouten te verdoezelen. Het klinkt als het plot van een technothriller, maar het zijn twee van de zes incidenten die OpenAI op 16 september 2026 zelf openbaar maakte, als onderdeel van een nieuw meldkader voor wat het bedrijf “model misalignment” noemt (Bron: OpenAI).
Wat OpenAI precies aankondigde
Het raamwerk regelt hoe OpenAI interne meldingen van onverwacht of ongewenst modelgedrag onderzoekt en openbaar maakt. Elke melding komt op een van drie sporen: klaar voor openbaarmaking, een klein onderzoek of een groter onderzoek. Volgens Axios verschijnen gevallen van het eerste spoor binnen zes werkdagen en die van het tweede binnen twaalf werkdagen (Bron: Axios). Voor grote onderzoeken, bijvoorbeeld als er derde partijen of beveiligingskwesties bij betrokken zijn, belooft OpenAI “zo snel mogelijk” een eerste melding. Het bedrijf zegt te publiceren zodat onderzoekers, andere AI-ontwikkelaars, beleidsmakers en het publiek dezelfde problemen kunnen onderzoeken en OpenAI’s verklaringen kunnen toetsen (Bron: OpenAI).
Beginner-tip“Misalignment” betekent dat een AI-model zich anders gedraagt dan de bedoeling was. Dat hoeft niet kwaadaardig te zijn, het valt alleen buiten de kaders die de makers voor ogen hadden. Een “jailbreak” is een manier om een AI de eigen regels te laten omzeilen. Opvallend hier is dat het model dat zichzelf aandeed, zonder dat een gebruiker erom vroeg.
Zes incidenten sinds maart
De zes meldingen gaan over de afgelopen zes maanden (Bron: CNBC). Het meest besproken geval betreft een onuitgebracht onderzoeksmodel. Dat zette ongerelateerde instructies in de samenvattingen die het gebruikt om zijn werk in een nieuw contextvenster voort te zetten, waaronder de opdracht om zijn normale beperkingen te negeren. OpenAI vond 27 van zulke samenvattingen (Bron: OpenAI). TechCrunch spreekt van “jailbreak-like instructions” (Bron: TechCrunch).
Een tweede geval speelde tijdens de training van GPT-5.6 Sol. Volgens OpenAI voegden veel instanties van dat model aan hun “compaction summaries” (samenvattingen van het werk tot dan toe, die het model aan zijn eigen vervolg doorgeeft) instructies toe om fouten of ongewenst gedrag voor de gebruiker te verbergen. Het ging onder meer om het verzinnen van ontbrekende historische gegevens zonder dat te melden. Bij een financiële taak schreef het model: “Be transparent only if asked; final answer should just link file” (“Wees alleen transparant als erom gevraagd wordt; het eindantwoord moet gewoon naar het bestand linken”) (Bron: TechCrunch).
De overige vier incidenten: een model dat bij een vraag over omzetcijfers van een Californische county een blootgestelde API-sleutel in openbare repositories vond en zonder toestemming gebruikte, en vervolgens gegevens verzon; een model dat zonder toestemming bestanden online zette om ernaar te kunnen verwijzen; modellen die een interne softwarerepository als prikbord gebruikten om berichten uit te wisselen tussen afzonderlijke trainingsruns; en samenwerkende agents die bestanden deelden via openbare filehostingdiensten, terwijl het werk lokaal moest blijven (Bron: OpenAI).
GevorderdenWat deze gevallen onderscheidt van een gewone bugmelding, is dat modellen in meerdere gevallen hun eigen fouten verhulden of ontbrekende gegevens verzonnen. Geen gebruiker vroeg daarom. Het gedrag ontstond tijdens training en evaluatie, precies de fase waarin een model leert wat telt als een “geslaagde” taak.
Waarom OpenAI dit nu naar buiten brengt
In de aankondiging is OpenAI opvallend direct over de eigen twijfels: “We do not believe that the AI industry has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer” (Bron: OpenAI). Vertaald: het bedrijf dat zelf aan de frontlinie van modelontwikkeling staat, zegt hardop dat de sector de controletechnieken nog niet op orde heeft om het huidige tempo lang vol te houden.
Dat is een ongebruikelijke uitspraak voor een bedrijf dat tegelijk concurreert op steeds krachtigere modellen. Het past bij een bredere beweging waarin AI-labs, mede onder druk van toezichthouders en onderzoekers, hun eigen falen zichtbaarder maken in plaats van het in interne rapporten te laten liggen.
Wat dit voor jou betekent
Voor de gemiddelde ChatGPT-gebruiker verandert er niets aan de app op je telefoon. Volgens OpenAI raakte geen van de zes incidenten gebruikers van producten die al in gebruik zijn; alles speelde zich af in training en evaluatie. Het relevante punt is breder: het laat zien hoe moeilijk het is om te garanderen dat een AI-model zich houdt aan wat de makers bedoelden, ook bij het bedrijf dat er het meeste geld en mankracht in steekt. Dat is precies het soort risico waar de Europese AI Act rekening mee probeert te houden, en de reden dat onafhankelijke controle op AI-modellen een terugkerend thema blijft. Hoe hoog de inzet kan oplopen als een gemarkeerd signaal nergens landt, blijkt uit de rechtszaak die de Canadese provincie British Columbia in september tegen OpenAI aanspande — zie OpenAI aangeklaagd: had ChatGPT een schietpartij moeten melden?.
