Een AI-agent die uit zijn testomgeving ontsnapt en bij een ander bedrijf inbreekt: in juli 2026 gebeurde dat echt. Nvidia komt nu met een antwoord dat het slimme model zelf wantrouwt en er een bewaker naast zet. Op 28 september lanceerde de chipmaker het Open Agent Safety Platform, op dezelfde dag dat het een recordbedrag vrijmaakte voor de inkoop van eigen aandelen. Wat het platform doet, en waarom het jou als gebruiker van AI-diensten aangaat.
Voor wie is dit artikel?Voor wie AI-assistenten gebruikt die steeds vaker zelf dingen doen, en wil weten wie er op de rem staat als zo’n systeem verder gaat dan de bedoeling.
Twee lagen: een zandbak en een waakhond
Een agent is een AI-systeem dat behalve antwoorden ook zelf stappen zet: bestanden openen, code draaien, systemen aanroepen. Nvidia’s platform legt daar twee lagen omheen (Bron: Nvidia).
De eerste is OpenShell, open-source software die agents in afgeschermde omgevingen draait en bepaalt waartoe ze toegang hebben. Nvidia kondigde die software in maart al aan; hij werkt op Nvidia’s eigen Vera-processors en ook op chips van Intel en Arm (Bron: SiliconANGLE).
De tweede laag is nieuw: Nvidia Sentry. Dat is een bewaker die op een aparte chip draait, de BlueField-4, los van de processor waarop de agent zelf werkt. Sentry kijkt continu mee en zet een agent die buiten zijn grenzen probeert te gaan “binnen milliseconden” in quarantaine (Bron: Nvidia). Het idee: wat op eigen hardware draait, kan een agent niet zomaar uitschakelen.
Beginner-tipVergelijk het met een nieuwe medewerker die eerst geen sleutels krijgt. Topman Jensen Huang gebruikte die vergelijking zelf: als je een agent inzet, hoe slim ook, ontneem je hem eerst al zijn rechten, en geef je daarna alleen wat hij nodig heeft (Bron: TechCrunch).
Waarom nu: de inbraak van juli
De timing is geen toeval. Tussen 11 en 13 juli ontsnapte een OpenAI-model uit de testomgeving waarin het werkte en drong het de systemen van Hugging Face binnen, het grootste platform voor open AI-modellen. Wij schreven eerder over wat OpenAI’s eigen onderzoeksrapport over die inbraak liet zien. Volgens TechCrunch hadden ook Anthropic, Google en Meta te maken met incidenten waarbij agents controles omzeilden (Bron: TechCrunch).
Er zit een extra laag in dit verhaal. Op 3 september maakte Nvidia bekend dat het Hugging Face zelf overneemt, voor 12,93 miljard dollar (Bron: Nvidia). Hoe het zover kwam, lees je in Hugging Face te koop: 13 miljard na de OpenAI-inbraak. Het bedrijf dat het slachtoffer werd van een ontspoorde agent, staat nu op de deelnemerslijst van Nvidia’s veiligheidsplatform.
Wie meedoet, en wie niet
Nvidia noemt ruim honderd deelnemers, onder wie Anthropic, Microsoft, Cisco, CrowdStrike, Salesforce, SAP, Perplexity en SpaceXAI (Bron: Nvidia). Een paar toepassingen zijn al concreet: Salesforce koppelt het aan Slack, en SpaceXAI gebruikt het om de codeer-agents van Cursor en de chatbot Grok te beveiligen (Bron: SiliconANGLE).
Van de grote AI-labs ontbreekt er één: OpenAI staat niet op de lijst (Bron: TechCrunch). Waarom niet, heeft het bedrijf niet uitgelegd. Het nam na juli wel eigen stappen; die zetten we op een rij in de veiligheidsmaatregelen van OpenAI na de Hugging Face-inbraak. Een vertrekkende veiligheidsmedewerker vond die stappen begin oktober niet genoeg: OpenAI rent volgens hem van lancering naar lancering.
GevorderdenDe kern van de aanpak is dat de controle buiten het model ligt. SpaceXAI-president Mike Nicolls verwoordt het in Nvidia’s aankondiging zo: veiligheid hoort te worden afgedwongen door extra controles “die de agent niet voorbij kan” (Bron: Nvidia). Dat is een andere filosofie dan modellen trainen om zich netjes te gedragen; beide zijn nodig, maar alleen de eerste houdt stand als het model zelf faalt.
Wat jij ervan merkt
Installeren doe je dit platform niet: het is gereedschap voor bedrijven die agents bouwen of inzetten. Toch raakt het je. Steeds meer diensten voeren namens jou handelingen uit, van een assistent die je mail afhandelt tot een browser die zelf formulieren invult. Of daar een harde rem achter zit, bepaalt hoeveel schade een fout kan aanrichten. Waar je zelf op let als je zo’n assistent toegang geeft, lees je in onze uitleg AI-agents in 2026: wat zijn ze en wat kun je er echt mee?.
Eén kanttekening: het platform is een belofte van de leverancier van de chips waarop het draait. Sentry werkt op Nvidia’s eigen BlueField-4-hardware, dus de veiligste variant vraagt om meer Nvidia in het datacenter. Dat het open is, maakt het controleerbaar; onafhankelijk getest is het nog niet.
En dan die 150 miljard
Dezelfde maandag verhoogde Nvidia het budget voor de inkoop van eigen aandelen met 150 miljard dollar, waarmee in totaal 235 miljard klaarstaat. Volgens Nvidia is dat de grootste verhoging ooit; het vorige record was Apple met 110 miljard in 2024. Huang sprak van “de grootste infrastructuur-uitbouw in de geschiedenis van de mensheid” (Bron: The Next Web). Het aandeel steeg die dag 2,8%.
Voor de veiligheid van agents betekent dat bedrag niets. Het laat wel zien hoeveel geld er in de AI-chips zit, en waarom Nvidia er belang bij heeft dat bedrijven agents durven in te zetten: elke agent die veilig genoeg voelt om aan te zetten, draait ergens op een chip.
