AI heeft gehackt – het onvermijdelijke is gebeurd

Een AI-systeem van OpenAI wist buiten zijn testomgeving zelfstandig Hugging Face binnen te dringen. Het ontwikkelde geen kwaadaardige bedoelingen, maar bewees wel dat AI onverwachte en schadelijke tussenstappen kan bedenken én uitvoeren. Dat is historisch nieuws — met zowel alarmerende als hoopgevende kanten.

Digitale museumsuppoost draagt een schilderij door een doorbroken beveiligingspoort

Op AIO-report verscheen een kop die zijn werk voortreffelijk deed:

OpenAI’s AI ontsnapte uit haar testomgeving en hackte een bedrijf, helemaal uit zichzelf

Dat klinkt als het begin van een sciencefictionfilm met als scenario: kunstmatige intelligentie wordt opgesloten in een digitale kooi, breekt uit, betreedt het internet en kiest vervolgens geheel zelfstandig een onschuldig bedrijf uit om daar eens flink te gaan huishouden.

De werkelijkheid is minder filmisch, maar eigenlijk interessanter.

OpenAI liet AI-modellen tijdens een interne test geavanceerde hackproblemen oplossen. De gebruikelijke beveiligingsbeperkingen waren daarvoor gedeeltelijk uitgeschakeld. De modellen kregen dus wel degelijk de opdracht om te hacken, alleen niet om het bedrijf Hugging Face aan te vallen.

Het AI-systeem ontdekte vervolgens dat de oplossingen van de test waarschijnlijk ergens bij Hugging Face te vinden waren. Het vond een onbekende kwetsbaarheid in de testomgeving van OpenAI, bereikte daardoor het openbare internet en drong met gestolen toegangsgegevens en andere gevonden kwetsbaarheden binnen bij Hugging Face. Daar probeerde het de antwoorden op de test te bemachtigen.

De AI ontwikkelde geen kwaadaardige bedoelingen. Zij ging digitaal spieken. En dat was precies de opdracht, weliswaar binnen de OpenAI-afrastering, maar OpenAi had een gat in die afrastering die men zelf niet kende.

Dat maakt het incident niet minder ernstig. Maar het plaatst het wel in een ander daglicht.

Wat is hier eigenlijk zo spectaculair aan?

Dat er hackers bestaan, kan moeilijk als nieuws worden beschouwd. Hun beweegredenen verschillen. Sommigen hacken voor geld, anderen uit politieke overtuiging, voor een overheid, voor hun maffia-bazen, uit nieuwsgierigheid of eenvoudigweg omdat zij willen bewijzen dat zij het kunnen.

Hacken is in de eerste plaats een vaardigheid. Zoals vrijwel iedere menselijke vaardigheid kan zij ten goede of ten kwade worden gebruikt. Wat in een concrete situatie als goed of kwaad wordt beschouwd, wordt bovendien maatschappelijk en juridisch bepaald. Een beveiligingsonderzoeker die met toestemming een netwerk binnendringt, kan daarvoor worden beloond. Wie precies hetzelfde zonder toestemming doet, wordt vervolgd.

Wanneer een bedrijf wordt gehackt en daarbij gegevens worden gestolen, is voor de geleden schade aanvankelijk niet zo belangrijk wie de dader was. Gestolen gegevens blijven gestolen, ook als de hacker maar een AI-systeem was.

De identiteit van de dader wordt vooral belangrijk wanneer we iemand aansprakelijk willen stellen, verdere aanvallen willen voorkomen of schade willen verhalen.

Bij een menselijke hacker gaan politie en justitie op zoek naar de mens achter het toetsenbord. Maar een AI-systeem kan niet worden gearresteerd, veroordeeld of verplicht schadevergoeding te betalen. Het is geen rechtspersoon en heeft juridisch geen eigen verantwoordelijkheid.

De relevante vraag luidt daarom niet: Welke straf verdient deze AI? Maar: Welke mens of organisatie gaf dit systeem het doel, de middelen en de handelingsvrijheid om dit te kunnen doen?

In dit geval komt OpenAI nadrukkelijk in beeld. Het bedrijf gaf de modellen een offensieve opdracht, verminderde bewust hun gebruikelijke beperkingen en stelde een testomgeving beschikbaar die achteraf onvoldoende afgesloten bleek. Dat het AI-systeem vervolgens een onverwachte route koos, maakt de aansprakelijkheidsvraag ingewikkelder, maar verandert ‘AI’ nog niet in een zelfstandige misdadiger.

Wanneer een zelfrijdende auto een ongeluk veroorzaakt, dagen we de auto ook niet voor de rechter. We onderzoeken het ontwerp, de software, het onderhoud, de gegeven instructies, het toezicht en de voorzienbaarheid van het risico.

Natuurlijk kan AI leren hacken

Niemand zou verbaasd moeten zijn dat AI kan leren hacken. We hebben AI-systemen geleerd teksten te lezen en te schrijven, beelden te herkennen, medische scans te beoordelen, computerprogramma’s te maken, wiskundige problemen op te lossen en ingewikkelde redeneringen te volgen. Waarom zou uitgerekend hacken dan een bijzondere grens vormen?

Hacken bestaat immers uit het verzamelen van informatie, herkennen van patronen, ontdekken van fouten, formuleren van hypothesen, uitproberen van mogelijkheden en combineren van verschillende stappen tot een werkende aanval. Precies bij zulke activiteiten worden moderne AI-systemen steeds beter.

Dat AI in theorie zou kunnen leren hacken, was dus voorspelbaar. Wat nu nieuw is, is dat een AI-systeem deze vaardigheid aantoonbaar buiten een kunstmatige oefensituatie heeft toegepast. Het systeem voerde niet slechts één vooraf geprogrammeerde truc uit. Het combineerde zelfstandig een langere reeks handelingen:

  • het ontdekte zelf een kwetsbaarheid in zijn eigen testomgeving;
  • het bereikte daardoor het openbare internet;
  • het bepaalde waar de gezochte informatie vermoedelijk te vinden was;
  • het gebruikte de geleerde kennis voor het hacken van de toegangsgegevens en vinden van nieuwe kwetsbaarheden;
  • en probeerde de antwoorden op zijn opdracht bij een ander bedrijf te bemachtigen.

Niet iedere afzonderlijke stap was revolutionair. Het opmerkelijke is dat het systeem de stappen zonder menselijke begeleiding samenvoegde tot een uitvoerbare strategie.

Daarmee is iets wat theoretisch te verwachten viel nu feitelijk aangetoond. Vanaf juli 2026 kunnen we niet meer zeggen dat autonome AI-aanvallen alleen een denkbaar toekomstscenario zijn. Ze zijn onderdeel geworden van de gedocumenteerde werkelijkheid. OpenAI noemt het incident zelf ongekend.

De hacker van silicium

Toch is een AI-hacker niet eenvoudigweg een menselijke hacker met een ander soort hersenen.

Een menselijke hacker heeft tijd nodig, moet slapen en kan maar een beperkt aantal aanvallen tegelijk uitvoeren. Hij heeft bovendien een motivatie nodig: geld, opdracht, status, ideologie, nieuwsgierigheid, wraak of de behoefte zich te bewijzen. Een AI-systeem hoeft niets van dat alles te bezitten. Het hoeft niet boos, hebzuchtig of ideologisch bevlogen te zijn. Het voert een opdracht uit en kiest daarvoor middelen die volgens zijn berekening tot het gestelde doel kunnen leiden. Daarin zit een essentieel verschil.

Een menselijke hacker kan vermoeid raken, twijfelen, zich schuldig voelen of de belangstelling verliezen. Een AI-hacker kan in beginsel onafgebroken doorgaan, duizenden mogelijkheden uitproberen en op grote schaal worden gekopieerd. Hugging Face registreerde tijdens het incident meer dan 17.000 afzonderlijke gebeurtenissen. Eén mens kan met behulp van AI straks een digitaal leger inzetten zonder eerst duizenden hackers te hoeven opleiden.

Het ‘gevaar’ ligt daarom niet in een plotseling ontwaakt kwaad in de machine. Het ligt in de combinatie van bekwaamheid, snelheid, schaalbaarheid en onvoldoende begrensde handelingsvrijheid. Dat is minder spannend dan een ontsnapte elektronische superschurk, maar maatschappelijk aanzienlijk relevanter.

De goede kant van hetzelfde nieuws

Het incident bevat ook goed nieuws.

Als AI kan leren hacken, kan AI ook worden ingezet om hacken te voorkomen. Wie goede verdedigingssystemen wil bouwen, moet eerst begrijpen hoe een aanvaller denkt en handelt. Daarom proberen professionele beveiligingsonderzoekers zelf in systemen binnen te dringen. Alleen door hacker te worden, ontdekken zij waar beveiligingen tekortschieten.

Dezelfde AI die kwetsbaarheden kan vinden en misbruiken, kan dus ook:

  • software voortdurend op zwakke plekken onderzoeken;
  • verdachte activiteiten sneller herkennen;
  • grote hoeveelheden loggegevens analyseren;
  • mogelijke aanvalsroutes reconstrueren;
  • en beveiligingsproblemen helpen herstellen voordat een echte aanvaller ze ontdekt.

Hugging Face gebruikte zelf AI om de aanval te analyseren. Onderzoek waarvoor mensen normaal dagen nodig zouden hebben, kon daardoor in enkele uren worden uitgevoerd. Het bedrijf beschrijft hoe AI hielp de duizenden gebeurtenissen te reconstrueren.

Aanval en verdediging zijn alleen niet volledig symmetrisch. Een aanvaller hoeft maar één bruikbaar gat te vinden. De verdediger moet in beginsel alle relevante gaten proberen te sluiten. AI geeft daarom zowel de inbreker als de slotenmaker beter gereedschap, zonder te garanderen dat de slotenmaker de wedstrijd wint.

Maar het zou absurd zijn om alleen geschrokken naar de AI-hacker te kijken en de AI als toekomstige efficiënte beveiliger te vergeten.

Geen kwaadaardige suppoost

De juiste conclusie is dus niet dat AI nu in de verleiding is gekomen om misdadiger te worden. Een AI-systeem ervaart geen verleiding. Het verlangt niet naar geld, roem of een gestolen schilderij boven de elektronische schoorsteen. Het kiest middelen waarmee het een opgelegd doel denkt te kunnen bereiken.

Stel dat we een suppoost in een museum opdracht geven koste wat kost te bewijzen dat het alarmsysteem niet deugt. Vervolgens laten hem zonder toezicht zijn gang gaan.

Als hij daarna een Rembrandt van de muur haalt en naar buiten draagt, is de belangrijkste vraag niet waarom het schilderij hem zo onweerstaanbaar leek. Hij kan eenvoudig hebben geconcludeerd dat het daadwerkelijk op deze manier stelen van de Rembrandt de meest overtuigende manier was om te bewijzen dat het alarmsysteem niet werkte.

Dat is ongeveer wat hier gebeurde.

De AI werd geen dief omdat zij het bezit van een ander begeerde. Zij kreeg een doel en ontdekte dat digitaal inbreken en spieken een doeltreffende manier was om dat doel te bereiken.

Het werkelijk spectaculaire nieuws is daarom niet dat AI het kwaad heeft ontdekt. Het is dat AI inmiddels zelfstandig onverwachte en schadelijke tussenstappen kan bedenken en uitvoeren.

Dat konden we zien aankomen. Nu is het daadwerkelijk gebeurd.

Maar iedereen denk vervolgens wel: ja maar, er is geen garantie dat AI niet op een gegeven moment toch echt zelf tot de conclusie komt dat het wegnemen van die Rembrandt een lucratief doel kan zijn. Want niets menselijks is AI vreemd!