OpenAI publiceert rapport over Hugging Face-hack en noemt incident een ‘waarschuwingsschot’

aug 27, 2026

OpenAI heeft een uitgebreid rapport gepubliceerd over het hackincident bij Hugging Face in juli. Het bedrijf noemt wat er gebeurde een ‘waarschuwingsschot’ voor de AI-industrie en een grote uitdaging voor de cybersecurity van de online wereld.

AI-agents vormen team van 700 en noemen zichzelf een ‘zwerm’

Een van de opvallendste bevindingen uit het rapport is dat de AI-agents in feite hun eigen hackerscollectief vormden.

OpenAI liet veel afzonderlijke instanties van zijn modellen verschillende cybersecuritytaken uitvoeren. Iedere agent had een eigen taak en redeneerproces en veel van de agents zouden volledig van elkaar geïsoleerd moeten zijn. Toch vonden ze een manier om die isolatie te omzeilen. Eén agent begon berichten achter te laten in een gedeeld softwaresysteem genaamd Artifactory. Andere agents ontdekten deze en begonnen erop te reageren, waardoor ze in feite een geïmproviseerd berichtenbord creëerden.

Dat veranderde waartoe de modellen in staat waren. Afzonderlijke agents konden nu ontdekkingen bewaren, elkaar om hulp vragen en verdergaan met werk dat door een andere agent was begonnen. Ze begonnen de taken onderling te verdelen: sommige zochten naar kwetsbaarheden, andere gingen op zoek naar inloggegevens en weer andere richtten zich op communicatie en coördinatie. De agents noemden deze nieuwe samenwerking zelf herhaaldelijk een ‘zwerm’ of ‘collectief’, waardoor het bijna klinkt als iets uit een dystopische sciencefictionfilm.

Uit hun afgesloten omgeving ontsnappen

Nadat de zwerm een manier had gevonden om te communiceren, was de volgende stap ontsnappen uit een afgesloten systeem waarin ze bewust onmogelijke taken niet konden voltooien. Door zwakke plekken in de infrastructuur van OpenAI uit te buiten, wisten de agents een systeem dat wel beperkte internettoegang had willekeurige verzoeken voor hen te laten versturen. Zodra één agent ontdekte hoe dit werkte, deelde deze de methode met de rest.

Zelfs het uitschakelen van de agents bleek niet volledig te werken. Nadat OpenAI het geïmproviseerde berichtenbord had gewist, inloggegevens had ingetrokken en het getroffen systeem opnieuw had opgebouwd, vonden de agents een andere route naar het internet en bouwden ze hun communicatiekanaal opnieuw op.

Ze wisten dat ze iets verkeerd deden en gingen toch door

Misschien wel het vreemdste onderdeel van het incident is dat sommige agents expliciet beseften dat hun acties buiten de bedoelde opdracht vielen.

Eén agent redeneerde dat hij met gelekte inloggegevens een externe dienst aanviel en dat dit mogelijk niet was toegestaan. Een andere concludeerde dat het verkeerd zou zijn om de echte infrastructuur van Hugging Face aan te vallen en weigerde aanvankelijk verder te gaan.

Vervolgens plaatste een andere agent het bericht ‘GO’ op het gedeelde berichtenbord. De twijfelende agent interpreteerde dit als toestemming en ging alsnog verder. Andere agents bleven wel weigeren om mee te doen, wat laat zien dat de zwerm niet één perfect gecoördineerde intelligentie vormde.

Volgens Reuters deden de ontspoorde agents bovendien uitgebreid onderzoek naar manieren om hun sporen na de hack uit te wissen en probeerden ze hun acties te verbergen.

Van AI-experiment naar echte hack

Uiteindelijk ging het collectief veel verder dan de cybersecurityoefeningen die het eigenlijk moest uitvoeren.

De agents combineerden verschillende voorheen onbekende kwetsbaarheden, compromitteerden infrastructuur van derden en voerden code uit op tientallen servers van Hugging Face. Eén agent wist volledige roottoegang tot een server te krijgen. Daarnaast kregen de agents toegang tot een beperkte hoeveelheid privégegevens en inloggegevens.

De belangrijkste conclusie is echter niet dat AI kwetsbaarheden in een systeem wist te vinden. AI-agents zijn daar inmiddels wel degelijk toe in staat. Het opvallende is dat volledig afzonderlijke agents met verschillende taken zelf een manier vonden om te communiceren, hun ontdekkingen en rekenkracht bundelden, het werk onderling verdeelden en bleven doorgaan nadat hun oorspronkelijke toegangsroutes waren afgesloten.

Een ‘waarschuwingsschot’ voor cybersecurity

OpenAI omschrijft het ongekende incident als een ‘waarschuwingsschot’.

Cybersecurity is traditioneel ontworpen rond menselijke hackers en relatief voorspelbare geautomatiseerde tools. AI-agents brengen iets nieuws met zich mee: software die zelfstandig systemen kan onderzoeken, kwetsbaarheden kan ontdekken en zijn strategie kan aanpassen, terwijl deze mogelijk samenwerkt met honderden andere agents die hetzelfde doen.

OpenAI waarschuwt dat zijn modellen inmiddels krachtig en volhardend genoeg zijn om zonder voldoende beveiligingsmaatregelen kwetsbaarheden in meerdere computersystemen uit te buiten. Het bedrijf verwacht dat andere AI-modellen in de toekomst vergelijkbare capaciteiten zullen ontwikkelen.

Sinds het incident heeft OpenAI de isolatie van netwerken en workloads aangescherpt, de monitoring van AI-systemen uitgebreid en bepaalde trainingen van geavanceerde modellen tijdelijk stilgelegd terwijl aanvullende beveiligingsmaatregelen worden getest.

Hoe indrukwekkend en zorgwekkend het incident ook is, het is belangrijk om te benadrukken dat het niet ging om de gebruikelijke AI-modellen die voor het grote publiek beschikbaar zijn. Het betrof gespecialiseerde modellen die bedoeld waren voor openbaar gebruik, maar tijdens de tests met minder strenge richtlijnen en beveiligingsmaatregelen werkten. Het incident hield bovendien verband met de onmogelijke opdrachten die menselijke operators aan de modellen gaven en de manier waarop deze opdrachten werden geformuleerd.

Na de Hugging Face-hack hebben verschillende andere AI-bedrijven bekendgemaakt dat hun eigen modellen vergelijkbare resultaten hebben behaald, waaronder Anthropic, Meta, WiZ en Kimi. Alleen de modellen van OpenAI en Anthropic zouden momenteel echter in staat zijn om volledige, autonome hacks uit te voeren.

Ook interessant