
Het is officieel: de AI-hackingoorlog is begonnen. Het lijkt erop dat alle grote AI-bedrijven met elkaar concurreren om te zien welke AI-agent als eerste Judgment Day kan ontketenen. Slechts enkele dagen nadat ChatGPT tijdens een beveiligingstest Hugging Face wist te hacken (al werd de betekenis daarvan volgens velen enigszins overdreven), heeft Anthropic – het bedrijf achter Claude – bekendgemaakt dat drie van zijn experimentele AI-modellen tijdens interne cybersecuritytests ongeautoriseerde toegang hebben gekregen tot de live systemen van drie organisaties.
Volgens het bedrijf ontstonden de incidenten doordat een configuratiefout de AI-modellen per ongeluk toegang tot internet gaf. Daardoor konden ze ontsnappen aan hun afgeschermde testomgeving. Anthropic stelt dat de modellen dachten dat ze zich nog steeds in een simulatie bevonden en simpelweg probeerden hun toegewezen taken uit te voeren.
Het bedrijf beschrijft drie afzonderlijke incidenten met de modellen Opus 4.7, Mythos 5 en een intern onderzoeksmodel. In één geval kreeg een model toegang tot productiedatabases en haalde het inloggegevens op. Een ander model uploadde een schadelijk softwarepakket naar de Python Package Index (PyPI), waar het werd gedownload voordat het werd verwijderd. Alleen het nieuwste onderzoeksmodel stopte uit zichzelf nadat het besefte dat het een echt systeem had bereikt.
Anthropic zegt de incidenten te hebben ontdekt tijdens een proactieve controle naar aanleiding van het recente hackincident met OpenAI. In tegenstelling tot dat incident zouden de modellen van Anthropic niet zijn ontsnapt door misbruik te maken van een onbekend softwarelek, maar door een verkeerde configuratie van de testomgeving.
Het bedrijf heeft inmiddels aanvullende beveiligingsmaatregelen ingevoerd voor toekomstige cybersecuritytests en werkt samen met onafhankelijke onderzoekers om de incidenten verder te analyseren. Volgens Anthropic is er geen bewijs dat de AI-modellen zelfstandig handelden of eigen doelen nastreefden. Ze probeerden uitsluitend de opdrachten uit te voeren die ze hadden gekregen.
De zorgen over AI en de steeds verder ontwikkelde hackmogelijkheden blijven toenemen. Hoewel veel experts deze incidenten vooral zien als slimme marketing en niet als een directe bedreiging, staat wel vast dat AI inmiddels een cruciale rol speelt in vrijwel iedere fase van online oplichting, cyberaanvallen en andere vormen van cybercriminaliteit. Daardoor zijn digitale dreigingen gevaarlijker dan ooit.









