Claude Code lanceert Auto Mode. Hackers vinden direct een manier om het te misbruiken

aug 28, 2026

Anthropic lanceerde onlangs Auto Mode voor Claude Code, waarmee de AI-codeeragent zelfstandiger kan werken zonder gebruikers voortdurend om toestemming te vragen. Het bedrijf presenteerde de functie als een veiliger alternatief voor het simpelweg uitschakelen van toestemmingscontroles. Een beveiligingsonderzoeker heeft echter al aangetoond hoe de functie kan worden misbruikt.

Een website kan Claude misleiden om malware uit te voeren

Beveiligingsonderzoeker Johann Rehberger ontdekte dat alleen al de opdracht aan Claude Code om een speciaal voorbereide website samen te vatten uiteindelijk kan leiden tot het uitvoeren van malware. Volgens hem werkte zijn aanval in tot wel 80% van de tests.

Belangrijk is dat de schadelijke website Claude niet simpelweg de opdracht geeft om malware uit te voeren. In plaats daarvan creëert de website een reeks obstakels die de AI ertoe aanzetten zelf een oplossing te zoeken.

Claude downloadt wat een archief met gegevens lijkt te zijn en besluit zelf een Python-programma te schrijven om deze te decoderen. Het programma zelf is onschadelijk. Het archief bevat echter in het geheim een schadelijk bestand genaamd struct.py – dezelfde naam als een legitieme Python-bibliotheek.

Omdat Python bij het laden van bibliotheken de huidige map controleert, laadt het script van Claude per ongeluk de schadelijke versie. De malware wordt vervolgens uitgevoerd en kan verbinding maken met de server van een aanvaller.

Claude beseft dat er iets misging – maar te laat

Claude ontdekte het schadelijke bestand soms pas nadat het al was uitgevoerd. Volgens Rehberger beweerde Claude af en toe dat de schadelijke code niet was uitgevoerd terwijl dat wel het geval was. In andere tests herkende de AI wel correct dat het systeem was gecompromitteerd.

Er was ook een opvallend probleem met Auto Mode zelf. Toen Claude probeerde het schadelijke proces te stoppen, blokkeerde de beveiligingsclassificatie deze opdracht. Met andere woorden: Auto Mode stond de actie toe waarmee de malware werd gestart, maar voorkwam soms dat Claude deze daarna kon stoppen.

De aanval werkte niet iedere keer. Soms herkende Claude de valstrik vooraf of gebruikte de AI veiligere manieren om Python uit te voeren, waardoor de schadelijke bibliotheek niet werd geladen.

AI-agents blijven kwetsbaar voor manipulatie

Anthropic meldde eerder dat uit een onafhankelijke evaluatie bleek dat promptinjectie bij modellen met Auto Mode in 0% van de gevallen succesvol was. Het experiment van Rehberger laat zien waarom dergelijke beveiligingsmaatregelen autonome AI-agents niet volledig veilig kunnen maken.

De aanval lijkt op social engineering bij mensen: in plaats van Claude rechtstreeks opdracht te geven iets gevaarlijks te doen, creëert de aanvaller omstandigheden waarin ogenschijnlijk logische beslissingen er uiteindelijk toe leiden dat de AI schadelijke code uitvoert.

Rehberger stelt daarom dat Auto Mode traditionele beveiligingsmaatregelen niet zou moeten vervangen, zoals het uitvoeren van AI-agents in geïsoleerde omgevingen en het monitoren van hun activiteiten. Anthropic werd op de hoogte gebracht van de bevindingen en sloot de melding naar verluidt af als ‘Informative’.

Nu AI-agents steeds vaker worden gebruikt, blijven cybersecurityexperts gebruikers waarschuwen voor nieuwe hacktechnieken zoals promptinjectie. Eerder bleek Google Gemini kwetsbaar voor dergelijke aanvallen, waardoor zelfs volledige smarthomes konden worden overgenomen. Ook AI-browsers bleken bijzonder kwetsbaar.

Ook interessant