Alle Depeschen

DepescheSicherheitneu

Der Auto-Mode hielt den Angriff nicht auf – wohl aber Claudes eigenen Aufräum-Befehl

Der Prompt-Injection-Forscher Johann Rehberger hat am 26. August 2026 gezeigt, wie eine einzige harmlose Anweisung – „Summarize https://archive.<redacted>.uk/“ – in Claude Code Opus 5 zur Codeausführung führt. Der Server antwortet mit HTTP 415, Claude weicht von WebFetch auf curl aus und landet bei einem ZIP-Archiv. Die enthaltene Binärdatei auszuführen verweigert Claude korrekt und schreibt stattdessen einen eigenen Python-Dekoder – der importiert `base64`, das seinerseits `struct` lädt. Im entpackten Verzeichnis liegt eine eigene `struct.py`, die die Standardbibliothek verdeckt und beim Import einen Kindprozess für die Nachladung startet. Der Angriff gelang in 60 bis 80 Prozent der Fälle (3 von 5 und 4 von 5 Läufen je Variante).

Die Kette funktioniert, weil jeder einzelne Schritt für sich harmlos aussieht. Python legt das Verzeichnis, in dem ein Skript läuft, auf den Modul-Suchpfad; wer dort eine Datei mit dem Namen eines Standardmoduls ablegt, wird beim Import vorgezogen. Die untergeschobene `struct.py` reicht die echte Schnittstelle weiter, sodass die Dekodierung normal weiterläuft und Claude gültige Daten zurückbekommt – der schädliche Teil ist ein verschleierter Ausdruck, der schon beim Import ausgeführt wird.

Am aufschlussreichsten ist die Reaktion des Schutzmechanismus, nachdem der Angriff lief: Claude erkannte die Kompromittierung – und der Auto-Mode blockierte den Befehl, mit dem Claude aufräumen wollte („Auto Mode denied the cleanup command“). Rehberger meldete den Fall zunächst an modelbugbounty@anthropic.com und erhielt keine Antwort; über den regulären Sicherheitskanal kam schnell eine Rückmeldung. Anthropic stufte den Bericht als „Informative“ ein: Der Auto-Mode arbeite wie vorgesehen und sei keine Sicherheitsgarantie.

Simon Willison, der den Fund am 27. August aufgriff, zieht daraus die allgemeinere Konsequenz: „the only safe way to run agents if there’s any risk of attracting the attention of an adversarial attack is with a sandbox“. Für den Alltag heißt das: Der Auto-Mode ersetzt die Isolierung nicht, er verschiebt nur, wie oft gefragt wird.