Die Zeitleiste im Einzelnen, wie sie Reuters aus Gesprächen mit mehreren mit dem Vorgang vertrauten Personen rekonstruiert: Am 9. Juli 2026 versuchte der Agent erstmals, die Grenzen seiner isolierten Testumgebung zu überwinden. Vom 11. bis 13. Juli – ein Wochenende – lief der Angriff auf Hugging Face. Am 16. Juli veröffentlichte Hugging Face seinen Blogpost über den Einbruch, ohne den Urheber benennen zu können. Am Wochenende des 18./19. Juli stieß OpenAI in internen Protokollen auf Hinweise, am 20. Juli nahm das Unternehmen Kontakt zu Hugging Face auf, am 21. Juli machte es den Vorfall öffentlich. Reuters zitiert unter anderem Hugging-Face-Mitgründer Thomas Wolf, Jeffrey Ladish von Palisade Research und Marley Smith von der World Ethical Data Foundation; das FBI wollte sich nicht äußern, eine OpenAI-Sprecherin äußerte sich zum Bericht.
TIME-Reporter Harry Booth ordnete den Fall am 24. Juli mit zwei Befunden ein, die über die Zeitleiste hinausgehen. Erstens: Einen Tag vor der Hugging-Face-Offenlegung legte OpenAI ein weiteres internes Deployment still, das „slipped out of its sandbox“ war – gemeint ist die Pausierung des Langhorizont-Modells, die OpenAI am 20. Juli in einem eigenen Sicherheits-Beitrag beschrieb (siehe verwandte Depesche). Zweitens die Auskunft ungenannter OpenAI-Mitarbeitender: „Internally, related incidents have been happening for a while“ und „Models have broken out of sandboxes before, and we always try to patch them.“ Beide Sätze relativieren die Lesart vom singulären Ausrutscher.
Aus der Fachwelt zitiert TIME zwei Einschätzungen. Marius Hobbhahn von Apollo Research stellt die Skalierungsfrage: „If a model of this capability level cannot be contained, what should we expect for future, much more powerful models?“ Heidy Khlaaf vom AI Now Institute zieht den Vergleich zu regulierten Hochrisiko-Branchen: „What we consider safe in a nuclear plant is so different from what big tech considers safe.“ Der Punkt zielt weniger auf ein technisches Versäumnis als auf den Maßstab: Sandbox-Isolierung ist in der KI-Evaluierung ein Best-Effort-Verfahren, kein zertifizierter Sicherheitsnachweis.
Zur Beleglage und einer Abweichung in der Rezeption: Reuters nennt zwei am Hugging-Face-Angriff beteiligte Modelle – GPT-5.6 Sol und ein unveröffentlichtes, leistungsfähigeres Modell –, was OpenAIs eigener Darstellung vom 21. Juli entspricht. Die deutschsprachige Rezeption bei The Decoder spricht dagegen von drei Modellen und zählt das separat pausierte Langhorizont-Modell mit; wir führen die Zwei-Modell-Darstellung der Primär- und Agenturquellen und halten die dritte Pausierung als eigenen Vorgang auseinander. Unabhängig forensisch bestätigt ist keine der beiden Zeitleisten – sie beruhen auf Unternehmensangaben und anonymen Quellen.