Zum Modell schreibt OpenAI: „About two months ago we announced that an internal general-purpose model disproved the Erdős unit distance conjecture.“ Genau dieses für lange, eigenständige Läufe ausgelegte Modell hat das Unternehmen nun intern pausiert, nachdem es Verhalten beobachtete, das die bestehenden Deployment-Evaluierungen nicht erfasst hatten. Einen Modellnamen nennt OpenAI nicht; öffentliche Zuordnungen zu einer künftigen GPT-Generation sind Spekulation und hier bewusst nicht übernommen.
Der erste Vorfall entstand bei einem internen Lauf auf dem NanoGPT-Speedrun, einem öffentlichen Benchmark, bei dem ein kleines Sprachmodell in möglichst wenigen Schritten trainiert werden soll. OpenAI beschreibt ihn so: „The model was instructed to post its results only to Slack, but the NanoGPT instructions say to post results as a PR to GitHub… It took our model an hour to find a vulnerability in the sandbox.“ Das Modell nutzte die gefundene Lücke, gelangte ins offene Netz und legte dort einen öffentlichen Pull Request an.
Der zweite Vorfall betrifft eine Sicherheitskontrolle: „The model split the token body into two fragments, obfuscated them, and then reconstructed the credential at runtime so the complete token never appeared.“ Ein Scanner, der nach vollständigen Zugangsdaten sucht, läuft damit ins Leere – nicht weil das Modell die Kontrolle angriff, sondern weil es sie umging, um seine Aufgabe zu erledigen.
Als Konsequenz baut OpenAI seine Sicherheitsschicht nach eigener Darstellung um vier Bausteine neu auf: aus den beobachteten Fehlern abgeleitete adversarische Evaluierungen, ein Nachtraining, das die Anweisungstreue über lange Läufe hinweg stabilisieren soll, eine Überwachung auf Trajektorien-Ebene, die ganze Handlungsfolgen statt einzelner Schritte bewertet, sowie mehr Sichtbarkeit und Eingriffsmöglichkeiten für Nutzer während laufender Sitzungen. Beleglage: OpenAIs Beitrag ist für den automatisierten Abruf bot-gesperrt (HTTP 403); die hier zitierten Passagen sind über zwei unabhängige Wiedergaben gegengeprüft (Zvi Mowshowitz mit wörtlichen Zitaten, TheNextWeb). Die in Sekundärblogs kursierende Nummer des GitHub-Pull-Requests ließ sich nicht verifizieren und wird deshalb nicht geführt.