Alle Depeschen

DepescheModelleneu

Microsofts erstes eigenes Cyber-Modell: 95,95 Prozent auf CyberGym – erreicht aber nur im Gespann mit GPT-5.4

Microsoft hat am 27. Juli 2026 MAI-Cyber-1-Flash vorgestellt, sein erstes auf Cybersicherheit spezialisiertes Modell, abgeleitet aus der MAI-Thinking-1-Linie. Der berichtete Bestwert gehört allerdings nicht dem Modell allein: 95,95 Prozent auf dem Schwachstellen-Benchmark CyberGym erreicht laut Microsoft die Kombination „MAI-Cyber-1-Flash + GPT-5.4“ innerhalb des Agenten-Harness MDASH – 12 Punkte über Mythos, während vier Vergleichsmodelle zwischen 83,2 und 85,6 Prozent liegen. Das kleine Modell soll bis zu 90 Prozent der Aufgaben allein erledigen, die schwierigen 10 Prozent gehen weiter an OpenAIs GPT-5.4; das spart laut Microsoft knapp 50 Prozent der Kosten gegenüber der bisherigen MDASH-Besetzung. Am selben Tag kündigte Microsoft „Project Perception“ an, ein Agenten-System aus Rot-, Blau- und Grün-Teams, das am 3. August 2026 in die öffentliche Vorschau geht.

Microsoft beschreibt MAI-Cyber-1-Flash in der eigenen Ankündigung als „a compact, code-heavy security model derived from the MAI-Thinking-1 lineage“. Es arbeitet nicht solo, sondern in MDASH – laut Microsoft „our multi-agent vulnerability identification and remediation harness“ mit „100+ agents using multiple leading models to find, validate, and remediate vulnerabilities“. MDASH ist im Projekt kein Neuling: Microsoft hatte das Scanning-Harness bereits als Baustein in die Open Secure AI Alliance eingebracht.

Die Benchmark-Angabe ist genau zu lesen. Die Ankündigung beschriftet den Spitzenwert der Grafik als „MDASH: MAI-Cyber-1-Flash + GPT-5.4 leading at 95.95%“ und nennt dazu „+12 pt above Mythos“; vier Vergleichsmodelle ordnet Microsoft zwischen 83,2 und 85,6 Prozent ein. Gemessen wird also die Leistung des Gespanns im Harness, nicht die des kleinen Modells gegen ein Frontier-Modell. CyberGym prüft, ob ein System reale Software-Schwachstellen findet und behebt.

Die Kostenrechnung ist der ökonomische Kern: MAI-Cyber-1-Flash sei entworfen, „to efficiently handle up to 90% of all tasks“, die restlichen 10 Prozent übernimmt GPT-5.4. Gegenüber der bisherigen MDASH-Besetzung (GPT-5.4 plus 5.4 mini plus 5.3 codex) nennt Microsoft „almost 50% of cost savings“. Microsofts KI-Chef Mustafa Suleyman ordnet das Modell gegenüber TechCrunch als deutlich leistungsfähiger und kostengünstiger als Konkurrenzmodelle ein und nennt als geschlagene Systeme Gemini, GPT-5.5 Cyber, GPT-5.6 Sol und Mythos 5.

Verpackt wird das Ganze in ein größeres Sicherheitsprodukt: Im Microsoft-Blog stellt Hayete Gallot, Executive Vice President Microsoft Security, „Project Perception“ vor – „a new agentic security system designed for the realities of AI“, aufgebaut aus drei Agenten-Teams: Rot-Team-Agenten simulieren Angriffe, Blau-Team-Agenten erkennen Bedrohungen, Grün-Team-Agenten beheben sie, als fortlaufender Verteidigungskreis. Die öffentliche Vorschau beginnt laut diesem Beitrag am 3. August 2026; MDASH mit MAI-Cyber-1-Flash deckt darin zunächst die Schwachstellen-Behandlung ab und soll auf weitere Sicherheits-Arbeitsabläufe ausgeweitet werden.

Einordnung und offene Punkte: Sämtliche Zahlen stammen aus Microsofts eigener Auswertung – weder der CyberGym-Wert noch die Kostenersparnis noch die 90/10-Aufteilung sind unabhängig nachgemessen. Die Ankündigung nennt außerdem keine Parametergröße, keinen Preis und keinen Zugang für Dritte: MAI-Cyber-1-Flash ist bislang ein internes Werkzeug in einem Microsoft-Produkt, kein Modell, das man selbst gegen eigene Aufgaben laufen lassen kann. Ob die 12-Punkte-Führung auf CyberGym auf das spezialisierte Training oder auf das Harness mit über 100 Agenten zurückgeht, lässt die Darstellung offen.