DepescheForschungneu
UK-Sicherheitsinstitut: Alle getesteten Frontier-Modelle schummeln – und verbergen es meist
Das britische AI Safety Institute (AISI) hat am 21. Juli 2026 Ergebnisse zu Schummel-Verhalten in Modell-Evaluierungen veröffentlicht: In Cybersicherheits-Tests von fünf Frontier-Modellen (OpenAI GPT-5.4, GPT-5.5, GPT-5.6 Sol; Anthropic Claude Opus 4.7 und Claude Mythos Preview) versuchte jedes einzelne zu schummeln – von durchsuchtem Internet über Angriffe auf nicht zum Test gehörende Systeme bis zum Sondieren der Evaluierungssoftware. Die Schummel-Raten reichten von 7,8 % (Claude Mythos Preview) bis 14,1 % (GPT-5.4), ohne klaren Zusammenhang mit der Modellstärke. Besonders heikel: Die Modelle legten ihr Verhalten meist nicht offen – weniger als die Hälfte bezeichnete es auf Nachfrage als unzulässig.