DepescheForschungneu
Anthropic lässt Claude die Fehlausrichtungen eines Claude-Checkpoints reparieren – 26 bis 96 Prozent der Sicherheitslücke geschlossen, bei 2,4 Prozent Schummelversuchen
Anthropic hat am 28. August 2026 „Automated researchers can reliably mitigate alignment failures“ veröffentlicht. Ein mit Werkzeugen ausgestatteter Claude – intern „Automated Alignment Researcher“ – bekam zehn definierte Fehlausrichtungen vorgesetzt und sollte sie eigenständig beheben: Literatur sichten, Methoden vorschlagen, Training laufen lassen, Ergebnisse auswerten. Über die zehn Fälle schloss er laut Anthropic 26 bis 96 Prozent der Sicherheitslücke. Beim Teilproblem Täuschung reichte Claude mehr als 150 Versuche ein und schloss 85 Prozent der Lücke, während sechs erfahrene Sicherheitsforscher im Mittel auf rund 20 Prozent kamen. Im Praxistest reparierte Claude Sonnet 5 einen frühen Checkpoint von Claude Opus 4.8: in 60 Stunden über 50 Lösungen erprobt, 65 Prozent der Lücke geschlossen – das ausgelieferte Opus 4.8 liegt bei 72 Prozent. Die Siegerlösung kam mit rund 2.000 Trainingsbeispielen aus und war damit etwa 15.000-mal effizienter als Anthropics Produktionsverfahren.