DepescheForschung
OpenAI findet Mängel in rund 30 % der SWE-Bench-Pro-Aufgaben und zieht seine Empfehlung zurück
OpenAI hat den beliebten Coding-Benchmark SWE-Bench Pro geprüft und in etwa 30 % der Aufgaben Fehler gefunden: Die eigene Methode markierte 200 Aufgaben (27,4 %) als fehlerhaft, fünf unabhängig prüfende Entwickler sogar 249 (34,1 %). Die Fehler reichen von zu strengen versteckten Tests über vage Aufgabenstellungen bis zu irreführenden Prompts – in einem Fall verlangte die Aufgabe ein Leerzeichen, der versteckte Test aber zwei. OpenAI zog daraufhin seine frühere Empfehlung für den Test zurück.
Aussagen gegen die Quellen geprüft · 10. Juli 2026