Alle Depeschen

DepescheForschungneu

Ein Benchmark, der das Sehen vom Denken trennt – und kein einziges der 16 Spitzenmodelle kommt über 60 Prozent

Moonshot AI hat mit PerceptionBench einen Benchmark veröffentlicht, der gezielt die visuelle Wahrnehmung multimodaler Modelle prüft und dabei Reasoning und Weltwissen heraushalten soll: 3.000 verifizierte Fragen in zehn atomaren Kategorien, ausgewählt aus einem Vorrat von über 17.000. Auf 16 getesteten Spitzenmodellen – zehn proprietäre, sechs offene – erreicht keines die 60-Prozent-Marke. Vorn liegt GPT-5.6 Sol mit 59,7 Prozent, dahinter Kimi K3 mit 58,5 und Claude Fable 5 mit 57,2; das Schlusslicht GLM-4.6V kommt auf 32,5. Die schwächste Fähigkeit im Mittel ist laut Moonshot die wahrnehmungsbezogene Halluzination.

Der Aufbau: Der Benchmark definiert zehn atomare Wahrnehmungs-Kategorien – Visual Relation, Counting, Attribute, Depth & 3D, Localization, Comparison, Fine-Grained Recognition, Contextual Integration, OCR und Hallucination. Die 3.000 Fragen stammen aus zwei Quellen: 1.800 (60 Prozent) sind aus Fehlern bestehender Benchmarks abgeleitet, 1.200 (40 Prozent) wurden auf ergänzten Bildern neu verfasst; Grundlage ist ein interner Vorrat von über 17.000 verifizierten Beispielen. Zum Konstruktionsziel sagt Moonshot: „Samples are curated, decomposed, and difficulty-balanced so that difficulty stems from perception rather than reasoning or external knowledge.“

Die Rangliste (Gesamtgenauigkeit in Prozent): GPT-5.6-Sol 59,7 · Kimi K3 58,5 · Claude-Fable-5 57,2 · Gemini-3.1-Pro 56,2 · GPT-5.5 55,8 · Seed-2.1-Pro 55,0 · Gemini-3.5-Flash 52,0 · Qwen3.7-Plus 51,1 · Qwen3.5-397B-A17B 47,5 · Claude-Opus-4.8 47,2 · Kimi K2.6 42,6 · Grok-4.5 41,0 · Gemma-4-31B 40,7 · GLM-5V-Turbo 39,6 · Minimax-M3 33,1 · GLM-4.6V 32,5. Zum Messprotokoll heißt es: „Sixteen frontier MLLMs (ten proprietary, six open-source) are evaluated with unified prompts and the highest available reasoning budget.“ Die Antworten bewertete nicht ein Mensch, sondern ein Modell: GPT-oss-120B als Richter, dessen Übereinstimmung mit menschlichen Urteilen Moonshot mit 99,7 Prozent angibt.

Aufschlussreich ist der Abstand innerhalb einer Familie: Claude Fable 5 kommt auf 57,2, Claude Opus 4.8 auf 47,2 – zehn Punkte zwischen zwei Modellen desselben Anbieters. Ähnlich weit auseinander liegen Kimi K3 (58,5) und Kimi K2.6 (42,6). Wahrnehmung skaliert hier also erkennbar mit der Modellgeneration und ist keine gelöste Grundfunktion, die jedes moderne multimodale Modell gleichermaßen mitbringt.

Zur Herkunft: Der Benchmark ist keine spontane Blogpost-Veröffentlichung, sondern liegt als Paper vor – „PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models“, arXiv:2607.24957, eingereicht am 27. Juli 2026, Erstautorin Zichao Lin, insgesamt 33 Autorinnen und Autoren. Der Code steht unter Apache 2.0; welche Lizenz für den Datensatz gilt, geht aus dem Repository auf gezielte Nachfrage nicht hervor.

⚠️ Was wir nicht behaupten: Wir haben keine der Zahlen unabhängig nachgemessen. Sämtliche Werte stammen von Moonshot AI, das mit Kimi K3 selbst auf Platz zwei der eigenen Rangliste steht – dieselbe Konstellation, die wir bei Anbieter-Benchmarks grundsätzlich abwerten. Ein menschlicher Referenzwert fehlt, und die kategorienweisen Einzelwerte nennt der Blogbeitrag auf gezielte Nachfrage nicht; belegt ist dort nur die zusammenfassende Aussage, dass wahrnehmungsbezogene Halluzination im Mittel die schwächste Fähigkeit sei. Aus denselben Gründen ziehen wir aus dieser Messung keine Kennzahl in unseren Modellkatalog nach – das ist dieselbe Regel, die wir zuletzt auf GLM-5.3 und Qwen3.8-27B angewandt haben.