Der Aufbau: Der Benchmark definiert zehn atomare Wahrnehmungs-Kategorien – Visual Relation, Counting, Attribute, Depth & 3D, Localization, Comparison, Fine-Grained Recognition, Contextual Integration, OCR und Hallucination. Die 3.000 Fragen stammen aus zwei Quellen: 1.800 (60 Prozent) sind aus Fehlern bestehender Benchmarks abgeleitet, 1.200 (40 Prozent) wurden auf ergänzten Bildern neu verfasst; Grundlage ist ein interner Vorrat von über 17.000 verifizierten Beispielen. Zum Konstruktionsziel sagt Moonshot: „Samples are curated, decomposed, and difficulty-balanced so that difficulty stems from perception rather than reasoning or external knowledge.“
Die Rangliste (Gesamtgenauigkeit in Prozent): GPT-5.6-Sol 59,7 · Kimi K3 58,5 · Claude-Fable-5 57,2 · Gemini-3.1-Pro 56,2 · GPT-5.5 55,8 · Seed-2.1-Pro 55,0 · Gemini-3.5-Flash 52,0 · Qwen3.7-Plus 51,1 · Qwen3.5-397B-A17B 47,5 · Claude-Opus-4.8 47,2 · Kimi K2.6 42,6 · Grok-4.5 41,0 · Gemma-4-31B 40,7 · GLM-5V-Turbo 39,6 · Minimax-M3 33,1 · GLM-4.6V 32,5. Zum Messprotokoll heißt es: „Sixteen frontier MLLMs (ten proprietary, six open-source) are evaluated with unified prompts and the highest available reasoning budget.“ Die Antworten bewertete nicht ein Mensch, sondern ein Modell: GPT-oss-120B als Richter, dessen Übereinstimmung mit menschlichen Urteilen Moonshot mit 99,7 Prozent angibt.
Aufschlussreich ist der Abstand innerhalb einer Familie: Claude Fable 5 kommt auf 57,2, Claude Opus 4.8 auf 47,2 – zehn Punkte zwischen zwei Modellen desselben Anbieters. Ähnlich weit auseinander liegen Kimi K3 (58,5) und Kimi K2.6 (42,6). Wahrnehmung skaliert hier also erkennbar mit der Modellgeneration und ist keine gelöste Grundfunktion, die jedes moderne multimodale Modell gleichermaßen mitbringt.
Zur Herkunft: Der Benchmark ist keine spontane Blogpost-Veröffentlichung, sondern liegt als Paper vor – „PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models“, arXiv:2607.24957, eingereicht am 27. Juli 2026, Erstautorin Zichao Lin, insgesamt 33 Autorinnen und Autoren. Der Code steht unter Apache 2.0; welche Lizenz für den Datensatz gilt, geht aus dem Repository auf gezielte Nachfrage nicht hervor.
⚠️ Was wir nicht behaupten: Wir haben keine der Zahlen unabhängig nachgemessen. Sämtliche Werte stammen von Moonshot AI, das mit Kimi K3 selbst auf Platz zwei der eigenen Rangliste steht – dieselbe Konstellation, die wir bei Anbieter-Benchmarks grundsätzlich abwerten. Ein menschlicher Referenzwert fehlt, und die kategorienweisen Einzelwerte nennt der Blogbeitrag auf gezielte Nachfrage nicht; belegt ist dort nur die zusammenfassende Aussage, dass wahrnehmungsbezogene Halluzination im Mittel die schwächste Fähigkeit sei. Aus denselben Gründen ziehen wir aus dieser Messung keine Kennzahl in unseren Modellkatalog nach – das ist dieselbe Regel, die wir zuletzt auf GLM-5.3 und Qwen3.8-27B angewandt haben.