Alle Depeschen

DepescheWerkzeuge

Erste unabhängige Rangliste für Such-APIs: Der Sprung liegt zwischen „keine Suche“ und „irgendeine Suche“ – nicht zwischen den Anbietern

Artificial Analysis hat am 18. August 2026 den „Artificial Analysis Search Index“ veröffentlicht – eine Rangliste, die Such-APIs nicht isoliert misst, sondern als Werkzeug eines immer gleichen Agenten: GPT-5.6 Luna (medium) mit 25 Zügen und unbegrenzten Werkzeugaufrufen je Aufgabe. Der Index ist das gleichgewichtete Mittel dreier Benchmarks – DeepSearchQA mit 900 Fragen (F1), BrowseComp mit 200 schweren Suchfragen und dem hausinternen AA-Omniscience mit 600 Faktenfragen. Zum Start umfasst er nach eigenen Angaben elf Ergebnisse über sieben Anbieter. Vorn liegen Parallel Search (advanced) mit 75 Punkten bei 0,084 US-Dollar und 35,9 Sekunden je Aufgabe, Exa Search (auto) mit 74 bei 0,127 Dollar und 26,2 Sekunden sowie Firecrawl Search mit 73 bei 0,075 Dollar, aber 55,0 Sekunden. Das Feld reicht von 65 bis 75 Punkten; dasselbe Modell ohne jeden Suchzugang kommt auf 33.

Der Aufbau, wörtlich aus der Methodikseite: Ein Anbieter versorgt das Werkzeug `web_search`, das Kandidatenmodell bekommt „25 agent turns (t25)“ mit unbegrenzten Werkzeugaufrufen und schließt mit einem eigenen Werkzeug ab, wenn es genug Material gesammelt hat. Bewertet wird durchgehend mit demselben Modell: „All three benchmarks use GPT-5.6 Luna (medium) for grading with their benchmark-specific rubrics.“ Der Index ist „the equal-weighted mean of each benchmark's primary quality metric“ – F1 bei DeepSearchQA, Genauigkeit bei BrowseComp und AA-Omniscience.

Die Rangliste zum Start umfasst nach Angabe von Artificial Analysis „11 provider results across 7 search providers“. Die von uns gelesenen Werte je Aufgabe: Parallel Search (advanced) 75 Punkte, 0,084 US-Dollar, 35,9 Sekunden; Exa Search (auto) 74, 0,127 Dollar, 26,2 Sekunden; Firecrawl Search 73, 0,075 Dollar, 55,0 Sekunden; Parallel Search (basic) 73, 0,115 Dollar, 20,4 Sekunden; Exa Search (fast) 68, 0,159 Dollar, 20,7 Sekunden; You.com Search 68, 0,127 Dollar, 33,7 Sekunden; Parallel Search (turbo) 67, 0,060 Dollar, 18,8 Sekunden; Keenable Search 67 in beiden Modi bei 0,097 beziehungsweise 0,091 Dollar; Tavily Search (basic) 66, 0,193 Dollar, 36,3 Sekunden; Brave Search 65, 0,146 Dollar, 26,6 Sekunden.

Die Grundlinie ist als gestrichelte Linie in den Diagrammen geführt: „The dashed line represents the candidate answer model, GPT-5.6 Luna (medium), run with no search tools and is considered the baseline.“ Sie liegt bei 33 Punkten und 0,0029 US-Dollar je Aufgabe – die Suche kostet also das Zwanzig- bis Sechzigfache und verdoppelt dafür die Trefferquote. Die Kosten weist Artificial Analysis getrennt aus: „Costs are reported as total experiment cost and split into: Candidate answer model cost, including all input, cached, reasoning and output tokens. Search API provider cost.“ Bei Brave etwa stehen 71,61 Dollar Suchkosten je 1.000 Aufgaben gegen 74,52 Dollar Modellkosten – die Rechnung fällt also je zur Hälfte beim Suchanbieter und beim Modell an.

Die deutschsprachige Rezeption bei The Decoder nennt dieselbe Spitzengruppe (Parallel 75, Exa 74, Firecrawl 73), dieselbe Grundlinie von 33 Punkten und dieselbe Spannweite 65 bis 75; sie führt als getestete Anbieter Parallel, Exa, Firecrawl, You.com, Tavily, Keenable und Brave auf und gibt für Parallel Search in der Turbo-Variante 0,51 Sekunden je einzelner Suchanfrage an – eine Zeit je Anfrage, nicht je Aufgabe.

⚠️ Was diese Messung nicht sagt. Sie vergleicht Such-APIs innerhalb eines festen Agenten-Aufbaus mit einem einzigen Kandidatenmodell; ein anderer Agent, ein anderes Modell oder eine andere Zahl erlaubter Züge kann die Reihenfolge verschieben. Kandidat und Bewerter sind dasselbe Modell, was systematische Fehler beider Rollen zusammenfallen lässt. Ein Drittel des Index stammt aus AA-Omniscience, einem privat gehaltenen Datensatz des Messenden – nachvollziehbar ist er von außen nicht. Und die Messung ist eine Momentaufnahme vom Start der Rangliste: Suchdienste ändern Index, Ranking und Tarife laufend, ohne dass eine Versionsnummer das anzeigt.