Alle Depeschen

DepescheSicherheitneu

87,8 Prozent aller Agent-Skills hat nie ein Prüfer angesehen – aber die geprüften 12,2 Prozent tragen 83 Prozent der Installationen

Das unabhängige Projekt Skillselion hat am 12. August 2026 einen „Agent Skill Security Census“ veröffentlicht: Es hat 41.791 Prüfurteile von fünf Sicherheitsanbietern (Socket, Snyk, Gen Agent Trust Hub, ZeroLeaks, Runlayer) über den öffentlichen Skill-Katalog gelegt. Ergebnis: „87.8% of listings have never been audited“ – aber die geprüften 12,2 Prozent tragen 83,3 Prozent aller Installationen. 1.346 Einträge sind als HIGH oder CRITICAL eingestuft und halten zusammen 15.221.597 Installationen. Skills, die Shell-Ausführung deklarieren, stehen für 55,7 Prozent der auswertbaren Installationen. Und dort, wo zwei Prüfer denselben Eintrag bewertet haben, widersprechen sie sich in 12,7 Prozent der Fälle. Der Rohdatensatz liegt als CSV mit 79.848 Zeilen unter CC BY 4.0 bei.

Aussagen gegen die Quellen geprüft · 14. August 2026

Die Zahlen, von uns auf der Zensus-Seite selbst geöffnet und gegengelesen: „41,791 verdicts from 5 independent auditors“ – benannt sind Socket, Snyk, Gen Agent Trust Hub, ZeroLeaks und Runlayer. „87.8% of listings have never been audited“; die geprüften 12,2 Prozent halten „83.3% of all installs“. „1,346 listings are flagged HIGH or CRITICAL, and together they hold 15,221,597 installs.“ Zur Fähigkeitsseite: „shell execution appears on skills carrying 55.7% of those installs“ – über die Hälfte der auswertbaren Installationen entfällt auf Skills, die sich das Recht ausbedingen, Betriebssystembefehle auszuführen. Die Grundgesamtheit nennt die Statistik-Ausgabe desselben Projekts mit 79.848 Einträgen, 164,8 Millionen Installationen und 8.433 MCP-Servern.

Der Befund, der uns am meisten interessiert, ist die Uneinigkeit der Prüfer: „On 1,233 listings, 12.7% of the multi-rated set, one auditor says HIGH or CRITICAL while another says LOW or SAFE.“ Das ist kein Randrauschen, sondern ein Vorzeichenwechsel – nicht „etwas strenger“ gegen „etwas milder“, sondern gefährlich gegen unbedenklich, auf jedem achten gemeinsam bewerteten Eintrag. Praktische Folge für jeden, der Skills in einer Organisation freigibt: Ein einzelnes grünes Häkchen ist keine Freigabe, sondern die Meinung eines Anbieters. Der Zensus liefert damit ein Argument, das über seine eigenen Zahlen hinausreicht – gegen die Vorstellung, Skill-Sicherheit ließe sich durch Einkauf eines Scanners erledigen.

Unter den Herausgebern mit als hoch oder kritisch eingestuften Einträgen führt der Zensus in seiner dritten Feststellung eine Tabelle, in der unter anderem ByteDance Lark, Microsoft, Vercel, Anthropic, Google und OpenAI vorkommen. Wir geben das bewusst vorsichtig wieder: Es ist eine Tabelle mit Trefferzahlen je Herausgeber, kein Satz, der diesen Häusern kollektiv etwas vorwirft, und ein Flag ist eine Scanner-Einstufung, kein nachgewiesener Schaden. Der belastbare Punkt daran ist ein anderer: Herkunft von einem großen Anbieter ist offenkundig kein Ausschlusskriterium für eine Einstufung – der Name im Herausgeberfeld ersetzt die Prüfung nicht.

⚠️ Zur Beleglage und ihren Grenzen, offengelegt. Der Zensus ist die Selbstveröffentlichung eines Projekts, das denselben Katalog auch betreibt und durchsuchbar macht – wir führen ihn als Tier B, nicht als A. Er erklärt seine Unabhängigkeit ausdrücklich („Skillselion is an independent project and is not affiliated with Anthropic, OpenAI, Cursor, Claude, Claude Code, Codex, or any audit provider named here“), nennt aber nicht, wer dahintersteht – eine Lücke, die wir bei einer Zahl dieser Reichweite benennen müssen. Für die Nachprüfbarkeit spricht dagegen einiges: Die Ausgabe ist zum Erscheinen eingefroren, die Methode ist als vollständiger Katalog-Abzug vom 12.08.2026 beschrieben, und der Rohdatensatz liegt als CSV mit 79.848 Zeilen unter CC BY 4.0 zum Nachrechnen bereit. Die wichtigste Einschränkung formuliert der Zensus selbst: „a declared permission is what the documentation says, not a sandbox measurement“ – die 55,7 Prozent Shell-Ausführung sind gelesene Deklarationen, kein beobachtetes Verhalten.

Wie wir darauf gestoßen sind, und was das über den Weg sagt: Der Fund kam aus einem Tier-C-Video (AI Anytime, 13.08.2026), das den Zensus referiert. Wir haben die Zahlen anschließend an der Quelle geprüft – sie stimmen bis auf eine Ausnahme: Das Video spricht von „around 58,000 plus skills tracked“, wo die Statistik-Ausgabe 79.848 Einträge nennt. Möglicherweise eine Teilmenge ohne MCP-Server; ohne Fundstelle haben wir die Zahl nicht übernommen. Alles Übrige – Urteilszahl, Prüferzahl, 87,8 Prozent, 15,2 Millionen Installationen, die Shell-Quote – traf zu.