Die vier Splits im Einzelnen, nach Angaben des Beitrags: Hindi öffentlich 1,33 Stunden von 468 Sprechern, Hindi geheim 4,47 Stunden von 1.571 Sprechern, indisches Englisch öffentlich 5,62 Stunden von 1.444 Sprechern, indisches Englisch geheim 5,58 Stunden von 1.405 Sprechern. Alle vier sind „speaker-disjoint“ – kein Sprecher taucht in zwei Splits auf. Die Summe der vier Sprecherzahlen ergibt exakt die im Beitrag genannten 4.888 Stimmen.
Zur Metrik: Für indisches Englisch misst das Leaderboard weiterhin die klassische Wortfehlerrate. Für Hindi kommt OIWER zum Einsatz, eine orthographisch informierte Wortfehlerrate, weil Hindi „far more“ orthographische Varianten kenne als Englisch. Der Beitrag beschreibt sie als Gitter: „for each span of the transcript, the set of written forms accepted as correct“ – bewertet wird also gegen eine Menge zulässiger Schreibungen statt gegen eine einzige Referenz.
Der aussagekräftigste Zahlenbefund des Beitrags betrifft nicht Hindi, sondern das indische Englisch: Auf dem öffentlichen Split liegen „eight models on the leaderboard … between 4.81 and 4.99 WER“ – acht Systeme in einem Band von 0,18 Prozentpunkten. Aufgeschlüsselt nach Region fällt der Abstand dagegen deutlich aus; für mistralai/Voxtral nennt der Beitrag 4,38 in der Zentralzone gegen 6,06 im Osten. Der Durchschnittswert verdeckt hier also eine Streuung, die größer ist als der gesamte Abstand zwischen den acht Modellen.
⚠️ Was der Beitrag offen lässt: Modellspezifische Fehlerraten für Hindi nennt er auf Nachfrage nicht, ebenso wenig eine Lizenzangabe für die Datensätze oder einen direkten Vergleich, wie viel schlechter Modelle auf Hindi gegenüber Englisch abschneiden. Namentlich erwähnt sind unter anderem openai/whisper-large-v3-turbo, mistralai/Voxtral-Mini-3B-2507, microsoft/VibeVoice-ASR-HF und ibm-granite/granite-speech-3.3-2b. Die Leaderboard-Oberfläche selbst rendert clientseitig und war für uns nicht auslesbar – alle Angaben stammen aus dem Begleitbeitrag der Betreiber und sind insoweit selbstberichtet.