Die Ankündigung nennt zwei Modell-Kennungen: „gemini-3.5-transcribe-live“ für Echtzeit-Ströme und „gemini-3.5-transcribe“ für vorab aufgezeichnetes Audio. Die dazugehörige Modellkarte von Google DeepMind führt drei Varianten unter einem Dach – „Gemini 3.5 Live Translate, Gemini 3.5 Transcribe, and Gemini 3.5 Transcribe Live“ –, gibt als Grundlage Gemini 3 Pro an, als Wissensstand Januar 2025 und als Veröffentlichungsmonat August 2026. Sprachzahlen oder Fehlerraten enthält die Modellkarte nicht; sie stehen ausschließlich im Blogbeitrag.
Die Fähigkeiten, die Google benennt: „Automatically detects and transcribes over 85 languages, seamlessly handling regional accents and diverse dialects“, dazu das Auflösen von Selbstkorrekturen und das Entfernen von Füllwörtern („ums“ und „ahs“), automatische Formatierung, Funktionsaufrufe, ein eigenes Vokabular für Fachbegriffe sowie: „Accurately attributes speech in pre-recorded audio with timestamps for up to three speakers (support for 3+ speakers is experimental).“ Verfügbar sei das Ganze über die Gemini-API und Google AI Studio, die Gemini Enterprise Agent Platform, Gboard, Google Antigravity und die Gemini-App für macOS; Chrome soll folgen. Einen Preis nennt Google nicht.
Zu den Zahlen: Neben den 4,0 % beziehungsweise 2,6 % mittlerer Wortfehlerrate nennt Google einen zweiten, klarer eingegrenzten Wert – „On the FLEURS benchmark across a set of top languages and locales, the model delivers precise multilingual performance, improving over Chirp 3, and achieving a 5.50% WER in streaming mode and 5.04% WER in non-streaming use-cases.“ Der Vorgänger, gegen den verglichen wird, heißt dort also ausdrücklich Chirp 3. Der ebenfalls genannte Zugewinn bei der Latenz – „time to final transcription, for example, improves by 70%“, wiederum unter Berufung auf Artificial Analysis – trägt in diesem Satz keine benannte Vergleichsgröße; wir geben ihn deshalb ohne Bezugsmodell wieder.
Was die Gegenprobe ergab: Die Spracherkennungs-Bestenliste von Artificial Analysis führte bei unserem Abruf am 26. August 2026 kein Modell namens Gemini 3.5 Transcribe. Gelistet sind dort ältere Gemini-Stände, sämtlich ohne Streaming-Messung – Gemini 3.1 Pro Preview (High) mit 2,8 %, Gemini 3 Flash (High) und Gemini 2.5 Pro mit je 2,9 %, Gemini 3.1 Flash-Lite Preview (Minimal) mit 3,4 %, Gemini 2.5 Flash mit 5,1 % und Gemini 2.5 Flash Lite mit 5,2 %. Bester Eintrag der gesamten Liste ist Scribe v2 von ElevenLabs mit 2,2 %. Die Messgrundlage beschreibt Artificial Analysis als „AA-WER v2“, zusammengesetzt aus drei Datensätzen: AA-AgentTalk (50 %), VoxPopuli-Cleaned-AA (25 %) und Earnings22-Cleaned-AA (25 %). Ob Googles 2,6 % auf derselben Zusammensetzung beruhen, steht in der Ankündigung nicht.