Heim
ElevenLabs setzt neue Maßstäbe bei der Sprach-zu-Text-Umwandlung; Google Gemini folgt mit umfassenden Funktionen
Artificial Analysis hat die neueste Version seines Sprach-zu-Text-Benchmarks, AA-WER v2.0, veröffentlicht. Die Ergebnisse zeigen, dass ElevenLabs und Google bei der Leistung der Audio-Transkription klar an der Spitze liegen.

Gemessen an der Kern-Wortfehlerrate (WER) erreichte ElevenLabs' Scribe v2 mit einer beeindruckend niedrigen Fehlerquote von 2,3 % den ersten Platz. Dicht dahinter lag Googles Gemini3Pro mit 2,9 %. Es ist erwähnenswert, dass Google Gemini nicht speziell für die Transkription optimiert hat; dieses Ergebnis beruht ausschließlich auf seinen robusten multimodalen allgemeinen Fähigkeiten.
Andere führende Modelle erzielten folgende Ergebnisse:
Mistral Voxtral Small: Belegte mit einer Fehlerquote von 3,0 % den dritten Platz.
Google Gemini3Flash: Zeigte mit einer Fehlerquote von 3,1 % eine solide Leistung.
OpenAI Whisper Large v3: Das am weitesten verbreitete Open-Source-Modell landete mit einer Fehlerquote von 4,2 % im Mittelfeld.
Die Schlusslichter: Alibabas Qwen3ASR Flash (5,9 %), Amazons Nova2Omni (6,0 %) und Rev AI (6,1 %) bildeten das Schlusslicht der Rangliste.

Im speziellen AA-AgentTalk-Benchmark für Sprachassistenzbefehle blieb die Rangliste unverändert. ElevenLabs’ Scribe v2 und Googles Gemini3Pro behielten mit Fehlerquoten von 1,6 % bzw. 1,7 % ihre Führung und erwiesen sich als äußerst zuverlässig bei kurzen, direkten Sprachinteraktionen.
Verwandter Artikel
Apple Smart Glasses könnten auf der WWDC27 vorgestellt werden und dabei den Schutz der Privatsphäre in den Mittelpunkt stellen
Bloombergs Mark Gurman berichtet, dass Apples Smart Glasses mit dem Codenamen N50 im Juni 2027 auf der WWDC27 vorgestellt werden sollen, wobei ein Verkaufsstart im Herbst 2027 erwartet wird. Ursprünglich für Ende dieses Jahres und Anfang 2027 geplant
Inside Details Exposed About Next-Gen Gemini: Strained Computing Power, Internal Teams Disagreed on Development Priorities and Resource Allocation
Berichten zufolge wurde der Start des hocherwarteten Next-Generation-Gemini-Modells von Google verschoben. Interne Uneinigkeiten über Entwicklungsprioritäten und Ressourcenallokation, kombiniert mit begrenzter Rechenkapazität und komplexen Genehmigun
OpenAI entkräftet Bedenken bezüglich des verlangsamen Wachstums und erklärt, dass mehrere Geschäftsbereiche ihre Expansion beschleunigen
Als Reaktion auf externe Kritik bezüglich des nachlassenden Umsatzwachstums und verpasster interner Zielvorgaben gab der KI-Pionier OpenAI am Dienstag, den 28. April, eine selbstbewusste Erklärung ab. Das Unternehmen präzisierte, dass seine Verbrauch
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Artificial Analysis hat die neueste Version seines Sprach-zu-Text-Benchmarks, AA-WER v2.0, veröffentlicht. Die Ergebnisse zeigen, dass ElevenLabs und Google bei der Leistung der Audio-Transkription klar an der Spitze liegen.

Gemessen an der Kern-Wortfehlerrate (WER) erreichte ElevenLabs' Scribe v2 mit einer beeindruckend niedrigen Fehlerquote von 2,3 % den ersten Platz. Dicht dahinter lag Googles Gemini3Pro mit 2,9 %. Es ist erwähnenswert, dass Google Gemini nicht speziell für die Transkription optimiert hat; dieses Ergebnis beruht ausschließlich auf seinen robusten multimodalen allgemeinen Fähigkeiten.
Andere führende Modelle erzielten folgende Ergebnisse:
Mistral Voxtral Small: Belegte mit einer Fehlerquote von 3,0 % den dritten Platz.
Google Gemini3Flash: Zeigte mit einer Fehlerquote von 3,1 % eine solide Leistung.
OpenAI Whisper Large v3: Das am weitesten verbreitete Open-Source-Modell landete mit einer Fehlerquote von 4,2 % im Mittelfeld.
Die Schlusslichter: Alibabas Qwen3ASR Flash (5,9 %), Amazons Nova2Omni (6,0 %) und Rev AI (6,1 %) bildeten das Schlusslicht der Rangliste.

Im speziellen AA-AgentTalk-Benchmark für Sprachassistenzbefehle blieb die Rangliste unverändert. ElevenLabs’ Scribe v2 und Googles Gemini3Pro behielten mit Fehlerquoten von 1,6 % bzw. 1,7 % ihre Führung und erwiesen sich als äußerst zuverlässig bei kurzen, direkten Sprachinteraktionen.
Apple Smart Glasses könnten auf der WWDC27 vorgestellt werden und dabei den Schutz der Privatsphäre in den Mittelpunkt stellen
Bloombergs Mark Gurman berichtet, dass Apples Smart Glasses mit dem Codenamen N50 im Juni 2027 auf der WWDC27 vorgestellt werden sollen, wobei ein Verkaufsstart im Herbst 2027 erwartet wird. Ursprünglich für Ende dieses Jahres und Anfang 2027 geplant
Inside Details Exposed About Next-Gen Gemini: Strained Computing Power, Internal Teams Disagreed on Development Priorities and Resource Allocation
Berichten zufolge wurde der Start des hocherwarteten Next-Generation-Gemini-Modells von Google verschoben. Interne Uneinigkeiten über Entwicklungsprioritäten und Ressourcenallokation, kombiniert mit begrenzter Rechenkapazität und komplexen Genehmigun
OpenAI entkräftet Bedenken bezüglich des verlangsamen Wachstums und erklärt, dass mehrere Geschäftsbereiche ihre Expansion beschleunigen
Als Reaktion auf externe Kritik bezüglich des nachlassenden Umsatzwachstums und verpasster interner Zielvorgaben gab der KI-Pionier OpenAI am Dienstag, den 28. April, eine selbstbewusste Erklärung ab. Das Unternehmen präzisierte, dass seine Verbrauch











