ElevenLabs 樹立新的語音轉文字基準;Google Gemini 緊隨其後,展現廣泛功能
Artificial Analysis 已發布其語音轉文字基準測試的最新版本——AA-WER v2.0。測試結果顯示,ElevenLabs 和 Google 在語音轉文字表現方面明顯領先。

以核心字元錯誤率(WER)為衡量標準時,ElevenLabs 的Scribe v2以驚人的2.3%低錯誤率奪得榜首。緊隨其後的是Google 的 Gemini3Pro,錯誤率為 2.9%。值得注意的是,Google 並未針對轉錄任務對 Gemini 進行微調;此結果純粹源自其強大的多模態通用能力。
其他領先模型的結果如下:
Mistral Voxtral Small:以3.0%的錯誤率位居第三。
Google Gemini3Flash:表現穩健,錯誤率為3.1%。
OpenAI Whisper Large v3:這款最廣泛使用的開源模型以4.2%的錯誤率位居中游。
表現最差者:阿里巴巴的Qwen3ASR Flash(5.9%)、亞馬遜的Nova2Omni(6.0%)以及Rev AI(6.1%)則位居排行榜末端。

在專為語音助理指令設計的AA-AgentTalk基準測試中,排行榜名次保持不變。ElevenLabs 的 Scribe v2 與 Google 的 Gemini3Pro 分別以1.6%和1.7%的錯誤率維持領先地位,證明了它們在簡短、直接的語音互動中極具可靠性。
相關文章
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
相關專題推薦
評論 (1)
0/500
Artificial Analysis 已發布其語音轉文字基準測試的最新版本——AA-WER v2.0。測試結果顯示,ElevenLabs 和 Google 在語音轉文字表現方面明顯領先。

以核心字元錯誤率(WER)為衡量標準時,ElevenLabs 的Scribe v2以驚人的2.3%低錯誤率奪得榜首。緊隨其後的是Google 的 Gemini3Pro,錯誤率為 2.9%。值得注意的是,Google 並未針對轉錄任務對 Gemini 進行微調;此結果純粹源自其強大的多模態通用能力。
其他領先模型的結果如下:
Mistral Voxtral Small:以3.0%的錯誤率位居第三。
Google Gemini3Flash:表現穩健,錯誤率為3.1%。
OpenAI Whisper Large v3:這款最廣泛使用的開源模型以4.2%的錯誤率位居中游。
表現最差者:阿里巴巴的Qwen3ASR Flash(5.9%)、亞馬遜的Nova2Omni(6.0%)以及Rev AI(6.1%)則位居排行榜末端。

在專為語音助理指令設計的AA-AgentTalk基準測試中,排行榜名次保持不變。ElevenLabs 的 Scribe v2 與 Google 的 Gemini3Pro 分別以1.6%和1.7%的錯誤率維持領先地位,證明了它們在簡短、直接的語音互動中極具可靠性。
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20





首頁






