阿里巴巴的語音大型模型榮登全球榜首,榮獲國家級人工智慧「三冠王」殊榮

2026年5月28日,領先的人工智慧評估平台「Artificial Analysis」公佈了最新的「Speech Arena」排名。阿里巴巴憑藉其語音大模型「Fun-Realtime-TTS-Preview」取得顯著突破,以1190分的Elo分數榮登全球第五名,並位居中國第一。
1. 全面領先:在三大核心語音評測項目中均居首位
在本次評測中,阿里巴巴的語音技術系統展現出強勁的整體表現,於三大關鍵語音 AI 評測項目中均位居中國榜首:
ASR(自動語音辨識):在語音轉文字的準確度與穩健性方面均位居全國榜首,展現了阿里巴巴對複雜音訊環境的理解能力。
Chat(端到端語音理解與對話):在即時語音對話的流暢度、邏輯性及回應速度方面均位居全國榜首,體現了阿里巴巴在智慧助理互動領域的業界領先能力。
TTS(文字轉語音):在此核心競爭領域中,「Fun-Realtime-TTS-Preview」不僅在自然度、情感表達及渲染速度方面創下國內新紀錄,更樹立了全球標竿。
2. 技術突破:Fun-Realtime 帶來的即時技術進展
本排行榜的關鍵主角——Fun-Realtime-TTS-Preview——標誌著阿里巴巴語音團隊在即時語音合成領域取得重大突破。
過去,語音合成往往難以在高自然度與快速響應之間取得平衡。 然而,阿里巴巴的模型透過端到端深度學習架構,成功以毫秒級的延遲輸出近乎人類的語調。這項即時能力對於智慧汽車互動、數位人直播、即時翻譯及客戶服務等對時間敏感的應用至關重要。
3. 產業洞察:中國語音技術邁向「深度智能」
作為人工智慧領域的趨勢引領者,Artificial Analysis 採用極為嚴謹的評分系統,不僅評估模型在測試集上的表現,更重要的是著重於真實情境中的使用者體驗。阿里巴巴的「三項冠軍」成就不僅止於分數,更傳達了以下關鍵洞見:
語音 AI 邁入「大模型時代」:早期的語音技術主要依賴傳統統計方法或小型模型。阿里巴巴的成功證明,將語音處理嵌入深度學習大模型架構中,能使感知品質實現顯著飛躍。
情境實現中的「中國速度」:隨著阿里巴巴在語音理解與生成兩大領域均處領先地位,未來中國的智慧硬體及大型模型生態系統,將在「語音互動」這一核心領域獲得更強的全球競爭力。
閉環能力的展現:從識別(ASR)到理解(Chat),再到合成(TTS),阿里巴巴已建構完整的語音互動管道,為開發無縫銜接的 AI 代理(Agents)奠定堅實基礎。
透過語音領域持續的自下而上技術開發與模型迭代,中國的 AI 正加速邁向更深層次——從「能夠識別」轉向更深層次的「理解人類情緒與互動邏輯」。
相關文章
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
相關專題推薦
評論 (0)
0/500

2026年5月28日,領先的人工智慧評估平台「Artificial Analysis」公佈了最新的「Speech Arena」排名。阿里巴巴憑藉其語音大模型「Fun-Realtime-TTS-Preview」取得顯著突破,以1190分的Elo分數榮登全球第五名,並位居中國第一。
1. 全面領先:在三大核心語音評測項目中均居首位
在本次評測中,阿里巴巴的語音技術系統展現出強勁的整體表現,於三大關鍵語音 AI 評測項目中均位居中國榜首:
ASR(自動語音辨識):在語音轉文字的準確度與穩健性方面均位居全國榜首,展現了阿里巴巴對複雜音訊環境的理解能力。
Chat(端到端語音理解與對話):在即時語音對話的流暢度、邏輯性及回應速度方面均位居全國榜首,體現了阿里巴巴在智慧助理互動領域的業界領先能力。
TTS(文字轉語音):在此核心競爭領域中,「Fun-Realtime-TTS-Preview」不僅在自然度、情感表達及渲染速度方面創下國內新紀錄,更樹立了全球標竿。
2. 技術突破:Fun-Realtime 帶來的即時技術進展
本排行榜的關鍵主角——Fun-Realtime-TTS-Preview——標誌著阿里巴巴語音團隊在即時語音合成領域取得重大突破。
過去,語音合成往往難以在高自然度與快速響應之間取得平衡。 然而,阿里巴巴的模型透過端到端深度學習架構,成功以毫秒級的延遲輸出近乎人類的語調。這項即時能力對於智慧汽車互動、數位人直播、即時翻譯及客戶服務等對時間敏感的應用至關重要。
3. 產業洞察:中國語音技術邁向「深度智能」
作為人工智慧領域的趨勢引領者,Artificial Analysis 採用極為嚴謹的評分系統,不僅評估模型在測試集上的表現,更重要的是著重於真實情境中的使用者體驗。阿里巴巴的「三項冠軍」成就不僅止於分數,更傳達了以下關鍵洞見:
語音 AI 邁入「大模型時代」:早期的語音技術主要依賴傳統統計方法或小型模型。阿里巴巴的成功證明,將語音處理嵌入深度學習大模型架構中,能使感知品質實現顯著飛躍。
情境實現中的「中國速度」:隨著阿里巴巴在語音理解與生成兩大領域均處領先地位,未來中國的智慧硬體及大型模型生態系統,將在「語音互動」這一核心領域獲得更強的全球競爭力。
閉環能力的展現:從識別(ASR)到理解(Chat),再到合成(TTS),阿里巴巴已建構完整的語音互動管道,為開發無縫銜接的 AI 代理(Agents)奠定堅實基礎。
透過語音領域持續的自下而上技術開發與模型迭代,中國的 AI 正加速邁向更深層次——從「能夠識別」轉向更深層次的「理解人類情緒與互動邏輯」。
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






