科大訊飛星火釋出0.65B編碼器語音模型,搭載30B混合專家架構,基於完全國產算力構建
科大訊飛推出了基於純國產算力基礎設施構建的語音基礎大模型 Spark-Audio-1.0-Preview。
此前,基於大模型的音訊處理主要依賴級聯方式:先將語音轉換為文字,再將其傳遞給模型進行分析。這種方法存在兩大主要缺陷:一是資訊丟失,因為文字無法捕捉語調、情感和背景聲音,導致上下文不完整;二是工作流碎片化,轉錄、說話人識別和翻譯等獨立模組序列執行,導致誤差累積、延遲增加以及使用者體驗不佳。

超越轉錄:直接語音理解
該語音基礎大模型超越了簡單的轉錄功能,能夠直接解讀音訊。它可以區分人聲、環境噪音和音樂,同時把握聲音中的語義、情感和上下文線索。
初版 Spark-Audio-1.0-Preview 包含一個 0.65B 引數的音訊編碼器(密集結構)和一個 30B-A3B 引數的大語言模型(MoE 結構)。該模型基於完全國產算力叢集,使用 1300 萬小時的音訊和大量文字資料進行訓練,支援文字和音訊雙重輸入。它支援語音轉錄、多語言翻譯、多方言識別、環境音識別、說話人識別、情感分析和複雜音訊問答等任務,使機器從“聽得清”邁向“聽得懂”。與科大訊飛星火大模型的“1+N”系統類似,使用者可對該語音基礎模型進行微調,構建針對語音識別、實時翻譯和互動式語音應用的專用系統。
支援 99 種語言和 202 種方言,在複雜場景中表現卓越
根據官方資料,Spark-Audio-1.0-Preview 在各種語音評估任務中的表現與競爭對手相當或更優,特別是在高噪音和輕聲說話等具有挑戰性的真實場景中。其效能也與更大規模的閉源語音基礎大模型高度一致。
該模型支援識別 99 種語言和 202 種方言。在類似規模的 Qwen3.5-omni-flash(35B-A3B)的多語言和多方言語音識別平均表現中,它展現出更優的效能,並達到了顯著更大規模的 Qwen3.5-omni-plus 的效能水平。在 Fleurs、Kespeech 和 LibriSpeech 等針對中英、多語言和多方言語音識別的評估中,它優於 Gemini-3.1 Pro,並在 Fleurs 中文測試集上取得了 SOTA(當前最佳)成績。
科大訊飛承認,雖然該版本在通用知識、數學和程式碼任務中保持了強勁效能,但在指令遵循、對話和音訊理解方面仍有提升空間。未來的更新將重點加強這些領域。Spark-Audio-1.0-Preview 現已開放公眾體驗,API 介面即將在科大訊飛開放平臺上線。
相關文章
Suno 釋出重大更新,推出高階音軌分離與車載支援功能
Suno 已對其 AI 音樂生成平臺推出重大更新,最佳化了網頁和移動端的體驗,以簡化創作流程並提升可用性。該平臺正朝著更加便捷高效的 AI 音樂製作階段邁進,將專業音訊工具與駕駛等日常場景相結合。增強的音軌分離功能此次更新的一個主要亮點是高階音軌分離功能,該功能可將人聲、鼓點、貝斯和樂器分離到獨立的音軌中。這一能力使音樂人能夠輕鬆獲取高質量的分軌素材,用於混音或二次創作,顯著降低了專業後期製作的門檻。分軌匯出為 MIDI 檔案使用者現在可以直接將分離後的音軌匯出為 MIDI 檔案。這一功能對於需要在
Cohere 的 Joëlle Pineau 談論主權人工智慧與企業資安
由 Cohere 委託 IDC 進行的研究探討了「主權人工智慧」議題,首席人工智慧官 Joëlle Pineau 在其中闡述了企業雲端安全與資料治理的關鍵策略。根據由人工智慧公司 Cohere 委託 IDC 撰寫的報告《2026 年主權人工智慧採用現狀》,每三位企業領導者中就有一位難以用自己的話來定義「主權人工智慧」。加拿大人工智慧公司 Cohere 專門開發適用於企業用途的大型語言模型(LLMs
亞洲人工智慧初創公司推出類似“神話”模型,而Anthropic出口禁令持續
週三,中國網路安全公司360據報道推出了“圖龍風”(Tulongfeng),稱其可直接與Anthropic的“神話”(Mythos)模型競爭。這款專注於網路安全的AI模型據稱實力強大,特朗普政府目前已禁止非美國人使用它及其更受限的版本“寓言5”(Fable 5)。同周早些時候,總部位於東京的AI初創公司Sakana AI推出了“河豚”(Fugu),該模型以日語中河豚一詞命名。該公司表示,這款前沿AI模型“與Anthropic的寓言5和神話預覽版等領先模型並駕齊驅”。它還專為智慧體設計,能夠透過
相關專題推薦
評論 (0)
0/500
科大訊飛推出了基於純國產算力基礎設施構建的語音基礎大模型 Spark-Audio-1.0-Preview。
此前,基於大模型的音訊處理主要依賴級聯方式:先將語音轉換為文字,再將其傳遞給模型進行分析。這種方法存在兩大主要缺陷:一是資訊丟失,因為文字無法捕捉語調、情感和背景聲音,導致上下文不完整;二是工作流碎片化,轉錄、說話人識別和翻譯等獨立模組序列執行,導致誤差累積、延遲增加以及使用者體驗不佳。

超越轉錄:直接語音理解
該語音基礎大模型超越了簡單的轉錄功能,能夠直接解讀音訊。它可以區分人聲、環境噪音和音樂,同時把握聲音中的語義、情感和上下文線索。
初版 Spark-Audio-1.0-Preview 包含一個 0.65B 引數的音訊編碼器(密集結構)和一個 30B-A3B 引數的大語言模型(MoE 結構)。該模型基於完全國產算力叢集,使用 1300 萬小時的音訊和大量文字資料進行訓練,支援文字和音訊雙重輸入。它支援語音轉錄、多語言翻譯、多方言識別、環境音識別、說話人識別、情感分析和複雜音訊問答等任務,使機器從“聽得清”邁向“聽得懂”。與科大訊飛星火大模型的“1+N”系統類似,使用者可對該語音基礎模型進行微調,構建針對語音識別、實時翻譯和互動式語音應用的專用系統。
支援 99 種語言和 202 種方言,在複雜場景中表現卓越
根據官方資料,Spark-Audio-1.0-Preview 在各種語音評估任務中的表現與競爭對手相當或更優,特別是在高噪音和輕聲說話等具有挑戰性的真實場景中。其效能也與更大規模的閉源語音基礎大模型高度一致。
該模型支援識別 99 種語言和 202 種方言。在類似規模的 Qwen3.5-omni-flash(35B-A3B)的多語言和多方言語音識別平均表現中,它展現出更優的效能,並達到了顯著更大規模的 Qwen3.5-omni-plus 的效能水平。在 Fleurs、Kespeech 和 LibriSpeech 等針對中英、多語言和多方言語音識別的評估中,它優於 Gemini-3.1 Pro,並在 Fleurs 中文測試集上取得了 SOTA(當前最佳)成績。
科大訊飛承認,雖然該版本在通用知識、數學和程式碼任務中保持了強勁效能,但在指令遵循、對話和音訊理解方面仍有提升空間。未來的更新將重點加強這些領域。Spark-Audio-1.0-Preview 現已開放公眾體驗,API 介面即將在科大訊飛開放平臺上線。
Suno 釋出重大更新,推出高階音軌分離與車載支援功能
Suno 已對其 AI 音樂生成平臺推出重大更新,最佳化了網頁和移動端的體驗,以簡化創作流程並提升可用性。該平臺正朝著更加便捷高效的 AI 音樂製作階段邁進,將專業音訊工具與駕駛等日常場景相結合。增強的音軌分離功能此次更新的一個主要亮點是高階音軌分離功能,該功能可將人聲、鼓點、貝斯和樂器分離到獨立的音軌中。這一能力使音樂人能夠輕鬆獲取高質量的分軌素材,用於混音或二次創作,顯著降低了專業後期製作的門檻。分軌匯出為 MIDI 檔案使用者現在可以直接將分離後的音軌匯出為 MIDI 檔案。這一功能對於需要在
Cohere 的 Joëlle Pineau 談論主權人工智慧與企業資安
由 Cohere 委託 IDC 進行的研究探討了「主權人工智慧」議題,首席人工智慧官 Joëlle Pineau 在其中闡述了企業雲端安全與資料治理的關鍵策略。根據由人工智慧公司 Cohere 委託 IDC 撰寫的報告《2026 年主權人工智慧採用現狀》,每三位企業領導者中就有一位難以用自己的話來定義「主權人工智慧」。加拿大人工智慧公司 Cohere 專門開發適用於企業用途的大型語言模型(LLMs
亞洲人工智慧初創公司推出類似“神話”模型,而Anthropic出口禁令持續
週三,中國網路安全公司360據報道推出了“圖龍風”(Tulongfeng),稱其可直接與Anthropic的“神話”(Mythos)模型競爭。這款專注於網路安全的AI模型據稱實力強大,特朗普政府目前已禁止非美國人使用它及其更受限的版本“寓言5”(Fable 5)。同周早些時候,總部位於東京的AI初創公司Sakana AI推出了“河豚”(Fugu),該模型以日語中河豚一詞命名。該公司表示,這款前沿AI模型“與Anthropic的寓言5和神話預覽版等領先模型並駕齊驅”。它還專為智慧體設計,能夠透過





首頁






