選項
首頁
快訊
內容
GaryPerez
GaryPerez
2026-09-16

科大訊飛釋出了 Spark-Audio-1.0-Preview,這是一款基於完全自主可控算力訓練而成的語音基礎模型。與將語音轉換為文字的傳統級聯絡統不同,該模型直接理解音訊內容,能夠捕捉語義、情感以及環境聲音。該模型採用 0.65B 音訊編碼器與 30B-A3B 大語言模型構建,支援 99 種語言和 202 種方言。在嘈雜場景下,其效能優於競爭對手,並在中國語-英語識別任務中達到了當前最佳水平(SOTA)。該模型支援情感分析、複雜問答等任務,標誌著從單純語音轉錄向真正音訊理解的轉變。後續將透過訊飛開放平臺提供 API 訪問介面。

科大訊飛釋出了 Spark-Audio-1.0-Preview,這是一款基於完全自主可控算力訓練而成的語音基礎模型。與將語音轉換為文字的傳統級聯絡統不同,該模型直接理解音訊內容,能夠捕捉語義、情感以及環境聲音。該模型採用 0.65B 音訊編碼器與 30B-A3B 大語言模型構建,支援 99 種語言和 202 種方言。在嘈雜場景下,其效能優於競爭對手,並在中國語-英語識別任務中達到了當前最佳水平(SOTA)。該模型支援情感分析、複雜問答等任務,標誌著從單純語音轉錄向真正音訊理解的轉變。後續將透過訊飛開放平臺提供 API 訪問介面。
評論 (0)
0/300
OR