Mistral 推出開源語音生成模型
法國人工智慧公司 Mistral 於週四推出一款全新的開源文字轉語音模型,專為語音 AI 助理及客戶支援等企業應用而設計。該模型使企業能夠開發用於銷售和客戶互動的語音代理,使 Mistral 成為 ElevenLabs、Deepgram 和 OpenAI 的直接競爭對手。
這款名為 Voxtral TTS 的模型支援九種語言,包括英語、法語、德語、西班牙語、荷蘭語、葡萄牙語、義大利語、印地語和阿拉伯語。
「我們的客戶一直都在尋求語音模型。因此,我們開發了一款體積小巧的語音模型,能夠運行於智慧手錶、智慧型手機、筆記型電腦或其他邊緣裝置上。其成本僅為市場上其他產品的零頭,卻能提供最先進的性能,」Mistral AI 科學運營副總裁 Pierre Stock 在接受 TechCrunch 電話採訪時表示。

圖片來源:Mistral
Mistral 表示,這款新模型只需不到五秒的語音樣本,就能適應特定使用者的聲音,並能捕捉細微的口音、語調變化、語氣以及語流中的不規則性。該模型基於 Mistral 3B 建構,能在保持語音特徵的同時流暢地切換語言,使其非常適合用於配音或即時翻譯。Stock 指出,公司的目標是讓模型聽起來像真人,而非機器人。
據該公司表示,此模型專為即時表現而設計。其「首次發聲時間」(TTFA)——即從接收輸入到開始「說話」所需的時間——針對 10 秒、500 字元的樣本,僅需 90 毫秒。 該模型還達到了 6 倍的即時係數(RTF),這意味著它大約只需 1.6 秒即可生成 10 秒的音頻片段。

圖片來源:Mistral AI
今年稍早,Mistral 推出了兩款轉錄模型——一款用於大規模批次處理,另一款則針對低延遲的即時應用場景。隨著這款新語音模型的推出,該公司似乎正致力於為企業打造一套全面的語音產品組合。
Stock 補充道:「我們計劃打造一個端到端的平台,能夠處理多模態輸入流——包括音訊、文字和圖像——以及輸出。其關鍵優勢在於,支援音訊輸入與輸出的端到端代理系統能提供更豐富的信息。」
Mistral 將其開源特性與客製化能力視為關鍵差異化優勢,讓企業能根據自身特定需求調整模型,因此相較於競爭對手的解決方案更具吸引力。
相關文章
ElevenLabs 推出可在歌曲進行中切換音樂風格的 AI 技術
語音人工智慧公司ElevenLabs推出了其音樂生成模型的最新版本Music v2,該版本具備在歌曲進行到中途時切換音樂風格的功能。這款模型專為處理複雜的人聲與曲目結構而設計。距離這家初創公司首次推出音樂生成模型至今已近十個月,此次新版本終於問世。據ElevenLabs稱,該模型能夠實現從歌劇到重金屬等多種風格的快速轉換,並且在保持連貫性的同時輸出快速的說唱內容,還能將非音樂類的音效融入歌曲中。藝術家們還可以選擇歌曲中的某一段落,透過提示詞重新生成該部分內容,而無需改動歌曲的其餘部分。此外,
Google 在 Docs 和 Keep 中推出語音提示功能
在 Google I/O 開發者大會上,該公司宣布將在 Docs、Keep 和 Gmail 等 Workspace 應用程式中導入語音提示功能。這些功能讓使用者能透過語音建立草稿、記錄筆記,以及搜尋電子郵件。在 Docs 中,您可以完全透過語音起草文件。在 TechCrunch 展示的示範中,一名使用者從 Drive 提取履歷詳情、從電子郵件中加入活動安排細節,甚至還加入了幾個幽默的軼事。圖片來源
前高盛員工與 Meta 創辦人聯手開發語音 AI,瞄準被忽視的市場
客戶支援與服務是當今語音人工智慧領域中最受矚目的領域之一。然而,在某些市場中,開發出聽起來像真人且能以極低延遲回應的產品,遠比其他市場更具挑戰性——而大多數主要業者在設計產品時,並未將非洲和中東地區納入考量。AethexAI 是一家成立於去年的新創公司,旨在彌合這項差距,該公司已完成由 4DX Ventures 領投、Enza Capital、Dorm Room Fund、Mojo Venture
相關專題推薦
評論 (1)
0/500
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?
法國人工智慧公司 Mistral 於週四推出一款全新的開源文字轉語音模型,專為語音 AI 助理及客戶支援等企業應用而設計。該模型使企業能夠開發用於銷售和客戶互動的語音代理,使 Mistral 成為 ElevenLabs、Deepgram 和 OpenAI 的直接競爭對手。
這款名為 Voxtral TTS 的模型支援九種語言,包括英語、法語、德語、西班牙語、荷蘭語、葡萄牙語、義大利語、印地語和阿拉伯語。
「我們的客戶一直都在尋求語音模型。因此,我們開發了一款體積小巧的語音模型,能夠運行於智慧手錶、智慧型手機、筆記型電腦或其他邊緣裝置上。其成本僅為市場上其他產品的零頭,卻能提供最先進的性能,」Mistral AI 科學運營副總裁 Pierre Stock 在接受 TechCrunch 電話採訪時表示。

圖片來源:Mistral
Mistral 表示,這款新模型只需不到五秒的語音樣本,就能適應特定使用者的聲音,並能捕捉細微的口音、語調變化、語氣以及語流中的不規則性。該模型基於 Mistral 3B 建構,能在保持語音特徵的同時流暢地切換語言,使其非常適合用於配音或即時翻譯。Stock 指出,公司的目標是讓模型聽起來像真人,而非機器人。
據該公司表示,此模型專為即時表現而設計。其「首次發聲時間」(TTFA)——即從接收輸入到開始「說話」所需的時間——針對 10 秒、500 字元的樣本,僅需 90 毫秒。 該模型還達到了 6 倍的即時係數(RTF),這意味著它大約只需 1.6 秒即可生成 10 秒的音頻片段。

圖片來源:Mistral AI
今年稍早,Mistral 推出了兩款轉錄模型——一款用於大規模批次處理,另一款則針對低延遲的即時應用場景。隨著這款新語音模型的推出,該公司似乎正致力於為企業打造一套全面的語音產品組合。
Stock 補充道:「我們計劃打造一個端到端的平台,能夠處理多模態輸入流——包括音訊、文字和圖像——以及輸出。其關鍵優勢在於,支援音訊輸入與輸出的端到端代理系統能提供更豐富的信息。」
Mistral 將其開源特性與客製化能力視為關鍵差異化優勢,讓企業能根據自身特定需求調整模型,因此相較於競爭對手的解決方案更具吸引力。
ElevenLabs 推出可在歌曲進行中切換音樂風格的 AI 技術
語音人工智慧公司ElevenLabs推出了其音樂生成模型的最新版本Music v2,該版本具備在歌曲進行到中途時切換音樂風格的功能。這款模型專為處理複雜的人聲與曲目結構而設計。距離這家初創公司首次推出音樂生成模型至今已近十個月,此次新版本終於問世。據ElevenLabs稱,該模型能夠實現從歌劇到重金屬等多種風格的快速轉換,並且在保持連貫性的同時輸出快速的說唱內容,還能將非音樂類的音效融入歌曲中。藝術家們還可以選擇歌曲中的某一段落,透過提示詞重新生成該部分內容,而無需改動歌曲的其餘部分。此外,
Google 在 Docs 和 Keep 中推出語音提示功能
在 Google I/O 開發者大會上,該公司宣布將在 Docs、Keep 和 Gmail 等 Workspace 應用程式中導入語音提示功能。這些功能讓使用者能透過語音建立草稿、記錄筆記,以及搜尋電子郵件。在 Docs 中,您可以完全透過語音起草文件。在 TechCrunch 展示的示範中,一名使用者從 Drive 提取履歷詳情、從電子郵件中加入活動安排細節,甚至還加入了幾個幽默的軼事。圖片來源
前高盛員工與 Meta 創辦人聯手開發語音 AI,瞄準被忽視的市場
客戶支援與服務是當今語音人工智慧領域中最受矚目的領域之一。然而,在某些市場中,開發出聽起來像真人且能以極低延遲回應的產品,遠比其他市場更具挑戰性——而大多數主要業者在設計產品時,並未將非洲和中東地區納入考量。AethexAI 是一家成立於去年的新創公司,旨在彌合這項差距,該公司已完成由 4DX Ventures 領投、Enza Capital、Dorm Room Fund、Mojo Venture
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?





首頁






