Fish Audio 推出 S2:開源模型實現詞彙層級的情感控制

Fish Audio 已正式推出其全新的文字轉語音模型 S2,這代表著開源 TTS 技術在表現力與可控性方面取得了一項重大突破。
這款名為 Fish Audio S2 的模型,將強大的情感控制列為首要目標。使用者可透過自然語言指令,對語調與情感進行細緻調整。無論是插入 [laugh]、[whisper] 或 [super happy] 等標籤,抑或使用 [專業播報語調] 或 [提高音高] 等自由描述,皆能實現精準的單字級控制,生成極具表現力且自然生動的語音。
主要特點包括:
完全開源:模型權重、微調程式碼以及基於 SGLang 的串流推論引擎,均已公開發布於 GitHub 和 Hugging Face。 S2-Pro 是旗艦版本,擁有約 44 億個參數。超低延遲:推論延遲低於 150 毫秒,非常適合聊天機器人和虛擬主播等即時應用。原生多講者支援:可在單次推論中處理多位講者,處理對話輪次、插話及自然的情感傳達,同時維持一致的音質,無需額外處理。Fish Audio 表示,S2 是基於涵蓋近 50 種語言、總計約 1,000 萬小時的音訊資料所訓練而成。透過強化學習對齊技術與雙自迴歸架構,該模型在多項基準測試中展現出業界領先的自然度與表現力。無論是開源或專有系統,它都被視為當今最具情感智能的 TTS 系統之一。Fish Audio 宣佈:「真正的語言自由從此刻開始」,標誌著具備真實情感與個性的 AI 語音時代正式來臨。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
相關文章
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
相關專題推薦
評論 (0)
0/500

Fish Audio 已正式推出其全新的文字轉語音模型 S2,這代表著開源 TTS 技術在表現力與可控性方面取得了一項重大突破。
這款名為 Fish Audio S2 的模型,將強大的情感控制列為首要目標。使用者可透過自然語言指令,對語調與情感進行細緻調整。無論是插入 [laugh]、[whisper] 或 [super happy] 等標籤,抑或使用 [專業播報語調] 或 [提高音高] 等自由描述,皆能實現精準的單字級控制,生成極具表現力且自然生動的語音。
主要特點包括:
完全開源:模型權重、微調程式碼以及基於 SGLang 的串流推論引擎,均已公開發布於 GitHub 和 Hugging Face。 S2-Pro 是旗艦版本,擁有約 44 億個參數。超低延遲:推論延遲低於 150 毫秒,非常適合聊天機器人和虛擬主播等即時應用。原生多講者支援:可在單次推論中處理多位講者,處理對話輪次、插話及自然的情感傳達,同時維持一致的音質,無需額外處理。Fish Audio 表示,S2 是基於涵蓋近 50 種語言、總計約 1,000 萬小時的音訊資料所訓練而成。透過強化學習對齊技術與雙自迴歸架構,該模型在多項基準測試中展現出業界領先的自然度與表現力。無論是開源或專有系統,它都被視為當今最具情感智能的 TTS 系統之一。Fish Audio 宣佈:「真正的語言自由從此刻開始」,標誌著具備真實情感與個性的 AI 語音時代正式來臨。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic





首頁






