Fish AudioがS2を発表:オープンソースモデルにより単語単位の感情制御を実現

Fish Audioは、オープンソースのTTS技術において表現力と制御性の面で大きな飛躍を遂げた、新しいテキスト読み上げモデル「S2」を正式にリリースしました。
「Fish Audio S2」と名付けられたこのモデルは、強力な感情制御を最優先しています。ユーザーは自然言語による指示を用いて、プロソディ(抑揚)や感情をきめ細かく調整できます。[laugh]、[whisper]、[super happy] といったタグを挿入したり、[professional broadcast tone] や [pitch up] といった自由形式の記述を使用したりすることで、単語単位での精密な制御が可能となり、表現力豊かで自然な生き生きとした音声を生成できます。
主な機能は以下の通りです:
完全なオープンソース:モデルの重み、微調整コード、およびSGLangに基づくストリーミング推論エンジンはすべて、GitHubとHugging Faceで公開されています。 S2-Proは、約44億のパラメータを持つフラッグシップバージョンです。超低遅延:推論遅延は150ミリ秒未満であり、チャットボットやバーチャルストリーマーなどのリアルタイムアプリケーションに最適です。ネイティブのマルチスピーカー対応:単一の推論で複数の話者を処理でき、会話のターンや割り込み、自然な感情表現を処理しながら、追加処理なしで一貫した音声品質を維持します。Fish Audioによると、S2は約50言語に及ぶ約1,000万時間の音声データを用いて学習されました。強化学習によるアライメントとデュアル自己回帰アーキテクチャを活用し、複数のベンチマークにおいて業界トップクラスの自然さと表現力を発揮しています。オープンソース・プロプライエタリを問わず、現在利用可能なTTSシステムの中で最も感情表現に優れたシステムの一つとされています。「真の言語的自由が今、始まる」とFish Audioは発表し、本物の感情と個性を備えたAI音声の到来を告げました。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
関連記事
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
関連特集おすすめ
コメント (0)
0/500

Fish Audioは、オープンソースのTTS技術において表現力と制御性の面で大きな飛躍を遂げた、新しいテキスト読み上げモデル「S2」を正式にリリースしました。
「Fish Audio S2」と名付けられたこのモデルは、強力な感情制御を最優先しています。ユーザーは自然言語による指示を用いて、プロソディ(抑揚)や感情をきめ細かく調整できます。[laugh]、[whisper]、[super happy] といったタグを挿入したり、[professional broadcast tone] や [pitch up] といった自由形式の記述を使用したりすることで、単語単位での精密な制御が可能となり、表現力豊かで自然な生き生きとした音声を生成できます。
主な機能は以下の通りです:
完全なオープンソース:モデルの重み、微調整コード、およびSGLangに基づくストリーミング推論エンジンはすべて、GitHubとHugging Faceで公開されています。 S2-Proは、約44億のパラメータを持つフラッグシップバージョンです。超低遅延:推論遅延は150ミリ秒未満であり、チャットボットやバーチャルストリーマーなどのリアルタイムアプリケーションに最適です。ネイティブのマルチスピーカー対応:単一の推論で複数の話者を処理でき、会話のターンや割り込み、自然な感情表現を処理しながら、追加処理なしで一貫した音声品質を維持します。Fish Audioによると、S2は約50言語に及ぶ約1,000万時間の音声データを用いて学習されました。強化学習によるアライメントとデュアル自己回帰アーキテクチャを活用し、複数のベンチマークにおいて業界トップクラスの自然さと表現力を発揮しています。オープンソース・プロプライエタリを問わず、現在利用可能なTTSシステムの中で最も感情表現に優れたシステムの一つとされています。「真の言語的自由が今、始まる」とFish Audioは発表し、本物の感情と個性を備えたAI音声の到来を告げました。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内





家






