Fish AudioがS2を発表:オープンソースモデルにより単語単位の感情制御を実現

Fish Audioは、オープンソースのTTS技術において表現力と制御性の面で大きな飛躍を遂げた、新しいテキスト読み上げモデル「S2」を正式にリリースしました。
「Fish Audio S2」と名付けられたこのモデルは、強力な感情制御を最優先しています。ユーザーは自然言語による指示を用いて、プロソディ(抑揚)や感情をきめ細かく調整できます。[laugh]、[whisper]、[super happy] といったタグを挿入したり、[professional broadcast tone] や [pitch up] といった自由形式の記述を使用したりすることで、単語単位での精密な制御が可能となり、表現力豊かで自然な生き生きとした音声を生成できます。
主な機能は以下の通りです:
完全なオープンソース:モデルの重み、微調整コード、およびSGLangに基づくストリーミング推論エンジンはすべて、GitHubとHugging Faceで公開されています。 S2-Proは、約44億のパラメータを持つフラッグシップバージョンです。超低遅延:推論遅延は150ミリ秒未満であり、チャットボットやバーチャルストリーマーなどのリアルタイムアプリケーションに最適です。ネイティブのマルチスピーカー対応:単一の推論で複数の話者を処理でき、会話のターンや割り込み、自然な感情表現を処理しながら、追加処理なしで一貫した音声品質を維持します。Fish Audioによると、S2は約50言語に及ぶ約1,000万時間の音声データを用いて学習されました。強化学習によるアライメントとデュアル自己回帰アーキテクチャを活用し、複数のベンチマークにおいて業界トップクラスの自然さと表現力を発揮しています。オープンソース・プロプライエタリを問わず、現在利用可能なTTSシステムの中で最も感情表現に優れたシステムの一つとされています。「真の言語的自由が今、始まる」とFish Audioは発表し、本物の感情と個性を備えたAI音声の到来を告げました。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500

Fish Audioは、オープンソースのTTS技術において表現力と制御性の面で大きな飛躍を遂げた、新しいテキスト読み上げモデル「S2」を正式にリリースしました。
「Fish Audio S2」と名付けられたこのモデルは、強力な感情制御を最優先しています。ユーザーは自然言語による指示を用いて、プロソディ(抑揚)や感情をきめ細かく調整できます。[laugh]、[whisper]、[super happy] といったタグを挿入したり、[professional broadcast tone] や [pitch up] といった自由形式の記述を使用したりすることで、単語単位での精密な制御が可能となり、表現力豊かで自然な生き生きとした音声を生成できます。
主な機能は以下の通りです:
完全なオープンソース:モデルの重み、微調整コード、およびSGLangに基づくストリーミング推論エンジンはすべて、GitHubとHugging Faceで公開されています。 S2-Proは、約44億のパラメータを持つフラッグシップバージョンです。超低遅延:推論遅延は150ミリ秒未満であり、チャットボットやバーチャルストリーマーなどのリアルタイムアプリケーションに最適です。ネイティブのマルチスピーカー対応:単一の推論で複数の話者を処理でき、会話のターンや割り込み、自然な感情表現を処理しながら、追加処理なしで一貫した音声品質を維持します。Fish Audioによると、S2は約50言語に及ぶ約1,000万時間の音声データを用いて学習されました。強化学習によるアライメントとデュアル自己回帰アーキテクチャを活用し、複数のベンチマークにおいて業界トップクラスの自然さと表現力を発揮しています。オープンソース・プロプライエタリを問わず、現在利用可能なTTSシステムの中で最も感情表現に優れたシステムの一つとされています。「真の言語的自由が今、始まる」とFish Audioは発表し、本物の感情と個性を備えたAI音声の到来を告げました。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






