XiaomiのオープンソースTTSモデル「OmniVoice」は、600以上の言語に対応したゼロショットクローン機能を可能にする
最近、Xiaomiの次世代Kaldiチーム(k2-fsa)は、600以上の言語に対応する大規模な多言語ゼロショット音声合成モデル「OmniVoice」を正式にオープンソース化しました。このモデルは、中国語、英語、および多言語合成に関する複数の主要ベンチマークにおいて最先端の成果を達成しており、この分野における大きな飛躍を遂げました。
トップクラスの性能:中国語のWERは0.84%と極めて低く、多言語テストでは主流モデルを上回る
Seed-TTS中国語テストセットにおいて、OmniVoiceはわずか0.84%という極めて低い単語誤り率(WER)を達成しました。多言語評価では、その類似度(SIM-o)およびWERスコアがElevenLabs v2やMiniMaxといった著名な商用モデルを上回り、卓越した音声の自然さと明瞭さを実証しています。

超高速推論:RTFはわずか0.025、リアルタイムの40倍の速度
OmniVoiceは、リアルタイム係数(RTF)がわずか0.025という低さを誇り、その合成速度はリアルタイム要件をはるかに上回っています。この大幅な効率化により、実用的なアプリケーションにおいて長文の音声生成を迅速に行うことが可能となり、ユーザー体験を大幅に向上させます。
中核となるアーキテクチャの革新:拡散モデルに着想を得た離散型非自己回帰設計
OmniVoiceは、拡散言語モデルに着想を得た斬新な離散非自己回帰アーキテクチャを採用しています。従来の中間的な意味的トークンを省略し、テキストから音声までを一つのステップで生成します。この合理化された設計により、高い出力品質を維持しつつパイプラインを簡素化しています。フルコードブックランダムマスキング戦略と事前学習済みLLMの初期化を組み合わせることで、トレーニング効率をさらに高め、最終的な音声の明瞭さと理解しやすさを向上させます。
柔軟な音声クローン作成とカスタマイズ:わずか3~10秒の音声で動作
本モデルは、わずか3~10秒の参照音声のみを使用して、高品質なゼロショット音声クローン生成をサポートします。また、ユーザーは自然言語プロンプトを通じて音声属性をカスタマイズでき、性別、年齢、ピッチ、アクセント、方言、さらにはささやき声のような特殊効果まで指定可能です。
非言語記号の処理と詳細な発音制御
OmniVoiceは[笑い声]などの非言語的記号を処理でき、ピンインや発音記号を用いた発音補正にも対応しています。これにより、中国語や様々な方言における精密な音声合成に特に適しています。
600以上の言語に対応:少数言語および消滅危惧言語のデジタル保存を支援
OmniVoiceの大きな特徴は、その広範な言語対応範囲にあり、主要言語だけでなく、リソースの乏しい数多くの言語も効率的にサポートしています。少数言語や消滅の危機にある言語においても、最小限のデータサンプルで高品質な音声を生成できるため、言語のデジタル保存や文化保護において大きな可能性を秘めています。
OmniVoiceのコードと事前学習済みモデルは、GitHubおよびHugging Faceでオープンソース化されており、開発者はローカルでの展開やアプリケーションへの統合が可能です。AIbaseは今後もコミュニティからのフィードバックや実世界でのユースケースを注視していきます。開発者の皆様には、ぜひご自身の体験を共有していただくようお願いいたします。
プロジェクトリンク: https://github.com/k2-fsa/OmniVoice
関連記事
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
関連特集おすすめ
コメント (0)
0/500
最近、Xiaomiの次世代Kaldiチーム(k2-fsa)は、600以上の言語に対応する大規模な多言語ゼロショット音声合成モデル「OmniVoice」を正式にオープンソース化しました。このモデルは、中国語、英語、および多言語合成に関する複数の主要ベンチマークにおいて最先端の成果を達成しており、この分野における大きな飛躍を遂げました。
トップクラスの性能:中国語のWERは0.84%と極めて低く、多言語テストでは主流モデルを上回る
Seed-TTS中国語テストセットにおいて、OmniVoiceはわずか0.84%という極めて低い単語誤り率(WER)を達成しました。多言語評価では、その類似度(SIM-o)およびWERスコアがElevenLabs v2やMiniMaxといった著名な商用モデルを上回り、卓越した音声の自然さと明瞭さを実証しています。

超高速推論:RTFはわずか0.025、リアルタイムの40倍の速度
OmniVoiceは、リアルタイム係数(RTF)がわずか0.025という低さを誇り、その合成速度はリアルタイム要件をはるかに上回っています。この大幅な効率化により、実用的なアプリケーションにおいて長文の音声生成を迅速に行うことが可能となり、ユーザー体験を大幅に向上させます。
中核となるアーキテクチャの革新:拡散モデルに着想を得た離散型非自己回帰設計
OmniVoiceは、拡散言語モデルに着想を得た斬新な離散非自己回帰アーキテクチャを採用しています。従来の中間的な意味的トークンを省略し、テキストから音声までを一つのステップで生成します。この合理化された設計により、高い出力品質を維持しつつパイプラインを簡素化しています。フルコードブックランダムマスキング戦略と事前学習済みLLMの初期化を組み合わせることで、トレーニング効率をさらに高め、最終的な音声の明瞭さと理解しやすさを向上させます。
柔軟な音声クローン作成とカスタマイズ:わずか3~10秒の音声で動作
本モデルは、わずか3~10秒の参照音声のみを使用して、高品質なゼロショット音声クローン生成をサポートします。また、ユーザーは自然言語プロンプトを通じて音声属性をカスタマイズでき、性別、年齢、ピッチ、アクセント、方言、さらにはささやき声のような特殊効果まで指定可能です。
非言語記号の処理と詳細な発音制御
OmniVoiceは[笑い声]などの非言語的記号を処理でき、ピンインや発音記号を用いた発音補正にも対応しています。これにより、中国語や様々な方言における精密な音声合成に特に適しています。
600以上の言語に対応:少数言語および消滅危惧言語のデジタル保存を支援
OmniVoiceの大きな特徴は、その広範な言語対応範囲にあり、主要言語だけでなく、リソースの乏しい数多くの言語も効率的にサポートしています。少数言語や消滅の危機にある言語においても、最小限のデータサンプルで高品質な音声を生成できるため、言語のデジタル保存や文化保護において大きな可能性を秘めています。
OmniVoiceのコードと事前学習済みモデルは、GitHubおよびHugging Faceでオープンソース化されており、開発者はローカルでの展開やアプリケーションへの統合が可能です。AIbaseは今後もコミュニティからのフィードバックや実世界でのユースケースを注視していきます。開発者の皆様には、ぜひご自身の体験を共有していただくようお願いいたします。
プロジェクトリンク: https://github.com/k2-fsa/OmniVoice
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策





家






