美団のオープンソース音声モデルが、音声クローン技術の新たな基準を打ち立てる
音声生成の分野では、多段階カスケードアーキテクチャからエンドツーエンドモデルへの根本的な転換が進んでいます。 TTSシステムで使用される従来の「メルスペクトログラム」中間表現に内在する情報損失や誤差の蓄積を克服するため、Meituan LongCatチームはLongCat-AudioDiT(パラメータ数10億および35億のバージョンが利用可能)を正式にリリースし、オープンソース化した。このモデルは、波形に対する直接的な潜在空間モデリングを行うことで、ゼロショット音声クローン生成における従来の性能限界を突破することに成功した。

コアアーキテクチャ:メルスペクトログラムの枠を超越
LongCat-AudioDiTは、「音響特徴予測+ニューラルボコーダー」という従来の多段階パイプラインを排除し、代わりにWav-VAE(波形変分オートエンコーダー)とDiT(拡散トランスフォーマー)を基盤とした、合理化された最小限のアーキテクチャを確立しています。
効率的なWav-VAE:完全畳み込み設計を採用し、24kHzの波形を2000倍圧縮して11.7Hzのフレームレートに変換します。非パラメトリックなショートカット分岐と多目的敵対的学習を通じて、再構成された波形が正確な時周波数構造を維持しつつ、極めて自然な聴感品質を実現します。
意味強化型DiT:本モデルは、UMT5テキストエンコーダからの元の単語埋め込みと、その最上位隠れ状態を革新的に融合させます。これにより、高次元の意味表現で失われがちな音声的詳細を補完し、生成音声の明瞭度を大幅に向上させます。
推論の最適化:音声ドリフトの精密な補正
生成品質をさらに向上させるため、チームは2つの重要な技術的改良を実施しました:
デュアル制約メカニズム:この技術は、フローマッチングTTSにおいて常に見られる「学習と推論の不一致」という問題を特定し、修正します。推論中にプロンプト領域の潜在変数を強制的にリセットすることで、話者の声のドリフトや不安定性の問題を完全に解決します。
適応型投影ガイダンス(APG):APGは従来の分類器フリーガイダンス(CFG)に代わるものです。ガイダンス信号内の有益な成分を正確に抽出すると同時に、音声品質の低下を招く成分を抑制することで、スペクトル上の「過飽和」を引き起こすことなく、音声の自然さを大幅に向上させます。
性能:SOTAレベルのクローン精度
Seedデータセットでのベンチマークテストにおいて、LongCat-AudioDiTは圧倒的な性能を発揮しました:
類似度(SIM):35億パラメータモデルは、Seed-ZHテストセットで0.818、難易度の高いSeed-Hard文セットで0.797のスコアを達成し、Seed-TTS、CosyVoice3.5、MiniMax-Speechといった著名なモデルを上回りました。
精度:主要な評価指標において業界トップクラスの性能を示しており、英語のWERは1.50%、中国語の難文におけるCERは6.04%を記録した。
特筆すべきは、LongCat-AudioDiTが、前処理済みのASR転写データに対して単一ステージのトレーニングのみを行いながら、多段階トレーニングを施したモデルと比較して優れた結果を達成している点です。関連する研究論文、ソースコード、およびモデル重みは、現在GitHubおよびHuggingFaceで完全にオープンソース化され、公開されています。
プロジェクトリンク:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
関連記事
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
関連特集おすすめ
コメント (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
音声生成の分野では、多段階カスケードアーキテクチャからエンドツーエンドモデルへの根本的な転換が進んでいます。 TTSシステムで使用される従来の「メルスペクトログラム」中間表現に内在する情報損失や誤差の蓄積を克服するため、Meituan LongCatチームはLongCat-AudioDiT(パラメータ数10億および35億のバージョンが利用可能)を正式にリリースし、オープンソース化した。このモデルは、波形に対する直接的な潜在空間モデリングを行うことで、ゼロショット音声クローン生成における従来の性能限界を突破することに成功した。

コアアーキテクチャ:メルスペクトログラムの枠を超越
LongCat-AudioDiTは、「音響特徴予測+ニューラルボコーダー」という従来の多段階パイプラインを排除し、代わりにWav-VAE(波形変分オートエンコーダー)とDiT(拡散トランスフォーマー)を基盤とした、合理化された最小限のアーキテクチャを確立しています。
効率的なWav-VAE:完全畳み込み設計を採用し、24kHzの波形を2000倍圧縮して11.7Hzのフレームレートに変換します。非パラメトリックなショートカット分岐と多目的敵対的学習を通じて、再構成された波形が正確な時周波数構造を維持しつつ、極めて自然な聴感品質を実現します。
意味強化型DiT:本モデルは、UMT5テキストエンコーダからの元の単語埋め込みと、その最上位隠れ状態を革新的に融合させます。これにより、高次元の意味表現で失われがちな音声的詳細を補完し、生成音声の明瞭度を大幅に向上させます。
推論の最適化:音声ドリフトの精密な補正
生成品質をさらに向上させるため、チームは2つの重要な技術的改良を実施しました:
デュアル制約メカニズム:この技術は、フローマッチングTTSにおいて常に見られる「学習と推論の不一致」という問題を特定し、修正します。推論中にプロンプト領域の潜在変数を強制的にリセットすることで、話者の声のドリフトや不安定性の問題を完全に解決します。
適応型投影ガイダンス(APG):APGは従来の分類器フリーガイダンス(CFG)に代わるものです。ガイダンス信号内の有益な成分を正確に抽出すると同時に、音声品質の低下を招く成分を抑制することで、スペクトル上の「過飽和」を引き起こすことなく、音声の自然さを大幅に向上させます。
性能:SOTAレベルのクローン精度
Seedデータセットでのベンチマークテストにおいて、LongCat-AudioDiTは圧倒的な性能を発揮しました:
類似度(SIM):35億パラメータモデルは、Seed-ZHテストセットで0.818、難易度の高いSeed-Hard文セットで0.797のスコアを達成し、Seed-TTS、CosyVoice3.5、MiniMax-Speechといった著名なモデルを上回りました。
精度:主要な評価指標において業界トップクラスの性能を示しており、英語のWERは1.50%、中国語の難文におけるCERは6.04%を記録した。
特筆すべきは、LongCat-AudioDiTが、前処理済みのASR転写データに対して単一ステージのトレーニングのみを行いながら、多段階トレーニングを施したモデルと比較して優れた結果を達成している点です。関連する研究論文、ソースコード、およびモデル重みは、現在GitHubおよびHuggingFaceで完全にオープンソース化され、公開されています。
プロジェクトリンク:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー
アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





家






