アリババのTongyi Labが「Fun-CineForge」をオープンソース化し、複数話者による吹き替えの課題を解決
映画やアニメーションといった、微妙な感情の起伏を捉え、唇の動きを完璧に同期させることが極めて重要な、ハイレベルな制作現場において、従来のAI音声吹き替え技術はしばしば不十分でした。この業界が抱える根本的な課題に取り組むため、Tongyi Labは、画期的な映画品質のマルチシナリオ・マルチモーダル吹き替えモデル「Fun-CineForge 」を正式にリリースし、オープンソース化しました。
映像と音声のギャップを埋める:シームレスな同期を実現する4つの柱からなるフレームワーク
Fun-CineForgeは、単純なテキスト読み上げ技術に頼るのではなく、プロフェッショナルな吹き替えにおける4つの重要な側面を習得するよう設計されています:
リップシンク:合成音声が画面上のキャラクターの口の動きと極めて高い精度で一致することを保証します。
感情表現:顔の表情や文脈上の指示を分析することで、音声に本物の人間のような感情を吹き込みます。
声の一貫性:複雑な複数人物の会話シーンにおいても、特定のキャラクターに対して安定した、識別可能な声の個性を維持します。
時間的整合性:話者が画面外にいる場合や部分的に隠れている場合でも、ミリ秒単位の精度で台詞を挿入します。
中核となるイノベーション:「タイム・モダリティ」と高忠実度データセットの先駆的開発
Fun-CineForgeの技術的飛躍は、独自の「データ+モデル」共同設計哲学に由来します:

CineDub高品質データセット:Tongyi Labは、自動化されたCineDubデータセット構築パイプラインもオープンソース化しました。思考連鎖エラー訂正メカニズムを活用することで、中国語および英語のテキストの転写誤り率を約1%~2%に低減し、話者ダイアリゼーションの誤りを1.2%まで大幅に削減します。
4モダリティ融合アーキテクチャ:本モデルは「時間モダリティ」の統合を先駆けて実現し、視覚入力(唇の形や表情)、テキスト(台詞や感情的文脈)、音声(参照音声)を共同でモデリングします。この融合により、顔が映っていないような困難なシーンにおいても、正確な同期が可能となります。
実証された卓越性:画期的なリアルな多人数対話吹き替え
ベンチマーク結果によると、Fun-CineForgeは、単語誤り率(WER/CER)、リップシンク精度(LSE-C/D)、音声類似度といった主要指標において、DeepDubber-V1などのベースラインモデルを大幅に上回っています。画期的な成果として、デュエットや複数人の対話を高精度で処理する業界初の機能を備えており、最大30秒の動画クリップにおいても卓越した堅牢性を示しています。
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500
映画やアニメーションといった、微妙な感情の起伏を捉え、唇の動きを完璧に同期させることが極めて重要な、ハイレベルな制作現場において、従来のAI音声吹き替え技術はしばしば不十分でした。この業界が抱える根本的な課題に取り組むため、Tongyi Labは、画期的な映画品質のマルチシナリオ・マルチモーダル吹き替えモデル「
映像と音声のギャップを埋める:シームレスな同期を実現する4つの柱からなるフレームワーク
Fun-CineForgeは、単純なテキスト読み上げ技術に頼るのではなく、プロフェッショナルな吹き替えにおける4つの重要な側面を習得するよう設計されています:
リップシンク:合成音声が画面上のキャラクターの口の動きと極めて高い精度で一致することを保証します。
感情表現:顔の表情や文脈上の指示を分析することで、音声に本物の人間のような感情を吹き込みます。
声の一貫性:複雑な複数人物の会話シーンにおいても、特定のキャラクターに対して安定した、識別可能な声の個性を維持します。
時間的整合性:話者が画面外にいる場合や部分的に隠れている場合でも、ミリ秒単位の精度で台詞を挿入します。
中核となるイノベーション:「タイム・モダリティ」と高忠実度データセットの先駆的開発
Fun-CineForgeの技術的飛躍は、独自の「データ+モデル」共同設計哲学に由来します:

CineDub高品質データセット:Tongyi Labは、自動化されたCineDubデータセット構築パイプラインもオープンソース化しました。思考連鎖エラー訂正メカニズムを活用することで、中国語および英語のテキストの転写誤り率を約1%~2%に低減し、話者ダイアリゼーションの誤りを1.2%まで大幅に削減します。
4モダリティ融合アーキテクチャ:本モデルは「時間モダリティ」の統合を先駆けて実現し、視覚入力(唇の形や表情)、テキスト(台詞や感情的文脈)、音声(参照音声)を共同でモデリングします。この融合により、顔が映っていないような困難なシーンにおいても、正確な同期が可能となります。
実証された卓越性:画期的なリアルな多人数対話吹き替え
ベンチマーク結果によると、Fun-CineForgeは、単語誤り率(WER/CER)、リップシンク精度(LSE-C/D)、音声類似度といった主要指標において、DeepDubber-V1などのベースラインモデルを大幅に上回っています。画期的な成果として、デュエットや複数人の対話を高精度で処理する業界初の機能を備えており、最大30秒の動画クリップにおいても卓越した堅牢性を示しています。
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






