27Bの数学SOTAと3秒の感情クローン:Youdaoが「Zi Yue 4」マルチモーダルおよびTTSエンジンをオープンソース化
NetEase Youdaoは先日、同社の大規模モデル「Confucius4」をバージョン4.0へと全面的にアップグレードしたと発表した。Confucius4は完全なマルチモーダル化を実現し、テキスト、画像、音声の統合的なインタラクションに対応している。 また、Youdaoは中核となるマルチモーダルモデルおよびテキスト読み上げ(TTS)モデルをオープンソース化し、翻訳モデルについては技術的な大幅な見直しを行い、品質と効率の両面で改善を実現しました。
このマルチモーダルモデルは、視覚および数学分野でSOTA(最先端)を達成しており、純粋なテキスト形式の数学問題においても優れた性能を発揮しています。
発表によると、パラメータ数270億を誇るオープンソースの「Confucius4」マルチモーダルモデルは、教育シーンにおいて視覚入力に基づく数学処理能力を業界最高水準(SOTA)に引き上げた。 同規模のモデルの中でも、「Confucius4」は、図表を含む高度な視覚的数学・物理の問題の処理に優れています。また、中国語の純粋なテキスト形式の数学問題においても大幅な改善が見られ、業界トップクラスの81.4%の精度を達成しています。

▲ Confucius4は、同規模のモデルの中で、複数の視覚的数学ベンチマークにおいてクラス最高の成績を達成
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに重要なブレークスルーは、実用的なコスト効率にあります。関係者によると、この新しいモデルは洗練された推論チェーン再構築スキームを採用しています。大量の高品質かつ簡潔な推論サンプルを集約して深く最適化することで、推論チェーンの出力長を43.2%圧縮しています。
これは、より少ないトークン数とより短い推論経路で解答を迅速に提供できることを意味し、企業や開発者にとっての実世界のビジネスシナリオにおける推論コストを大幅に削減します。

▲ Confucius4は、複数の視覚的数学ベンチマークにおいて出力トークン数を大幅に削減
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに、Confucius4の研究チームは、中国の学生が直面する実際の宿題、試験、問題解決のシナリオに合わせてモデルを徹底的に最適化しました。これにより、実際の学習上の課題に対処できるようになり、より共感力のあるデジタルアシスタントとなっています。
オープンソースのTTS:14言語に対応、3秒で元の声を再現し、言語間のアクセントの問題もなし
マルチモーダルモデルに加え、音声合成(TTS)エンジンもオープンソース化されました。最先端の「音声エンコーダー+LLM」アーキテクチャに基づいて構築されており、開発者やコンテンツクリエイターに、ゼロショットで敷居の低い音声クローン作成および感情合成機能を提供します。
現在、中国語、英語、日本語、韓国語、ドイツ語、フランス語、スペイン語、インドネシア語、イタリア語、タイ語、ポルトガル語、ロシア語、マレー語、ベトナム語の計14言語を完全にサポートしています。 このシステムは、追加のトレーニングを必要とせずに話者の声を異なる言語間で自然に転送することができ、声の一貫性を維持しつつ、合成結果がネイティブで流暢に聞こえるよう保証します。また、言語間のクローン作成においても、アクセントの漏れが発生することはありません。
音声クローン機能において、Confucius4は完全な「アップロードしてクローン」機能を実現している。ユーザーは任意の音声素材を提供するだけで、システムは3秒以内に元の声を再現する。 発表によると、このエンジンのクローン作成タスクにおける精度は97%を超え、クローンされた声と元の声の類似度は85%以上です。話者固有の声の特徴を保持しつつ、感情のニュアンスを正確に再現し、その包括的な機能は同分野でトップクラスに位置しています。
さらに、このオープンソースモデルは、実際の多言語環境においても高い堅牢性を発揮します。日常会話、ニュース放送、企業プロモーション、複雑な感情表現など、さまざまな合成ニーズに対応可能です。
翻訳モデルの品質が全面的に向上、推論速度は80%高速化
Youdaoの最も根強い技術資産の一つである翻訳モデルも、今回のアップデートで大幅な技術的アップグレードを受け、翻訳タスクにおける性能がさらに向上しました。
データに関しては、Confuciusチームが数十億件の多言語データを収集・クリーニングし、TEM-8認定資格を持つ専門家を起用して多角的な手動評価を行うことで、初期段階から高品質なコーパスを確保しました。
アルゴリズム面では、このモデルは革新的な「マルチエキスパート OPD」モードを採用し、よりスマートな「ソフトアプローチ」によって、さまざまな専門家の強みを活用しています。また、強化学習を通じてフォーマット報酬や言語検出メカニズムを導入し、機械翻訳でよく見られる「文脈から外れた翻訳」や「混在言語の出力」といった問題を効果的に解決しています。
高頻度かつ高同時処理が求められる産業用アプリケーションのニーズに応えるため、更新された翻訳モデルには、全体的な推論速度を直接80%向上させる効率的な高速化メカニズムが搭載されています。 大規模モデルの自動評価とランダムな手動サンプリングを組み合わせたカスタマイズされたソリューションと相まって、新世代の翻訳モデルは、テキスト、画像、文書翻訳を含む複数のシナリオにおいて、極めて高い水準の速度と品質を発揮しています。
教育向け初の大型モデル「Confucius」の初期リリースから、従来の会話練習手法を一新した「バーチャルスピーキングコーチ Hi Echo」の導入、さらには「Confucius 2.0」および「3.0」のソフトウェア・ハードウェアエコシステムへの包括的な統合に至るまで、YoudaoのAIにおける歩みを振り返ると、 Youdaoは一貫して、実世界シナリオにおけるAI活用を牽引してきました。2026年、Youdaoは「LobsterAI」、「Youdao Treasure」、「Youdao Conference Agent」、「Thinkflow」といった一連のAIエージェント製品によりAIの応用を加速させ、先見性のある全シナリオ対応のAIエージェントマトリックスを実現しました。
「Confucius 4」のアップグレードとコアモデルの完全オープンソース化は、マルチモーダルおよび音声合成分野における開発者の参入障壁を大幅に引き下げるだけでなく、基盤となるコア技術が上位層のエージェント・マトリックスを育むという、エコシステムの閉ループ構造を実証するものです。 Youdaoは、世界中の開発者やオープンソースコミュニティの共同の貢献により、この全モーダル大規模モデルエコシステムが、幅広い業界において真の生産性変革をもたらすことを期待しています。
付録:オープンソースのURL:
「Confucius4」マルチモーダルモデル:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」TTSモデル:https://github.com/netease-youdao/Confucius4-TTS
関連記事
サイバーセキュリティの専門家が、Anthropicの「Fable」におけるガードレールを批判
Anthropicは火曜日、最新のモデル「Fable」をリリースし、その高い期待を集めるサイバーセキュリティ特化型モデル「Mythos」の公開版かつ制限付き版として位置づけた。しかし、これらの制限により、オンライン上で懸念を表明する複数のサイバーセキュリティ研究者や専門家の間で不満が高まっている。IBM X-Forceの著名なセキュリティ研究者であるValentina「Chompie」Palmiotti氏は、「[Fable]は、ブログ記事の読書といった無害なタスクを含め、サイバーセキュリティ
Vbot VITA Power、Pre-Aラウンドで約5億元を調達、初の具現化知能製品の大規模納品を開始
Vbot Weita Powerは体現型知能のパイオニアとして、約5億元のプレAラウンド資金調達に成功しました。このラウンドは東方嘉富、華泰紫金、復星陸正がリードし、上汽資本(SAICグループ)および持分を増額した既存の株主からも追加支援を受けました。この投資は、グローバルな消費者向け体現型知能分野における単一資金調達イベントとして最大規模となります。5月8日、Vbotは初製品「Super Dog」の量産と納品を開始しました。最初の500台が出荷され、体現型ロボットが研究室から日常環境へ移行した
Baidu Wenyinが「PaddleOCR-VL-1.6」を発表、96.33%の精度を達成し、文書解析において新たなSOTAを記録
百度は、ERNIE大型モデルの専用バージョンである「PaddleOCR-VL-1.6」を正式にリリースした。 権威あるベンチマーク「OmnicDocBench v1.6」において、96.33%の精度を達成し、Gemini-3-Pro、GPT-5.2、GLM-OCRといった主要モデルを上回りました。 この成果は業界のSOTA(最先端)を更新し、総合性能において世界1位にランクインしたものであり、マル
関連特集おすすめ
コメント (1)
0/500
NetEase Youdaoは先日、同社の大規模モデル「Confucius4」をバージョン4.0へと全面的にアップグレードしたと発表した。Confucius4は完全なマルチモーダル化を実現し、テキスト、画像、音声の統合的なインタラクションに対応している。 また、Youdaoは中核となるマルチモーダルモデルおよびテキスト読み上げ(TTS)モデルをオープンソース化し、翻訳モデルについては技術的な大幅な見直しを行い、品質と効率の両面で改善を実現しました。
このマルチモーダルモデルは、視覚および数学分野でSOTA(最先端)を達成しており、純粋なテキスト形式の数学問題においても優れた性能を発揮しています。
発表によると、パラメータ数270億を誇るオープンソースの「Confucius4」マルチモーダルモデルは、教育シーンにおいて視覚入力に基づく数学処理能力を業界最高水準(SOTA)に引き上げた。 同規模のモデルの中でも、「Confucius4」は、図表を含む高度な視覚的数学・物理の問題の処理に優れています。また、中国語の純粋なテキスト形式の数学問題においても大幅な改善が見られ、業界トップクラスの81.4%の精度を達成しています。

▲ Confucius4は、同規模のモデルの中で、複数の視覚的数学ベンチマークにおいてクラス最高の成績を達成
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに重要なブレークスルーは、実用的なコスト効率にあります。関係者によると、この新しいモデルは洗練された推論チェーン再構築スキームを採用しています。大量の高品質かつ簡潔な推論サンプルを集約して深く最適化することで、推論チェーンの出力長を43.2%圧縮しています。
これは、より少ないトークン数とより短い推論経路で解答を迅速に提供できることを意味し、企業や開発者にとっての実世界のビジネスシナリオにおける推論コストを大幅に削減します。

▲ Confucius4は、複数の視覚的数学ベンチマークにおいて出力トークン数を大幅に削減
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに、Confucius4の研究チームは、中国の学生が直面する実際の宿題、試験、問題解決のシナリオに合わせてモデルを徹底的に最適化しました。これにより、実際の学習上の課題に対処できるようになり、より共感力のあるデジタルアシスタントとなっています。
オープンソースのTTS:14言語に対応、3秒で元の声を再現し、言語間のアクセントの問題もなし
マルチモーダルモデルに加え、音声合成(TTS)エンジンもオープンソース化されました。最先端の「音声エンコーダー+LLM」アーキテクチャに基づいて構築されており、開発者やコンテンツクリエイターに、ゼロショットで敷居の低い音声クローン作成および感情合成機能を提供します。
現在、中国語、英語、日本語、韓国語、ドイツ語、フランス語、スペイン語、インドネシア語、イタリア語、タイ語、ポルトガル語、ロシア語、マレー語、ベトナム語の計14言語を完全にサポートしています。 このシステムは、追加のトレーニングを必要とせずに話者の声を異なる言語間で自然に転送することができ、声の一貫性を維持しつつ、合成結果がネイティブで流暢に聞こえるよう保証します。また、言語間のクローン作成においても、アクセントの漏れが発生することはありません。
音声クローン機能において、Confucius4は完全な「アップロードしてクローン」機能を実現している。ユーザーは任意の音声素材を提供するだけで、システムは3秒以内に元の声を再現する。 発表によると、このエンジンのクローン作成タスクにおける精度は97%を超え、クローンされた声と元の声の類似度は85%以上です。話者固有の声の特徴を保持しつつ、感情のニュアンスを正確に再現し、その包括的な機能は同分野でトップクラスに位置しています。
さらに、このオープンソースモデルは、実際の多言語環境においても高い堅牢性を発揮します。日常会話、ニュース放送、企業プロモーション、複雑な感情表現など、さまざまな合成ニーズに対応可能です。
翻訳モデルの品質が全面的に向上、推論速度は80%高速化
Youdaoの最も根強い技術資産の一つである翻訳モデルも、今回のアップデートで大幅な技術的アップグレードを受け、翻訳タスクにおける性能がさらに向上しました。
データに関しては、Confuciusチームが数十億件の多言語データを収集・クリーニングし、TEM-8認定資格を持つ専門家を起用して多角的な手動評価を行うことで、初期段階から高品質なコーパスを確保しました。
アルゴリズム面では、このモデルは革新的な「マルチエキスパート OPD」モードを採用し、よりスマートな「ソフトアプローチ」によって、さまざまな専門家の強みを活用しています。また、強化学習を通じてフォーマット報酬や言語検出メカニズムを導入し、機械翻訳でよく見られる「文脈から外れた翻訳」や「混在言語の出力」といった問題を効果的に解決しています。
高頻度かつ高同時処理が求められる産業用アプリケーションのニーズに応えるため、更新された翻訳モデルには、全体的な推論速度を直接80%向上させる効率的な高速化メカニズムが搭載されています。 大規模モデルの自動評価とランダムな手動サンプリングを組み合わせたカスタマイズされたソリューションと相まって、新世代の翻訳モデルは、テキスト、画像、文書翻訳を含む複数のシナリオにおいて、極めて高い水準の速度と品質を発揮しています。
教育向け初の大型モデル「Confucius」の初期リリースから、従来の会話練習手法を一新した「バーチャルスピーキングコーチ Hi Echo」の導入、さらには「Confucius 2.0」および「3.0」のソフトウェア・ハードウェアエコシステムへの包括的な統合に至るまで、YoudaoのAIにおける歩みを振り返ると、 Youdaoは一貫して、実世界シナリオにおけるAI活用を牽引してきました。2026年、Youdaoは「LobsterAI」、「Youdao Treasure」、「Youdao Conference Agent」、「Thinkflow」といった一連のAIエージェント製品によりAIの応用を加速させ、先見性のある全シナリオ対応のAIエージェントマトリックスを実現しました。
「Confucius 4」のアップグレードとコアモデルの完全オープンソース化は、マルチモーダルおよび音声合成分野における開発者の参入障壁を大幅に引き下げるだけでなく、基盤となるコア技術が上位層のエージェント・マトリックスを育むという、エコシステムの閉ループ構造を実証するものです。 Youdaoは、世界中の開発者やオープンソースコミュニティの共同の貢献により、この全モーダル大規模モデルエコシステムが、幅広い業界において真の生産性変革をもたらすことを期待しています。
付録:オープンソースのURL:
「Confucius4」マルチモーダルモデル:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」TTSモデル:https://github.com/netease-youdao/Confucius4-TTS
サイバーセキュリティの専門家が、Anthropicの「Fable」におけるガードレールを批判
Anthropicは火曜日、最新のモデル「Fable」をリリースし、その高い期待を集めるサイバーセキュリティ特化型モデル「Mythos」の公開版かつ制限付き版として位置づけた。しかし、これらの制限により、オンライン上で懸念を表明する複数のサイバーセキュリティ研究者や専門家の間で不満が高まっている。IBM X-Forceの著名なセキュリティ研究者であるValentina「Chompie」Palmiotti氏は、「[Fable]は、ブログ記事の読書といった無害なタスクを含め、サイバーセキュリティ
Vbot VITA Power、Pre-Aラウンドで約5億元を調達、初の具現化知能製品の大規模納品を開始
Vbot Weita Powerは体現型知能のパイオニアとして、約5億元のプレAラウンド資金調達に成功しました。このラウンドは東方嘉富、華泰紫金、復星陸正がリードし、上汽資本(SAICグループ)および持分を増額した既存の株主からも追加支援を受けました。この投資は、グローバルな消費者向け体現型知能分野における単一資金調達イベントとして最大規模となります。5月8日、Vbotは初製品「Super Dog」の量産と納品を開始しました。最初の500台が出荷され、体現型ロボットが研究室から日常環境へ移行した
Baidu Wenyinが「PaddleOCR-VL-1.6」を発表、96.33%の精度を達成し、文書解析において新たなSOTAを記録
百度は、ERNIE大型モデルの専用バージョンである「PaddleOCR-VL-1.6」を正式にリリースした。 権威あるベンチマーク「OmnicDocBench v1.6」において、96.33%の精度を達成し、Gemini-3-Pro、GPT-5.2、GLM-OCRといった主要モデルを上回りました。 この成果は業界のSOTA(最先端)を更新し、総合性能において世界1位にランクインしたものであり、マル





家






