アリババ・トンイー、『FreeStyle』自然言語制御機能搭載音声モデルを発表
本日、アリババ統一ラボ音声チームは画期的な音声生成モデル「Fun-CosyVoice3.5」と「Fun-AudioGen-VD」を発表しました。これらのモデルの最大の特徴は「フリースタイル」コマンドのサポートです。複雑なパラメータ調整の代わりに、ユーザーは自然な言語記述を用いて声の表現スタイルを精密に制御したり、複雑な音声シーンを一から構築したりできます。

各モデルは異なる目的を果たします:
Fun-CosyVoice3.5:多言語再現と微細制御
CosyVoiceの強化版である本モデルは、音声表現のニュアンス理解において中核的なブレークスルーを達成。
コマンド駆動型生成:ユーザーは「より自信を持って話す」「感情の変化を伴いながらゆっくり話す」などの指示を入力し、リアルタイムで音声調整が可能です。
言語拡張:タイ語、インドネシア語、ポルトガル語、ベトナム語のサポートを追加し、13言語にわたる業界トップクラスの文字起こし精度(WER)と音声類似性を維持。
特殊文字最適化:特殊文字の誤認識率を15.2%から5.3%に低減。
パフォーマンス向上:ファーストパケット遅延が35%短縮され、リアルタイム操作の滑らかさが大幅に向上。
Fun-AudioGen-VD:包括的なサウンドデザイン
このモデルは「オーディオディレクター」として機能し、「キャラクター+環境」を統合したオーディオを生成します。
音声カスタマイズ:性別、年齢、アクセント、および「嗄れた声、低い声、低音」などの詳細な特性を指定可能。
感情とロールプレイ:カスタマーサービス担当者、放送局アナウンサー、子供などの役割をシミュレートし、「外見は平静だが内面は緊張している」といった複雑な状態も表現可能。
没入型環境:背景音(戦場の喧騒、カフェのざわめき)や空間効果(大聖堂のリバーブ、水中音響)を追加し、完全な空間シミュレーションを実現。
同義ラボは、これらのモデルが高品質な音声制作を民主化し、ポッドキャスティング、ゲーム開発、映画ポストプロダクションに強力なAI支援を提供すると指摘している。
関連記事
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
関連特集おすすめ
コメント (0)
0/500
本日、アリババ統一ラボ音声チームは画期的な音声生成モデル「Fun-CosyVoice3.5」と「Fun-AudioGen-VD」を発表しました。これらのモデルの最大の特徴は「フリースタイル」コマンドのサポートです。複雑なパラメータ調整の代わりに、ユーザーは自然な言語記述を用いて声の表現スタイルを精密に制御したり、複雑な音声シーンを一から構築したりできます。

各モデルは異なる目的を果たします:
Fun-CosyVoice3.5:多言語再現と微細制御
CosyVoiceの強化版である本モデルは、音声表現のニュアンス理解において中核的なブレークスルーを達成。
コマンド駆動型生成:ユーザーは「より自信を持って話す」「感情の変化を伴いながらゆっくり話す」などの指示を入力し、リアルタイムで音声調整が可能です。
言語拡張:タイ語、インドネシア語、ポルトガル語、ベトナム語のサポートを追加し、13言語にわたる業界トップクラスの文字起こし精度(WER)と音声類似性を維持。
特殊文字最適化:特殊文字の誤認識率を15.2%から5.3%に低減。
パフォーマンス向上:ファーストパケット遅延が35%短縮され、リアルタイム操作の滑らかさが大幅に向上。
Fun-AudioGen-VD:包括的なサウンドデザイン
このモデルは「オーディオディレクター」として機能し、「キャラクター+環境」を統合したオーディオを生成します。
音声カスタマイズ:性別、年齢、アクセント、および「嗄れた声、低い声、低音」などの詳細な特性を指定可能。
感情とロールプレイ:カスタマーサービス担当者、放送局アナウンサー、子供などの役割をシミュレートし、「外見は平静だが内面は緊張している」といった複雑な状態も表現可能。
没入型環境:背景音(戦場の喧騒、カフェのざわめき)や空間効果(大聖堂のリバーブ、水中音響)を追加し、完全な空間シミュレーションを実現。
同義ラボは、これらのモデルが高品質な音声制作を民主化し、ポッドキャスティング、ゲーム開発、映画ポストプロダクションに強力なAI支援を提供すると指摘している。
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1





家






