科大訊飛星火、30B MoE を搭載した 0.65B エンコーダ音声モデルを公開、完全な国内計算資源を基盤に構築
iFLYTEKは、国内の計算インフラのみを基盤として構築された音声基盤大規模モデル「Spark-Audio-1.0-Preview」をリリースしました。
従来、大規模モデルを用いた音声処理は、まず音声をテキストに変換し、その後モデルに渡して分析するというカスケード方式に依存していました。このアプローチには2つの大きな欠点があります。1つ目は情報の損失です。テキストではトーン、感情、背景音などが捉えられず、文脈が不完全になります。2つ目は分断されたワークフローです。文字起こし、話者識別、翻訳といった独立したモジュールが直列で動作するため、エラーの蓄積、遅延、そしてユーザー体験の低下を招きます。

文字起こしを超えて:直接の音声理解
この音声基盤モデルは、単純な文字起こしを超えて、音声を直接解釈します。人間の声、環境音、音楽を区別でき、音声内の意味、感情、文脈の手がかりを把握します。
初期版のSpark-Audio-1.0-Previewは、0.65Bの音声エンコーダー(Dense構造)と30B-A3Bの大規模言語モデル(MoE構造)を特徴としています。完全な国内計算クラスターを用いて、1300万時間の音声データと膨大なテキストデータで学習されたこのモデルは、テキストと音声の両方の入力を接受します。音声文字起こし、多言語翻訳、多方言認識、環境音識別、話者認識、感情分析、複雑な音声Q&Aなどのタスクをサポートし、機械が「はっきりと聞く」から「理解する」へ移行することを可能にします。iFLYTEKのSpark大規模モデルの「1+N」システムと同様に、ユーザーはこの音声基盤モデルをファインチューニングして、音声認識、リアルタイム翻訳、対話型音声アプリケーション向けの専用システムを作成できます。
99の言語と202の方言をサポートし、複雑なシナリオで優れたパフォーマンスを発揮
公式データによると、Spark-Audio-1.0-Previewは、高ノイズレベルや小声での発話といった困難な現実世界のシナリオを含む、さまざまな音声評価タスクにおいて、競合他社と同等またはそれ以上のパフォーマンスを示しています。そのパフォーマンスは、より大規模なクローズドソースの音声基盤モデルとも密接に一致しています。
このモデルは99の言語と202の方言の認識をサポートしています。同規模のQwen3.5-omni-flash(35B-A3B)と比較して、多言語および多方言の音声認識において優れた平均パフォーマンスを示し、大幅に大規模なQwen3.5-omni-plusと同等のパフォーマンスを達成しています。中国語-英語、多言語、多方言の音声認識に関するFleurs、Kespeech、LibriSpeechなどの評価では、Gemini-3.1 Proを上回り、Fleursの中国語テストセットでSOTAを達成しています。
iFLYTEKは、このバージョンが一般的な知識、数学、コーディングタスクにおいて強力なパフォーマンスを維持している一方で、指示のフォロー、対話、音声理解の分野には改善の余地があることを認めています。今後のアップデートでは、これらの領域の強化に焦点を当てます。Spark-Audio-1.0-Previewは現在、一般公開された体験版として利用可能であり、APIアクセスはまもなくiFLYTEK Open Platformでリリースされる予定です。
関連記事
Zoho、企業のAIエージェント導入を支援
市場はAI駆動型エージェントへと急速に進化しているZohoは、AIが飛躍的に進歩していることを強調し、企業がこれに適応し、業務の見直しを行うことが不可欠であると指摘しているAIをめぐる熱狂は、衰える気配を見せていません。最新動向に追いつくには多大な努力が必要です。モデルの大型化、エージェントの性能向上、そして「乗り遅れることへの強い不安」が相まって、すべての経営者は、AIを日常のワークフローに組み
Suno、高度なトラック分離と車載サポートを備えた大規模アップデートを公開
Sunoは、AI音楽生成プラットフォームに大幅なアップデートを導入し、Webおよびモバイルの両方の体験を強化して、制作の簡素化と使いやすさの向上を図っています。このプラットフォームは、AI駆動の音楽制作において、よりアクセスしやすく効率的な段階へと進歩しており、プロフェッショナルなオーディオツールを運転などの日常的なシナリオと統合しています。高度なステム分離このアップデートの主要な見どころは、ボーカル、ドラム、ベース、楽器を個別のトラックに分離する高度なステム分離機能です。この機能により、ミュー
Cohere社のジョエル・ピノーが語る「ソブリンAI」と企業セキュリティ
Cohereが委託したIDCの調査では、ソブリンAIについて検証されており、最高AI責任者(CIO)のジョエル・ピノー氏が、企業のクラウドセキュリティとデータガバナンスに向けた重要な戦略を概説している。AI企業Cohereが委託したIDCのレポート『2026年のソブリンAI導入状況(The State of Sovereign AI Adoption in 2026)』によると、ビジネスリーダーの
関連特集おすすめ
コメント (0)
0/500
iFLYTEKは、国内の計算インフラのみを基盤として構築された音声基盤大規模モデル「Spark-Audio-1.0-Preview」をリリースしました。
従来、大規模モデルを用いた音声処理は、まず音声をテキストに変換し、その後モデルに渡して分析するというカスケード方式に依存していました。このアプローチには2つの大きな欠点があります。1つ目は情報の損失です。テキストではトーン、感情、背景音などが捉えられず、文脈が不完全になります。2つ目は分断されたワークフローです。文字起こし、話者識別、翻訳といった独立したモジュールが直列で動作するため、エラーの蓄積、遅延、そしてユーザー体験の低下を招きます。

文字起こしを超えて:直接の音声理解
この音声基盤モデルは、単純な文字起こしを超えて、音声を直接解釈します。人間の声、環境音、音楽を区別でき、音声内の意味、感情、文脈の手がかりを把握します。
初期版のSpark-Audio-1.0-Previewは、0.65Bの音声エンコーダー(Dense構造)と30B-A3Bの大規模言語モデル(MoE構造)を特徴としています。完全な国内計算クラスターを用いて、1300万時間の音声データと膨大なテキストデータで学習されたこのモデルは、テキストと音声の両方の入力を接受します。音声文字起こし、多言語翻訳、多方言認識、環境音識別、話者認識、感情分析、複雑な音声Q&Aなどのタスクをサポートし、機械が「はっきりと聞く」から「理解する」へ移行することを可能にします。iFLYTEKのSpark大規模モデルの「1+N」システムと同様に、ユーザーはこの音声基盤モデルをファインチューニングして、音声認識、リアルタイム翻訳、対話型音声アプリケーション向けの専用システムを作成できます。
99の言語と202の方言をサポートし、複雑なシナリオで優れたパフォーマンスを発揮
公式データによると、Spark-Audio-1.0-Previewは、高ノイズレベルや小声での発話といった困難な現実世界のシナリオを含む、さまざまな音声評価タスクにおいて、競合他社と同等またはそれ以上のパフォーマンスを示しています。そのパフォーマンスは、より大規模なクローズドソースの音声基盤モデルとも密接に一致しています。
このモデルは99の言語と202の方言の認識をサポートしています。同規模のQwen3.5-omni-flash(35B-A3B)と比較して、多言語および多方言の音声認識において優れた平均パフォーマンスを示し、大幅に大規模なQwen3.5-omni-plusと同等のパフォーマンスを達成しています。中国語-英語、多言語、多方言の音声認識に関するFleurs、Kespeech、LibriSpeechなどの評価では、Gemini-3.1 Proを上回り、Fleursの中国語テストセットでSOTAを達成しています。
iFLYTEKは、このバージョンが一般的な知識、数学、コーディングタスクにおいて強力なパフォーマンスを維持している一方で、指示のフォロー、対話、音声理解の分野には改善の余地があることを認めています。今後のアップデートでは、これらの領域の強化に焦点を当てます。Spark-Audio-1.0-Previewは現在、一般公開された体験版として利用可能であり、APIアクセスはまもなくiFLYTEK Open Platformでリリースされる予定です。
Zoho、企業のAIエージェント導入を支援
市場はAI駆動型エージェントへと急速に進化しているZohoは、AIが飛躍的に進歩していることを強調し、企業がこれに適応し、業務の見直しを行うことが不可欠であると指摘しているAIをめぐる熱狂は、衰える気配を見せていません。最新動向に追いつくには多大な努力が必要です。モデルの大型化、エージェントの性能向上、そして「乗り遅れることへの強い不安」が相まって、すべての経営者は、AIを日常のワークフローに組み
Suno、高度なトラック分離と車載サポートを備えた大規模アップデートを公開
Sunoは、AI音楽生成プラットフォームに大幅なアップデートを導入し、Webおよびモバイルの両方の体験を強化して、制作の簡素化と使いやすさの向上を図っています。このプラットフォームは、AI駆動の音楽制作において、よりアクセスしやすく効率的な段階へと進歩しており、プロフェッショナルなオーディオツールを運転などの日常的なシナリオと統合しています。高度なステム分離このアップデートの主要な見どころは、ボーカル、ドラム、ベース、楽器を個別のトラックに分離する高度なステム分離機能です。この機能により、ミュー
Cohere社のジョエル・ピノーが語る「ソブリンAI」と企業セキュリティ
Cohereが委託したIDCの調査では、ソブリンAIについて検証されており、最高AI責任者(CIO)のジョエル・ピノー氏が、企業のクラウドセキュリティとデータガバナンスに向けた重要な戦略を概説している。AI企業Cohereが委託したIDCのレポート『2026年のソブリンAI導入状況(The State of Sovereign AI Adoption in 2026)』によると、ビジネスリーダーの





家






