オプション
速報
コンテンツ
GaryPerez
GaryPerez
2026年9月16日

科大讯飛は、国内の計算資源のみを用いて学習された音声基盤モデル「Spark-Audio-1.0-Preview」をリリースした。従来の音声からテキストへの変換を行うカスケード型システムとは異なり、本モデルは音声を直接理解し、意味、感情、環境音などを捉える。0.65Bの音声エンコーダと30B-A3BのLLMで構築されており、99言語および202つの方言に対応している。ノイズの多いシナリオにおいて競合モデルを上回る性能を発揮し、中国語-英語認識においてSOTAを達成している。本モデルは感情分析や複雑なQ&Aなどのタスクを可能にし、文字起こしから真の音声理解への転換を示している。APIアクセスは、今後は科大讯飛オープンプラットフォームを通じて提供される予定である。

科大讯飛は、国内の計算資源のみを用いて学習された音声基盤モデル「Spark-Audio-1.0-Preview」をリリースした。従来の音声からテキストへの変換を行うカスケード型システムとは異なり、本モデルは音声を直接理解し、意味、感情、環境音などを捉える。0.65Bの音声エンコーダと30B-A3BのLLMで構築されており、99言語および202つの方言に対応している。ノイズの多いシナリオにおいて競合モデルを上回る性能を発揮し、中国語-英語認識においてSOTAを達成している。本モデルは感情分析や複雑なQ&Aなどのタスクを可能にし、文字起こしから真の音声理解への転換を示している。APIアクセスは、今後は科大讯飛オープンプラットフォームを通じて提供される予定である。
コメント (0)
0/300
OR