アリババのQwenは「Qwen-Audio-3.1」をリリースし、音声認識、合成、リアルタイム対話、生成を網羅する5つのモデルを導入しました。今回のアップデートにより価格が70~95%引き下げられ、音声技術が格段に利用しやすくなりました。 主な機能には、文脈認識型音声認識(ASR)とネイティブな文字起こし補正、30の言語と16の中国方言への対応、超低遅延などが含まれます。「TTS-Next」モデルは、音声、効果音、環境音を組み合わせた汎用的な音声生成を可能にします。 リアルタイム対話機能は、感情認識やツール連携を備えた全二重会話をサポートしています。この包括的なスイートにより、コストを大幅に削減しつつ、精度、多言語対応、およびクリエイティブな音声制作能力を向上させます。





家
