科大讯飞星火发布0.65B编码器语音模型,搭载30B混合专家架构,基于完全国产算力构建
科大讯飞推出了基于纯国产算力基础设施构建的语音基础大模型 Spark-Audio-1.0-Preview。
此前,基于大模型的音频处理主要依赖级联方式:先将语音转换为文本,再将其传递给模型进行分析。这种方法存在两大主要缺陷:一是信息丢失,因为文本无法捕捉语调、情感和背景声音,导致上下文不完整;二是工作流碎片化,转录、说话人识别和翻译等独立模块串行运行,导致误差累积、延迟增加以及用户体验不佳。

超越转录:直接语音理解
该语音基础大模型超越了简单的转录功能,能够直接解读音频。它可以区分人声、环境噪音和音乐,同时把握声音中的语义、情感和上下文线索。
初版 Spark-Audio-1.0-Preview 包含一个 0.65B 参数的音频编码器(密集结构)和一个 30B-A3B 参数的大语言模型(MoE 结构)。该模型基于完全国产算力集群,使用 1300 万小时的音频和大量文本数据进行训练,支持文本和音频双重输入。它支持语音转录、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析和复杂音频问答等任务,使机器从“听得清”迈向“听得懂”。与科大讯飞星火大模型的“1+N”系统类似,用户可对该语音基础模型进行微调,构建针对语音识别、实时翻译和交互式语音应用的专用系统。
支持 99 种语言和 202 种方言,在复杂场景中表现卓越
根据官方数据,Spark-Audio-1.0-Preview 在各种语音评估任务中的表现与竞争对手相当或更优,特别是在高噪音和轻声说话等具有挑战性的真实场景中。其性能也与更大规模的闭源语音基础大模型高度一致。
该模型支持识别 99 种语言和 202 种方言。在类似规模的 Qwen3.5-omni-flash(35B-A3B)的多语言和多方言语音识别平均表现中,它展现出更优的性能,并达到了显著更大规模的 Qwen3.5-omni-plus 的性能水平。在 Fleurs、Kespeech 和 LibriSpeech 等针对中英、多语言和多方言语音识别的评估中,它优于 Gemini-3.1 Pro,并在 Fleurs 中文测试集上取得了 SOTA(当前最佳)成绩。
科大讯飞承认,虽然该版本在通用知识、数学和代码任务中保持了强劲性能,但在指令遵循、对话和音频理解方面仍有提升空间。未来的更新将重点加强这些领域。Spark-Audio-1.0-Preview 现已开放公众体验,API 接口即将在科大讯飞开放平台上线。
相关文章
Zoho 助力企业采用人工智能客服机器人
市场正迅速向人工智能驱动的智能代理转型Zoho强调,人工智能正在呈指数级发展,企业必须适应这一趋势并重新思考其运营模式围绕人工智能的热潮丝毫没有减弱的迹象。要跟上最新发展,需要付出巨大的努力。随着模型规模的扩大、智能代理功能的增强,以及人们对“错失良机”的强烈担忧,每一位企业领导者都感受到必须设法将人工智能融入日常工作流程的压力。麦肯锡公司的一项研究显示,多达62%的受访者对AI智能代理表现出浓厚
Suno 发布重大更新,推出高级音轨分离与车载支持功能
Suno 已对其 AI 音乐生成平台推出重大更新,优化了网页和移动端的体验,以简化创作流程并提升可用性。该平台正朝着更加便捷高效的 AI 音乐制作阶段迈进,将专业音频工具与驾驶等日常场景相结合。增强的音轨分离功能此次更新的一个主要亮点是高级音轨分离功能,该功能可将人声、鼓点、贝斯和乐器分离到独立的音轨中。这一能力使音乐人能够轻松获取高质量的分轨素材,用于混音或二次创作,显著降低了专业后期制作的门槛。分轨导出为 MIDI 文件用户现在可以直接将分离后的音轨导出为 MIDI 文件。这一功能对于需要在
Cohere公司的乔埃尔·皮诺谈主权人工智能与企业安全
由Cohere委托IDC开展的一项研究探讨了主权人工智能,首席人工智能官乔埃尔·皮诺(Joëlle Pineau)在报告中概述了企业云安全和数据治理的核心策略。根据IDC受人工智能公司Cohere委托发布的报告《2026年主权人工智能采用现状》,三分之一的商业领袖难以用自己的话定义“主权人工智能”。加拿大人工智能公司Cohere致力于开发专为企业应用设计的大型语言模型(LLMs)和自然语言处理工具
相关专题推荐
评论 (0)
0/500
科大讯飞推出了基于纯国产算力基础设施构建的语音基础大模型 Spark-Audio-1.0-Preview。
此前,基于大模型的音频处理主要依赖级联方式:先将语音转换为文本,再将其传递给模型进行分析。这种方法存在两大主要缺陷:一是信息丢失,因为文本无法捕捉语调、情感和背景声音,导致上下文不完整;二是工作流碎片化,转录、说话人识别和翻译等独立模块串行运行,导致误差累积、延迟增加以及用户体验不佳。

超越转录:直接语音理解
该语音基础大模型超越了简单的转录功能,能够直接解读音频。它可以区分人声、环境噪音和音乐,同时把握声音中的语义、情感和上下文线索。
初版 Spark-Audio-1.0-Preview 包含一个 0.65B 参数的音频编码器(密集结构)和一个 30B-A3B 参数的大语言模型(MoE 结构)。该模型基于完全国产算力集群,使用 1300 万小时的音频和大量文本数据进行训练,支持文本和音频双重输入。它支持语音转录、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析和复杂音频问答等任务,使机器从“听得清”迈向“听得懂”。与科大讯飞星火大模型的“1+N”系统类似,用户可对该语音基础模型进行微调,构建针对语音识别、实时翻译和交互式语音应用的专用系统。
支持 99 种语言和 202 种方言,在复杂场景中表现卓越
根据官方数据,Spark-Audio-1.0-Preview 在各种语音评估任务中的表现与竞争对手相当或更优,特别是在高噪音和轻声说话等具有挑战性的真实场景中。其性能也与更大规模的闭源语音基础大模型高度一致。
该模型支持识别 99 种语言和 202 种方言。在类似规模的 Qwen3.5-omni-flash(35B-A3B)的多语言和多方言语音识别平均表现中,它展现出更优的性能,并达到了显著更大规模的 Qwen3.5-omni-plus 的性能水平。在 Fleurs、Kespeech 和 LibriSpeech 等针对中英、多语言和多方言语音识别的评估中,它优于 Gemini-3.1 Pro,并在 Fleurs 中文测试集上取得了 SOTA(当前最佳)成绩。
科大讯飞承认,虽然该版本在通用知识、数学和代码任务中保持了强劲性能,但在指令遵循、对话和音频理解方面仍有提升空间。未来的更新将重点加强这些领域。Spark-Audio-1.0-Preview 现已开放公众体验,API 接口即将在科大讯飞开放平台上线。
Zoho 助力企业采用人工智能客服机器人
市场正迅速向人工智能驱动的智能代理转型Zoho强调,人工智能正在呈指数级发展,企业必须适应这一趋势并重新思考其运营模式围绕人工智能的热潮丝毫没有减弱的迹象。要跟上最新发展,需要付出巨大的努力。随着模型规模的扩大、智能代理功能的增强,以及人们对“错失良机”的强烈担忧,每一位企业领导者都感受到必须设法将人工智能融入日常工作流程的压力。麦肯锡公司的一项研究显示,多达62%的受访者对AI智能代理表现出浓厚
Suno 发布重大更新,推出高级音轨分离与车载支持功能
Suno 已对其 AI 音乐生成平台推出重大更新,优化了网页和移动端的体验,以简化创作流程并提升可用性。该平台正朝着更加便捷高效的 AI 音乐制作阶段迈进,将专业音频工具与驾驶等日常场景相结合。增强的音轨分离功能此次更新的一个主要亮点是高级音轨分离功能,该功能可将人声、鼓点、贝斯和乐器分离到独立的音轨中。这一能力使音乐人能够轻松获取高质量的分轨素材,用于混音或二次创作,显著降低了专业后期制作的门槛。分轨导出为 MIDI 文件用户现在可以直接将分离后的音轨导出为 MIDI 文件。这一功能对于需要在
Cohere公司的乔埃尔·皮诺谈主权人工智能与企业安全
由Cohere委托IDC开展的一项研究探讨了主权人工智能,首席人工智能官乔埃尔·皮诺(Joëlle Pineau)在报告中概述了企业云安全和数据治理的核心策略。根据IDC受人工智能公司Cohere委托发布的报告《2026年主权人工智能采用现状》,三分之一的商业领袖难以用自己的话定义“主权人工智能”。加拿大人工智能公司Cohere致力于开发专为企业应用设计的大型语言模型(LLMs)和自然语言处理工具





首页






