微软的VibeVoice AI系列开源,支持长达90分钟的对话,GitHub星标数突破2.7万
微软最近开源了一套名为VibeVoice 的尖端语音 AI 模型系列,具备自动语音识别(ASR)和文本转语音(TTS)等功能。 得益于其强大的长音频处理能力、自然的多说话者对话生成以及实时低延迟的性能表现,该项目迅速吸引了开发者社区的关注,目前已在GitHub上收获了约27,000个星标。
VibeVoice作为基于MIT许可证的开源研究框架发布,支持本地部署且无需支付云订阅费用,旨在促进语音合成领域的协作与创新。该模型系列包含三个核心成员,分别针对传统语音AI中的特定挑战,例如长序列处理、说话人一致性以及自然流畅性。

VibeVoice-ASR-7B:强大的结构化语音转文本工具,支持处理长达 60 分钟的音频
VibeVoice-ASR-7B是一款统一的语音转文本模型,能够单次处理长达 60 分钟的音频文件,并直接输出结构化转录文本。其输出结果可识别说话者、提供精确的时间戳并详细记录语音内容,同时支持自定义热词以提高专有名词或技术术语的识别准确率。 该模型支持 50 多种语言,非常适合处理长篇会议录音和播客转录等复杂场景。
社区开发者已基于该模型开发出实用工具,例如适用于 macOS 和 Windows 的语音输入法Vibing。用户反馈显示其在速度和准确性方面表现优异,显著提升了日常语音输入效率。
VibeVoice-TTS-1.5B:支持多达 90 分钟、多说话人的富有表现力的语音生成
VibeVoice-TTS-1.5B是核心文本转语音模型,能够一次性生成长达 90 分钟的连续音频,并支持多达四位不同说话者进行自然的对话模拟。生成的语音富有表现力,听起来自然流畅,包含真实的停顿、重音和情感变化,非常适合播客、长篇叙述、有声读物或多角色对话。
与许多仅支持1-2名说话者的传统TTS模型不同,VibeVoice-TTS在长篇内容和多说话者一致性方面实现了重大突破。其架构将连续语音分词器(声学和语义)与低帧率(7.5Hz)相结合,显著提升了长序列的计算效率。
VibeVoice-Realtime-0.5B:延迟约 300 毫秒的实时语音合成
VibeVoice-Realtime-0.5B专为实时应用设计,支持流式文本输入,首次音频输出延迟约为300毫秒,同时仍能生成长达10分钟的音频。该模型特别适用于需要即时反馈的交互式应用,例如实时语音助手或直播配音。
此外,该项目引入了实验性的发音人支持功能,涵盖多语言语音及多种英语风格变体,为开发者提供了更丰富的定制选项。
AIbase 评测:微软将 VibeVoice 开源不仅降低了高性能语音 AI 的入门门槛,还提供了一套完整的本地部署解决方案。该项目曾因潜在的滥用风险而短暂下线,但在实施了音频水印和可听见的免责声明等安全措施后重新上线,体现了负责任的 AI 开发原则。开发者现在可以从 GitHub 和 Hugging Face 获取模型权重,并通过 Colab 等平台快速进行测试。
随着开源社区持续贡献(包括针对 Apple Silicon 的优化),VibeVoice 有望加速其在内容创作、辅助技术及语音交互领域的应用。感兴趣的开发者可访问微软官方项目页面进行进一步探索。
项目地址:https://github.com/microsoft/VibeVoice
相关文章
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
相关专题推荐
评论 (0)
0/500
微软最近开源了一套名为VibeVoice 的尖端语音 AI 模型系列,具备自动语音识别(ASR)和文本转语音(TTS)等功能。 得益于其强大的长音频处理能力、自然的多说话者对话生成以及实时低延迟的性能表现,该项目迅速吸引了开发者社区的关注,目前已在GitHub上收获了约27,000个星标。
VibeVoice作为基于MIT许可证的开源研究框架发布,支持本地部署且无需支付云订阅费用,旨在促进语音合成领域的协作与创新。该模型系列包含三个核心成员,分别针对传统语音AI中的特定挑战,例如长序列处理、说话人一致性以及自然流畅性。

VibeVoice-ASR-7B:强大的结构化语音转文本工具,支持处理长达 60 分钟的音频
VibeVoice-ASR-7B是一款统一的语音转文本模型,能够单次处理长达 60 分钟的音频文件,并直接输出结构化转录文本。其输出结果可识别说话者、提供精确的时间戳并详细记录语音内容,同时支持自定义热词以提高专有名词或技术术语的识别准确率。 该模型支持 50 多种语言,非常适合处理长篇会议录音和播客转录等复杂场景。
社区开发者已基于该模型开发出实用工具,例如适用于 macOS 和 Windows 的语音输入法Vibing。用户反馈显示其在速度和准确性方面表现优异,显著提升了日常语音输入效率。
VibeVoice-TTS-1.5B:支持多达 90 分钟、多说话人的富有表现力的语音生成
VibeVoice-TTS-1.5B是核心文本转语音模型,能够一次性生成长达 90 分钟的连续音频,并支持多达四位不同说话者进行自然的对话模拟。生成的语音富有表现力,听起来自然流畅,包含真实的停顿、重音和情感变化,非常适合播客、长篇叙述、有声读物或多角色对话。
与许多仅支持1-2名说话者的传统TTS模型不同,VibeVoice-TTS在长篇内容和多说话者一致性方面实现了重大突破。其架构将连续语音分词器(声学和语义)与低帧率(7.5Hz)相结合,显著提升了长序列的计算效率。
VibeVoice-Realtime-0.5B:延迟约 300 毫秒的实时语音合成
VibeVoice-Realtime-0.5B专为实时应用设计,支持流式文本输入,首次音频输出延迟约为300毫秒,同时仍能生成长达10分钟的音频。该模型特别适用于需要即时反馈的交互式应用,例如实时语音助手或直播配音。
此外,该项目引入了实验性的发音人支持功能,涵盖多语言语音及多种英语风格变体,为开发者提供了更丰富的定制选项。
AIbase 评测:微软将 VibeVoice 开源不仅降低了高性能语音 AI 的入门门槛,还提供了一套完整的本地部署解决方案。该项目曾因潜在的滥用风险而短暂下线,但在实施了音频水印和可听见的免责声明等安全措施后重新上线,体现了负责任的 AI 开发原则。开发者现在可以从 GitHub 和 Hugging Face 获取模型权重,并通过 Colab 等平台快速进行测试。
随着开源社区持续贡献(包括针对 Apple Silicon 的优化),VibeVoice 有望加速其在内容创作、辅助技术及语音交互领域的应用。感兴趣的开发者可访问微软官方项目页面进行进一步探索。
项目地址:https://github.com/microsoft/VibeVoice
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强





首页






