阿里巴巴旗下通一推出Fun-CineForge:开源AI模型实现电影级语音合成
3月16日,阿里巴巴通一实验室正式发布并开源了电影级、多场景语音合成多模态模型Fun-CineForge。该模型解决了AI配音中的核心挑战,包括口型同步不匹配、情感表达不足以及多个角色间声音特征不一致等问题,同时引入了一种高质量的数据集构建方法。

在技术层面,Fun-CineForge开创了“时序模态”的概念。与仅关注文本或视觉信息的传统模型不同,它通过精准的时间戳控制,确保语音合成在精确的时间区间内进行。即使在角色被遮挡、镜头频繁切换或面部模糊等复杂的电影场景中,该模型仍能保持高度的视听同步性并严格遵循指令。
配套的开源数据集构建管道CineDub是另一项关键创新。Tongyi Lab 利用大型语言模型的链式推理能力,将原始电影素材自动转换为结构化数据,大幅减少了人工标注的需求。该流程实现了约 1% 的词错误率和仅 1.20% 的说话人分割错误率,为大型模型提供了极具竞争力的训练基础。

Fun-CineForge 现已发布于 GitHub、HuggingFace 及 ModelScope 社区,支持长达 30 秒的视频片段推理。该模型不仅在单人独白场景中表现出色,还为双人对话及多方对话场景提供了专业级支持。这一突破标志着人工智能语音技术正从基础的客户服务和助手角色,向高标准的动画与电影后期制作领域迈进。
GitHub:https://github.com/FunAudioLLM/FunCineForge
HuggingFace:https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope:https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
相关文章
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
相关专题推荐
评论 (1)
0/500
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
3月16日,阿里巴巴通一实验室正式发布并开源了电影级、多场景语音合成多模态模型Fun-CineForge。该模型解决了AI配音中的核心挑战,包括口型同步不匹配、情感表达不足以及多个角色间声音特征不一致等问题,同时引入了一种高质量的数据集构建方法。

在技术层面,Fun-CineForge开创了“时序模态”的概念。与仅关注文本或视觉信息的传统模型不同,它通过精准的时间戳控制,确保语音合成在精确的时间区间内进行。即使在角色被遮挡、镜头频繁切换或面部模糊等复杂的电影场景中,该模型仍能保持高度的视听同步性并严格遵循指令。
配套的开源数据集构建管道CineDub是另一项关键创新。Tongyi Lab 利用大型语言模型的链式推理能力,将原始电影素材自动转换为结构化数据,大幅减少了人工标注的需求。该流程实现了约 1% 的词错误率和仅 1.20% 的说话人分割错误率,为大型模型提供了极具竞争力的训练基础。

Fun-CineForge 现已发布于 GitHub、HuggingFace 及 ModelScope 社区,支持长达 30 秒的视频片段推理。该模型不仅在单人独白场景中表现出色,还为双人对话及多方对话场景提供了专业级支持。这一突破标志着人工智能语音技术正从基础的客户服务和助手角色,向高标准的动画与电影后期制作领域迈进。
GitHub:https://github.com/FunAudioLLM/FunCineForge
HuggingFace:https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope:https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.





首页






