阿里巴巴通一实验室开源Fun-CineForge,攻克多声部配音难题
在电影和动画等要求极高的制作中,传统的AI配音技术往往难以胜任,因为精准捕捉细腻的情感起伏和完美同步的口型动作至关重要。为解决这一行业核心难题,同益实验室正式发布了开创性的电影级多场景多模态配音模型——Fun-CineForge ,并将其开源。
弥合视听鸿沟:实现无缝同步的四大支柱框架
Fun-CineForge 并非简单依赖基础的文本转语音技术,而是经过精心设计,旨在精通专业配音的四大关键维度:
口型同步:确保合成语音与屏幕角色嘴型以极高精度精准对齐。
情感表达:通过分析面部线索和上下文指令,为声音注入真实的人类情感。
声音一致性:在复杂的多角色对话场景中,为特定角色保持稳定且可辨识的声线特征。
时间对齐:即使说话者不在画面中或部分被遮挡,也能实现毫秒级精度的对话插入。
核心创新:开创性的“时间模态”与高保真数据集
Fun-CineForge的技术飞跃源于其独特的“数据+模型”协同设计理念:

CineDub 高质量数据集:同义实验室还开源了自动化的 CineDub 数据集构建管道。该管道利用“思维链”错误校正机制,将中文和英文文本的转录错误率降低至约 1%–2%,并将说话人识别错误率降至低至 1.2%。
四模态融合架构:该模型开创性地整合了“时间模态”,将视觉输入(口型与表情)、文本(对话与情感语境)及音频(参考语音)进行联合建模。这种融合技术使得在包括无面部可见场景在内的复杂场景中,也能实现精准的同步。
卓越表现:开创真实多角色对话配音
基准测试结果表明,Fun-CineForge 在关键指标上(包括词错误率(WER/CER)、口型同步度(LSE-C/D)和语音相似度)均显著优于 DeepDubber-V1 等基线模型。其里程碑式的成就在于首次实现了对二重唱和多人对话的精准处理,并在长达 30 秒的视频片段中展现出卓越的鲁棒性。
GitHub:https://github.com/FunAudioLLM/FunCineForge
HuggingFace:https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope:https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
相关文章
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
相关专题推荐
评论 (0)
0/500
在电影和动画等要求极高的制作中,传统的AI配音技术往往难以胜任,因为精准捕捉细腻的情感起伏和完美同步的口型动作至关重要。为解决这一行业核心难题,同益实验室正式发布了开创性的电影级多场景多模态配音模型——
弥合视听鸿沟:实现无缝同步的四大支柱框架
Fun-CineForge 并非简单依赖基础的文本转语音技术,而是经过精心设计,旨在精通专业配音的四大关键维度:
口型同步:确保合成语音与屏幕角色嘴型以极高精度精准对齐。
情感表达:通过分析面部线索和上下文指令,为声音注入真实的人类情感。
声音一致性:在复杂的多角色对话场景中,为特定角色保持稳定且可辨识的声线特征。
时间对齐:即使说话者不在画面中或部分被遮挡,也能实现毫秒级精度的对话插入。
核心创新:开创性的“时间模态”与高保真数据集
Fun-CineForge的技术飞跃源于其独特的“数据+模型”协同设计理念:

CineDub 高质量数据集:同义实验室还开源了自动化的 CineDub 数据集构建管道。该管道利用“思维链”错误校正机制,将中文和英文文本的转录错误率降低至约 1%–2%,并将说话人识别错误率降至低至 1.2%。
四模态融合架构:该模型开创性地整合了“时间模态”,将视觉输入(口型与表情)、文本(对话与情感语境)及音频(参考语音)进行联合建模。这种融合技术使得在包括无面部可见场景在内的复杂场景中,也能实现精准的同步。
卓越表现:开创真实多角色对话配音
基准测试结果表明,Fun-CineForge 在关键指标上(包括词错误率(WER/CER)、口型同步度(LSE-C/D)和语音相似度)均显著优于 DeepDubber-V1 等基线模型。其里程碑式的成就在于首次实现了对二重唱和多人对话的精准处理,并在长达 30 秒的视频片段中展现出卓越的鲁棒性。
GitHub:https://github.com/FunAudioLLM/FunCineForge
HuggingFace:https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope:https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业





首页






