同益实验室推出PrismAudio,实现双向音视频分离
在人工智能视频生成技术迅速发展的时代,画面与音频之间的脱节——通常表现为静音或音画不同步——仍然是影响观众沉浸感的一大障碍。 为应对这一挑战,阿里巴巴的通一实验室推出了PrismAudio——一个创新的视频转音频框架。这项研究已被顶级人工智能会议ICLR 2026录用,致力于自动将视频内容与精准的环境音效进行同步。

生成前的推理:“思维链”实现音频掌控
传统的音频生成模型通常基于“直觉”运作,经常产生脱节的结果——例如马蹄声听起来像鸟鸣,或者音频滞后于视觉动作。PrismAudio 的独特之处在于采用了“先规划,再生成”的方法。
“思维链”分解过程:在生成音频之前,模型会逐帧分析视频:识别场景元素、确定声音起始时间、评估音频特征(如清晰度或深度),并定位声音在空间中的来源。
多维度评估:为确保高质量输出,开发团队整合了强化学习技术,利用四个“虚拟评估员”从语义一致性、时间同步性、美学质量和空间准确性四个维度对结果进行评分。这种多维度的反馈循环解决了此前模型常出现的“只优化某一方面而忽视其他方面”的问题。
轻量且高效:0.6 秒内处理 9 秒视频
除了准确性之外,PrismAudio 还具备卓越的速度。借助其专有的Fast-GRPO训练算法,该模型在保持运行效率的同时,实现了显著的性能提升:
紧凑架构,成效显著:该模型仅含 5.18 亿个参数,远小于同类系统——后者通常需要数百亿个参数。
响应迅捷:为一段9秒的视频片段生成高质量音频仅需0.63秒,性能已接近实时水平。
行业视角:真实环境音效的崛起
PrismAudio的推出不仅为电影后期制作和短视频创作提供了一款强大的自动化工具,还为多对象生成开辟了新的路径。随着AI在平衡音频质感与空间定位方面的能力不断提升,未来的视频制作将越来越接近实现真正的“所见即所闻”的保真度。
论文链接:arXiv:2511.18833
开源链接:https://prismaudio-project.github.io/
相关文章
Neros Technologies 获得 2.5 亿美元融资,计划到 2026 年部署防御无人机
Neros Archer:一款专为模块化有效载荷和弹性通信链路设计的FPV无人机。| 来源:NerosNeros Inc.已完成2.5亿美元的C轮融资,将该国防无人机承包商的估值提升至25亿美元。“这笔最新的资金注入加速了Neros向多能力无人机制造商的转型,”联合创始人兼首席执行官Soren Monroe-Anderson表示。“虽然我们每年生产100万架无人机的目标保持不变,但我们能够支持的平台范围和任务类型正在迅速扩展。自去年11月上一轮融资以来,核心业务增长迅猛。这笔资金使我们能够以决定
宇树科技,A股首个人形机器人概念股,定于8月19日上市,估值约610亿元人民币
定于8月19日在科创板上市的越数科技,将以每股150.80元的价格上市,发行后市值约为609.93亿元。其市盈率高达219.23,估值显著高于行业平均水平。该公司计划发行4044.64万股新股,占发行后总股本的10%,预计募集资金约60.99亿元。网上发行中签率仅为0.01809759%,成为科创板历史上竞争最为激烈的IPO之一。财务预测显示,2025年营收约为17亿元,扣除非经常性损益后归属于股东的净利润为5.91亿元。按发行后市值计算,静态市盈率超过100倍,反映出市场对其高增长的预期。
阿里玄元M890 Ultra节点现已兼容Qwen3.8,可在百炼平台进行推理
阿里云于7月23日确认,其“玄武M890”超级节点已成功集成最新旗舰大模型Qwen3.8,使其在阿里云百炼平台上线模型推理服务。这一里程碑事件确立了玄武M890作为中国首个支持万亿参数以上大模型稳定运行的超级节点系统,标志着国内大模型计算调度软硬件协同方面取得重大突破。Qwen3.8是阿里云最新推出的超大规模旗舰模型,拥有高达2.4万亿参数。传统AI集群在处理高吞吐、低延迟和高并发推理需求时,常因节点间通信带宽受限而面临性能瓶颈。为确保如此规模下的稳定高效运行,模型参数通常需拆分并分布在数十甚
相关专题推荐
评论 (0)
0/500
在人工智能视频生成技术迅速发展的时代,画面与音频之间的脱节——通常表现为静音或音画不同步——仍然是影响观众沉浸感的一大障碍。 为应对这一挑战,阿里巴巴的通一实验室推出了PrismAudio——一个创新的视频转音频框架。这项研究已被顶级人工智能会议ICLR 2026录用,致力于自动将视频内容与精准的环境音效进行同步。

生成前的推理:“思维链”实现音频掌控
传统的音频生成模型通常基于“直觉”运作,经常产生脱节的结果——例如马蹄声听起来像鸟鸣,或者音频滞后于视觉动作。PrismAudio 的独特之处在于采用了“先规划,再生成”的方法。
“思维链”分解过程:在生成音频之前,模型会逐帧分析视频:识别场景元素、确定声音起始时间、评估音频特征(如清晰度或深度),并定位声音在空间中的来源。
多维度评估:为确保高质量输出,开发团队整合了强化学习技术,利用四个“虚拟评估员”从语义一致性、时间同步性、美学质量和空间准确性四个维度对结果进行评分。这种多维度的反馈循环解决了此前模型常出现的“只优化某一方面而忽视其他方面”的问题。
轻量且高效:0.6 秒内处理 9 秒视频
除了准确性之外,PrismAudio 还具备卓越的速度。借助其专有的Fast-GRPO训练算法,该模型在保持运行效率的同时,实现了显著的性能提升:
紧凑架构,成效显著:该模型仅含 5.18 亿个参数,远小于同类系统——后者通常需要数百亿个参数。
响应迅捷:为一段9秒的视频片段生成高质量音频仅需0.63秒,性能已接近实时水平。
行业视角:真实环境音效的崛起
PrismAudio的推出不仅为电影后期制作和短视频创作提供了一款强大的自动化工具,还为多对象生成开辟了新的路径。随着AI在平衡音频质感与空间定位方面的能力不断提升,未来的视频制作将越来越接近实现真正的“所见即所闻”的保真度。
论文链接:arXiv:2511.18833
开源链接:https://prismaudio-project.github.io/
宇树科技,A股首个人形机器人概念股,定于8月19日上市,估值约610亿元人民币
定于8月19日在科创板上市的越数科技,将以每股150.80元的价格上市,发行后市值约为609.93亿元。其市盈率高达219.23,估值显著高于行业平均水平。该公司计划发行4044.64万股新股,占发行后总股本的10%,预计募集资金约60.99亿元。网上发行中签率仅为0.01809759%,成为科创板历史上竞争最为激烈的IPO之一。财务预测显示,2025年营收约为17亿元,扣除非经常性损益后归属于股东的净利润为5.91亿元。按发行后市值计算,静态市盈率超过100倍,反映出市场对其高增长的预期。
阿里玄元M890 Ultra节点现已兼容Qwen3.8,可在百炼平台进行推理
阿里云于7月23日确认,其“玄武M890”超级节点已成功集成最新旗舰大模型Qwen3.8,使其在阿里云百炼平台上线模型推理服务。这一里程碑事件确立了玄武M890作为中国首个支持万亿参数以上大模型稳定运行的超级节点系统,标志着国内大模型计算调度软硬件协同方面取得重大突破。Qwen3.8是阿里云最新推出的超大规模旗舰模型,拥有高达2.4万亿参数。传统AI集群在处理高吞吐、低延迟和高并发推理需求时,常因节点间通信带宽受限而面临性能瓶颈。为确保如此规模下的稳定高效运行,模型参数通常需拆分并分布在数十甚





首页






