美团开源 LongCat-Video-Avatar 1.5,性能优于主流闭源模型
美团LongCat大模型团队正式开源了商业级数字人视频生成模型LongCat-Video-Avatar 1.5。该版本标志着模型已从开源最先进技术全面转向实际商业部署,在口型同步、物理真实感、长视频稳定性、多人互动以及高效推理等方面均有重大提升。
三大关键升级,攻克商业化难关
为了使数字人能够在各种实际应用场景中稳定运行,LongCat-Video-Avatar 1.5 通过三项全面改进,解决了传统数字人视频中存在的抖动、失真和高延迟等顽固问题:
商用级音频编码升级
该模型的音频特征提取编码器已从 Wav2Vec2 升级至Whisper-large。 凭借更多的参数和更丰富的多语言先验知识,它现在能够捕捉细微的音素变化和语调节奏。这不仅提升了长句、快速语速和演唱等复杂音频的唇形同步效果,还实现了面部表情、头部动作与语音之间的自然协调——从而显著减少了长视频中的帧跳过和身份漂移现象。
通过多阶段数据增强实现强大的开放域泛化能力
为确保在真实人物、虚拟偶像、动漫角色和动物等不同主体上都能保持稳定的性能,研究团队开发了一条集离线标注和在线验证于一体的多阶段数据处理管道,并引入了三种针对性的增强数据类型:
多人物数据:利用主动说话人检测技术,消除多人物场景中的视听歧义,准确区分说话人与听众。
静默数据:通过筛选无语音的视频,模型可学习静默状态下的自然微表情,从而避免非说话角色出现不必要的嘴部动作。
情绪数据:结合帧级情绪识别过滤,该数据整合了情绪变化,帮助模型把握言语与面部表情之间的深层关联。
基于 GRPO 的手部对齐与时间连续性
针对电商直播和产品演示等双手频繁入镜的应用场景,该模型引入了GRPO(Human Preference Alignment),该技术将奖励信号细化至帧级别,并增加了首帧手部检测机制。这大大减少了手部变形、局部结构坍塌和动作不一致等常见问题。

推理速度提升15倍:消除高昂的计算需求
成本是商业部署的另一个关键因素。LongCat-Video-Avatar 1.5 采用了DMD(分布式匹配蒸馏)技术,将原本 50 步的生成过程压缩至仅8 步。 此外,团队将传统的三模型并行架构替换为单个共享基础模型加多个 LoRA 适配器,从而大幅降低了 VRAM 占用量。
在实际测试中,该模型的推理速度提升了约15倍 ,仅需约一分钟即可生成一段10秒的视频。
基准评估:超越业界顶尖模型
通过 EvalTalker 基准测试,770 名评估员和 10 名领域专家对来自新闻、教育和娱乐等复杂领域的视频进行了结构化质量分析。结果表明,LongCat-Video-Avatar 1.5 在多项关键指标上表现卓越:
用户偏好胜率:其胜率比Kling Avatar2.0高出65.9%,比OmniHuman-1.5高出61. 1%,比HeyGen高出54.3%。
单人及多人场景评分:单人场景评分达到3.336,远高于HeyGen等竞争对手;多人场景评分为2.730,显著优于InfiniteTalk(2.339)。
视频稳定性:主体变形率仅为23.1%,背景变形率仅为9.4%;帧丢失率低至0.8%,在所有对比模型中表现最佳。
音视频协调性:面部与身体不同步率降至5.1%,口型不同步率降至29.8%,两项指标均超越了传统商用系统。
美团LongCat大模型团队表示,开源LongCat-Video-Avatar 1.5不仅仅是一次版本更新,更是向全球开发者和创作者社区发出的邀请。 他们希望该模型能成为一个可验证、可改进的技术基础,助力推动数字人视频应用在现实世界中的边界拓展。
开源链接:
Github:https://github.com/meituan-longcat/LongCat-Video
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技术报告:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
项目页面:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
相关文章
Preply的“独角兽”地位体现了乌克兰的韧性
语言学习平台Preply在完成1.5亿美元D轮融资后,估值达到12亿美元,这标志着这家成立14年的公司迈出了重要一步。其现有投资者包括Horizon Capital、Hoxton Ventures、Owl Ventures和Techstars Berlin。自2013年开始为语言学习者与辅导老师搭建桥梁以来,Preply已连续12个月实现息税折旧及摊销前利润(EBITDA)盈利。与此同时,该公司加
王兴兴:具身人工智能有望在2至3年内实现类似ChatGPT的突破
BotSchool创始人兼首席执行官王兴兴在2026年世界机器人大会(WRC2026)主论坛上的演讲中强调,具身智能正接近一个类似于“ChatGPT时刻”的产业转折点。 他预测,相关突破最快可能在两到三年内实现,而在应用普及较慢的情景下,则可能需要五到十年时间。就在王兴兴发表演讲的前一天,BotSchool刚刚在上海证券交易所科创板上市,其股票在上市首日收盘价较发行价上涨了460%。 王强调,具身
微软推出新编码模型,重启内部AI战略,因Claude成本飙升
AI辅助编码已成为现代软件开发中的常态,然而,即使是微软这样的科技巨头,也感受到了昂贵的第三方大型语言模型订阅带来的压力。为了减少对外部依赖和运营开销,微软正准备推出自己的AI模型套件,直接瞄准AI编码领域。飙升的成本推动微软转向内部解决方案微软最近要求内部团队从商业Claude模型迁移到其自己的GitHub Copilot,主要原因是租用和使用Claude的成本过高。此前,与OpenAI的独家协议限制了微软在某些高级领域开发竞争技术的能力。然而,最近对这一合作伙伴关系的调整恢复了微软的研究
相关专题推荐
评论 (0)
0/500
美团LongCat大模型团队正式开源了商业级数字人视频生成模型LongCat-Video-Avatar 1.5。该版本标志着模型已从开源最先进技术全面转向实际商业部署,在口型同步、物理真实感、长视频稳定性、多人互动以及高效推理等方面均有重大提升。
三大关键升级,攻克商业化难关
为了使数字人能够在各种实际应用场景中稳定运行,LongCat-Video-Avatar 1.5 通过三项全面改进,解决了传统数字人视频中存在的抖动、失真和高延迟等顽固问题:
商用级音频编码升级
该模型的音频特征提取编码器已从 Wav2Vec2 升级至Whisper-large。 凭借更多的参数和更丰富的多语言先验知识,它现在能够捕捉细微的音素变化和语调节奏。这不仅提升了长句、快速语速和演唱等复杂音频的唇形同步效果,还实现了面部表情、头部动作与语音之间的自然协调——从而显著减少了长视频中的帧跳过和身份漂移现象。
通过多阶段数据增强实现强大的开放域泛化能力
为确保在真实人物、虚拟偶像、动漫角色和动物等不同主体上都能保持稳定的性能,研究团队开发了一条集离线标注和在线验证于一体的多阶段数据处理管道,并引入了三种针对性的增强数据类型:
多人物数据:利用主动说话人检测技术,消除多人物场景中的视听歧义,准确区分说话人与听众。
静默数据:通过筛选无语音的视频,模型可学习静默状态下的自然微表情,从而避免非说话角色出现不必要的嘴部动作。
情绪数据:结合帧级情绪识别过滤,该数据整合了情绪变化,帮助模型把握言语与面部表情之间的深层关联。
基于 GRPO 的手部对齐与时间连续性
针对电商直播和产品演示等双手频繁入镜的应用场景,该模型引入了GRPO(Human Preference Alignment),该技术将奖励信号细化至帧级别,并增加了首帧手部检测机制。这大大减少了手部变形、局部结构坍塌和动作不一致等常见问题。

推理速度提升15倍:消除高昂的计算需求
成本是商业部署的另一个关键因素。LongCat-Video-Avatar 1.5 采用了DMD(分布式匹配蒸馏)技术,将原本 50 步的生成过程压缩至仅8 步。 此外,团队将传统的三模型并行架构替换为单个共享基础模型加多个 LoRA 适配器,从而大幅降低了 VRAM 占用量。
在实际测试中,该模型的推理速度提升了约15倍 ,仅需约一分钟即可生成一段10秒的视频。
基准评估:超越业界顶尖模型
通过 EvalTalker 基准测试,770 名评估员和 10 名领域专家对来自新闻、教育和娱乐等复杂领域的视频进行了结构化质量分析。结果表明,LongCat-Video-Avatar 1.5 在多项关键指标上表现卓越:
用户偏好胜率:其胜率比Kling Avatar2.0高出65.9%,比OmniHuman-1.5高出61. 1%,比HeyGen高出54.3%。
单人及多人场景评分:单人场景评分达到3.336,远高于HeyGen等竞争对手;多人场景评分为2.730,显著优于InfiniteTalk(2.339)。
视频稳定性:主体变形率仅为23.1%,背景变形率仅为9.4%;帧丢失率低至0.8%,在所有对比模型中表现最佳。
音视频协调性:面部与身体不同步率降至5.1%,口型不同步率降至29.8%,两项指标均超越了传统商用系统。
美团LongCat大模型团队表示,开源LongCat-Video-Avatar 1.5不仅仅是一次版本更新,更是向全球开发者和创作者社区发出的邀请。 他们希望该模型能成为一个可验证、可改进的技术基础,助力推动数字人视频应用在现实世界中的边界拓展。
开源链接:
Github:https://github.com/meituan-longcat/LongCat-Video
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技术报告:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
项目页面:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Preply的“独角兽”地位体现了乌克兰的韧性
语言学习平台Preply在完成1.5亿美元D轮融资后,估值达到12亿美元,这标志着这家成立14年的公司迈出了重要一步。其现有投资者包括Horizon Capital、Hoxton Ventures、Owl Ventures和Techstars Berlin。自2013年开始为语言学习者与辅导老师搭建桥梁以来,Preply已连续12个月实现息税折旧及摊销前利润(EBITDA)盈利。与此同时,该公司加
王兴兴:具身人工智能有望在2至3年内实现类似ChatGPT的突破
BotSchool创始人兼首席执行官王兴兴在2026年世界机器人大会(WRC2026)主论坛上的演讲中强调,具身智能正接近一个类似于“ChatGPT时刻”的产业转折点。 他预测,相关突破最快可能在两到三年内实现,而在应用普及较慢的情景下,则可能需要五到十年时间。就在王兴兴发表演讲的前一天,BotSchool刚刚在上海证券交易所科创板上市,其股票在上市首日收盘价较发行价上涨了460%。 王强调,具身
微软推出新编码模型,重启内部AI战略,因Claude成本飙升
AI辅助编码已成为现代软件开发中的常态,然而,即使是微软这样的科技巨头,也感受到了昂贵的第三方大型语言模型订阅带来的压力。为了减少对外部依赖和运营开销,微软正准备推出自己的AI模型套件,直接瞄准AI编码领域。飙升的成本推动微软转向内部解决方案微软最近要求内部团队从商业Claude模型迁移到其自己的GitHub Copilot,主要原因是租用和使用Claude的成本过高。此前,与OpenAI的独家协议限制了微软在某些高级领域开发竞争技术的能力。然而,最近对这一合作伙伴关系的调整恢复了微软的研究





首页






