美團將 LongCat-Video-Avatar 1.5 開源,表現優於主流封閉式模型
美團的 LongCat 大型模型團隊已正式開源 LongCat-Video-Avatar 1.5,這是一款商用級數位人類影片生成模型。此版本標誌著從開源最先進技術向實際商業部署的全面轉變,在嘴型同步、物理真實感、長影片穩定性、多人互動以及高效推論等方面均有重大提升。
三大關鍵升級,突破商業化瓶頸
為了讓數位人能在各種實際應用中穩定運作,LongCat-Video-Avatar 1.5 透過三項全面性的改進,解決了傳統數位人影片中長期存在的抖動、變形及高延遲等問題:
商用級音訊編碼升級
該模型的音訊特徵提取編碼器已從 Wav2Vec2 升級至Whisper-large。 憑藉更豐富的參數與更全面的多語言先驗知識,該編碼器現能精準捕捉細微的音素變化與語調節奏。此舉不僅提升了長句、快速語速及歌唱等複雜音訊的唇形同步效果,更實現了面部表情、頭部動作與語音之間的自然協調——顯著減少了長影片中的畫面跳幀與身份漂移現象。
透過多階段資料增強實現強健的開放域泛化
為確保在各類主體(真實人物、虛擬偶像、動漫角色及動物)上均能維持穩定表現,研究團隊開發了一套結合離線標註與線上驗證的多階段資料處理流程,並引入三種針對性增強資料類型:
多人數據:透過主動說話者偵測,消除多人場景中的視聽歧義,精準區分說話者與聽眾。
靜默數據:透過篩選無語音的影片,使模型學習靜默狀態下的自然微表情,避免非說話角色出現不必要的嘴部動作。
情緒數據:結合幀級情緒辨識過濾機制,納入情緒變化,協助模型掌握語音與面部表情之間的深層關聯。
透過 GRPO 實現手部對齊與時間連續性
針對電子商務直播和產品演示等經常出現手部影像的使用情境,該模型引入GRPO(Human Preference Alignment),將獎勵訊號精細化至幀級,並新增首幀手部偵測機制。這大幅減少了手部變形、局部結構崩塌及動作不一致等常見問題。

推論速度提升 15 倍:消除高昂的運算需求
成本是商業部署的另一關鍵因素。LongCat-Video-Avatar 1.5 採用DMD(分散式匹配蒸餾)技術,將原本 50 步驟的生成流程壓縮至僅8 步驟。 此外,研究團隊將傳統的三模型並行架構,改為單一共享基礎模型搭配多個 LoRA 適配器,大幅降低了 VRAM 的使用量。
在實際測試中,該模型的推論速度提升約15 倍 ,僅需約一分鐘即可生成一段 10 秒的影片。
基準測試:表現超越業界頂尖模型
透過 EvalTalker 基準測試,770 位評審與 10 位領域專家針對新聞、教育及娛樂等複雜領域的影片進行了結構化品質分析。結果顯示,LongCat-Video-Avatar 1.5 在多項關鍵指標上表現卓越:
用戶偏好勝率:較 Kling Avatar 2.0 高出65.9%,較 OmniHuman-1.5 高出61.1%,較 HeyGen 高出54.3%。
單人與多人情境評分:單人情境評分達3.336,遠高於 HeyGen 等競爭對手;多人情境評分為2.730,顯著優於 InfiniteTalk(2.339)。
影片穩定性:主體變形率僅 23.1%,背景變形率僅 9.4%;幀遺失率低至 0.8%,在所有對比模型中表現最佳。
音視協同:臉部與身體不同步問題率降至5.1%,嘴型不同步問題率降至29.8%,兩者均超越傳統商用系統。
美團 LongCat 大型模型團隊表示,開源 LongCat-Video-Avatar 1.5 不僅是版本更新,更是向全球開發者與創作者社群發出的邀請。 他們希望此模型能成為可驗證且可持續改進的技術基礎,協助拓展數位人類影片應用的實際應用邊界。
開源連結:
Github:https://github.com/meituan-longcat/LongCat-Video
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技術報告:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
專案頁面:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
相關文章
Preply 躋身獨角獸行列,彰顯了烏克蘭的韌性
語言學習平台 Preply 在完成 1.5 億美元 D 輪融資後,估值已達 12 億美元,這對這家成立 14 年的公司而言,標誌著一個重要的里程碑。過往投資者包括 Horizon Capital、Hoxton Ventures、Owl Ventures 以及 Techstars Berlin。自 2013 年開始為語言學習者與家教媒合服務以來,Preply 已連續十二個月實現 EBITDA 獲利。
王興興:具身人工智慧預計在 2 至 3 年內實現類似 ChatGPT 的突破
BotSchool 創辦人暨執行長王興興在 2026 年世界機器人大會(WRC2026)主論壇的演講中強調,具身智能正接近一個類似「ChatGPT 時刻」的產業轉捩點。 他預測,突破性進展最快可能在兩至三年內出現,若採用速度較慢,則可能需要五至十年。就在王興興發表演說的前一天,BotSchool 剛在上海證券交易所科創板掛牌上市,其股票在首日收盤時較發行價上漲了 460%。 王強調,具身智能邁向產
微軟推出新編碼模型,重啟內部AI戰略,因Claude成本飆升
AI輔助編碼已成為現代軟體開發中的常態,然而,即使是微軟這樣的科技巨頭,也感受到了昂貴的第三方大型語言模型訂閱帶來的壓力。為了減少對外部依賴和運營開銷,微軟正準備推出自己的AI模型套件,直接瞄準AI編碼領域。飆升的成本推動微軟轉向內部解決方案微軟最近要求內部團隊從商業Claude模型遷移到其自己的GitHub Copilot,主要原因是租用和使用Claude的成本過高。此前,與OpenAI的獨家協議限制了微軟在某些高階領域開發競爭技術的能力。然而,最近對這一合作伙伴關係的調整恢復了微軟的研究
相關專題推薦
評論 (0)
0/500
美團的 LongCat 大型模型團隊已正式開源 LongCat-Video-Avatar 1.5,這是一款商用級數位人類影片生成模型。此版本標誌著從開源最先進技術向實際商業部署的全面轉變,在嘴型同步、物理真實感、長影片穩定性、多人互動以及高效推論等方面均有重大提升。
三大關鍵升級,突破商業化瓶頸
為了讓數位人能在各種實際應用中穩定運作,LongCat-Video-Avatar 1.5 透過三項全面性的改進,解決了傳統數位人影片中長期存在的抖動、變形及高延遲等問題:
商用級音訊編碼升級
該模型的音訊特徵提取編碼器已從 Wav2Vec2 升級至Whisper-large。 憑藉更豐富的參數與更全面的多語言先驗知識,該編碼器現能精準捕捉細微的音素變化與語調節奏。此舉不僅提升了長句、快速語速及歌唱等複雜音訊的唇形同步效果,更實現了面部表情、頭部動作與語音之間的自然協調——顯著減少了長影片中的畫面跳幀與身份漂移現象。
透過多階段資料增強實現強健的開放域泛化
為確保在各類主體(真實人物、虛擬偶像、動漫角色及動物)上均能維持穩定表現,研究團隊開發了一套結合離線標註與線上驗證的多階段資料處理流程,並引入三種針對性增強資料類型:
多人數據:透過主動說話者偵測,消除多人場景中的視聽歧義,精準區分說話者與聽眾。
靜默數據:透過篩選無語音的影片,使模型學習靜默狀態下的自然微表情,避免非說話角色出現不必要的嘴部動作。
情緒數據:結合幀級情緒辨識過濾機制,納入情緒變化,協助模型掌握語音與面部表情之間的深層關聯。
透過 GRPO 實現手部對齊與時間連續性
針對電子商務直播和產品演示等經常出現手部影像的使用情境,該模型引入GRPO(Human Preference Alignment),將獎勵訊號精細化至幀級,並新增首幀手部偵測機制。這大幅減少了手部變形、局部結構崩塌及動作不一致等常見問題。

推論速度提升 15 倍:消除高昂的運算需求
成本是商業部署的另一關鍵因素。LongCat-Video-Avatar 1.5 採用DMD(分散式匹配蒸餾)技術,將原本 50 步驟的生成流程壓縮至僅8 步驟。 此外,研究團隊將傳統的三模型並行架構,改為單一共享基礎模型搭配多個 LoRA 適配器,大幅降低了 VRAM 的使用量。
在實際測試中,該模型的推論速度提升約15 倍 ,僅需約一分鐘即可生成一段 10 秒的影片。
基準測試:表現超越業界頂尖模型
透過 EvalTalker 基準測試,770 位評審與 10 位領域專家針對新聞、教育及娛樂等複雜領域的影片進行了結構化品質分析。結果顯示,LongCat-Video-Avatar 1.5 在多項關鍵指標上表現卓越:
用戶偏好勝率:較 Kling Avatar 2.0 高出65.9%,較 OmniHuman-1.5 高出61.1%,較 HeyGen 高出54.3%。
單人與多人情境評分:單人情境評分達3.336,遠高於 HeyGen 等競爭對手;多人情境評分為2.730,顯著優於 InfiniteTalk(2.339)。
影片穩定性:主體變形率僅 23.1%,背景變形率僅 9.4%;幀遺失率低至 0.8%,在所有對比模型中表現最佳。
音視協同:臉部與身體不同步問題率降至5.1%,嘴型不同步問題率降至29.8%,兩者均超越傳統商用系統。
美團 LongCat 大型模型團隊表示,開源 LongCat-Video-Avatar 1.5 不僅是版本更新,更是向全球開發者與創作者社群發出的邀請。 他們希望此模型能成為可驗證且可持續改進的技術基礎,協助拓展數位人類影片應用的實際應用邊界。
開源連結:
Github:https://github.com/meituan-longcat/LongCat-Video
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技術報告:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
專案頁面:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Preply 躋身獨角獸行列,彰顯了烏克蘭的韌性
語言學習平台 Preply 在完成 1.5 億美元 D 輪融資後,估值已達 12 億美元,這對這家成立 14 年的公司而言,標誌著一個重要的里程碑。過往投資者包括 Horizon Capital、Hoxton Ventures、Owl Ventures 以及 Techstars Berlin。自 2013 年開始為語言學習者與家教媒合服務以來,Preply 已連續十二個月實現 EBITDA 獲利。
王興興:具身人工智慧預計在 2 至 3 年內實現類似 ChatGPT 的突破
BotSchool 創辦人暨執行長王興興在 2026 年世界機器人大會(WRC2026)主論壇的演講中強調,具身智能正接近一個類似「ChatGPT 時刻」的產業轉捩點。 他預測,突破性進展最快可能在兩至三年內出現,若採用速度較慢,則可能需要五至十年。就在王興興發表演說的前一天,BotSchool 剛在上海證券交易所科創板掛牌上市,其股票在首日收盤時較發行價上漲了 460%。 王強調,具身智能邁向產
微軟推出新編碼模型,重啟內部AI戰略,因Claude成本飆升
AI輔助編碼已成為現代軟體開發中的常態,然而,即使是微軟這樣的科技巨頭,也感受到了昂貴的第三方大型語言模型訂閱帶來的壓力。為了減少對外部依賴和運營開銷,微軟正準備推出自己的AI模型套件,直接瞄準AI編碼領域。飆升的成本推動微軟轉向內部解決方案微軟最近要求內部團隊從商業Claude模型遷移到其自己的GitHub Copilot,主要原因是租用和使用Claude的成本過高。此前,與OpenAI的獨家協議限制了微軟在某些高階領域開發競爭技術的能力。然而,最近對這一合作伙伴關係的調整恢復了微軟的研究





首頁






