美團推出「LongCat-Next」AI 模型,具備統一的視覺與語音架構

4月3日,MiTi團隊正式推出原生多模態大型模型 LongCat-Next。該模型突破了傳統的「語言基礎架構加外掛程式」模式,將圖像、音訊和文字轉換為統一的離散標記流。這使人工智慧能夠原生地「看見」和「聽見」物理世界,並像處理文字一樣處理這些輸入。
技術核心:DiNA 架構實現「模態內化」
為消除不同資料類型之間的隔閡,MiTi 開發了 DiNA(離散原生自迴歸)架構,實現了多模態建模的深度統一:
完整的模態統一:該模型針對文字、圖像和音訊使用相同的參數、注意力機制及損失函數。
理解與生成對稱性:在單一數學框架內,預測下一個文字標記即為「理解」,而預測圖像標記則為「生成」。這兩項過程在訓練期間展現出顯著的協同效益。
極致壓縮:透過 dNaViT 視覺分詞器,可處理任何解析度的輸入。藉由 8 層殘差向量量化過程,在像素空間中實現最高 28 倍的壓縮率,同時保留 OCR 和財務文件分析等任務所需的關鍵細節。
實證表現:離散建模並無固有限制
LongCat-Next 在多項基準測試中展現出超越專用模型的表現,有效挑戰了「離散化必然導致資訊損失」的傳統觀念:
細粒度感知:在密集文本場景的 OmniDocBench 測試中,其表現不僅超越 Qwen3-Omni,更勝過專用的視覺模型 Qwen3-VL。
視覺推理:在 MathVista 測試中取得 83.1 分的高分,展現出強健的產業級邏輯推理能力。
跨模態協作:在維持領先的語言能力(C-Eval 86.80)的同時,支援文字與語音的低延遲並行生成,並具備可自訂的語音克隆功能。
產業洞見:實體世界 AI 的基礎
大型語言模型長期以來都以文字為核心。LongCat-Next 的突破性之處在於,它證明了實體世界資訊可以像語言一樣被離散化並建模。當 AI 擁有統一的「母語」時,無論是使用工具、編寫程式碼,還是解讀複雜圖表,都能變得更加智能且直覺。
MiTi 現已將 LongCat-Next 模型與 dNaViT 詞法分析器開源。這套高效且潛力巨大的原生離散架構,為開發者提供了打造能感知並與現實世界互動的人工智慧所需的關鍵工具。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (1)
0/500
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐

4月3日,MiTi團隊正式推出原生多模態大型模型 LongCat-Next。該模型突破了傳統的「語言基礎架構加外掛程式」模式,將圖像、音訊和文字轉換為統一的離散標記流。這使人工智慧能夠原生地「看見」和「聽見」物理世界,並像處理文字一樣處理這些輸入。
技術核心:DiNA 架構實現「模態內化」
為消除不同資料類型之間的隔閡,MiTi 開發了 DiNA(離散原生自迴歸)架構,實現了多模態建模的深度統一:
完整的模態統一:該模型針對文字、圖像和音訊使用相同的參數、注意力機制及損失函數。
理解與生成對稱性:在單一數學框架內,預測下一個文字標記即為「理解」,而預測圖像標記則為「生成」。這兩項過程在訓練期間展現出顯著的協同效益。
極致壓縮:透過 dNaViT 視覺分詞器,可處理任何解析度的輸入。藉由 8 層殘差向量量化過程,在像素空間中實現最高 28 倍的壓縮率,同時保留 OCR 和財務文件分析等任務所需的關鍵細節。
實證表現:離散建模並無固有限制
LongCat-Next 在多項基準測試中展現出超越專用模型的表現,有效挑戰了「離散化必然導致資訊損失」的傳統觀念:
細粒度感知:在密集文本場景的 OmniDocBench 測試中,其表現不僅超越 Qwen3-Omni,更勝過專用的視覺模型 Qwen3-VL。
視覺推理:在 MathVista 測試中取得 83.1 分的高分,展現出強健的產業級邏輯推理能力。
跨模態協作:在維持領先的語言能力(C-Eval 86.80)的同時,支援文字與語音的低延遲並行生成,並具備可自訂的語音克隆功能。
產業洞見:實體世界 AI 的基礎
大型語言模型長期以來都以文字為核心。LongCat-Next 的突破性之處在於,它證明了實體世界資訊可以像語言一樣被離散化並建模。當 AI 擁有統一的「母語」時,無論是使用工具、編寫程式碼,還是解讀複雜圖表,都能變得更加智能且直覺。
MiTi 現已將 LongCat-Next 模型與 dNaViT 詞法分析器開源。這套高效且潛力巨大的原生離散架構,為開發者提供了打造能感知並與現實世界互動的人工智慧所需的關鍵工具。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐





首頁






