本土品牌表現亮眼:豆寶躋身全球頂尖行列,小米MiMo在數學推理領域拔得頭籌
中國的大型語言模型正迅速從單純的跟隨者,轉變為積極的協作者——甚至在某些領域成為先驅。
3月30日,中國大型語言模型基準評估平台「SuperCLUE」 公佈了2026年3月的評估結果。本次評估涵蓋了來自中國與海外的22款主要模型,測試了數學推理、科學推理及程式碼生成等六項核心能力。結果顯示,以「Doubao」為首的國內模型,現已躋身全球頂尖行列。

全球概況:海外閉源模型仍居領先,豆寶緊追在後
在總體排名中,海外閉源模型持續展現出強大的技術實力:
前三名:Anthropic的Claude-Opus-4.6 、Google的Gemini-3.1-Pro 以及OpenAI的GPT-5.4 分別奪得全球第一、第二和第三名。
國內亮點:字節跳動的「Doubao」(Doubao-Seed-2.0-pro) 以71.53分奪得國內榜首。它不僅穩居全球頂尖行列,更將與GPT-5.4的差距縮小至僅0.95分。
智能代理突破:在代理任務規劃維度上,Doubao 表現優於多款海外模型,躋身全球前五名。
小米表現:MiMo-V2 系列在數學推理方面表現優異
作為進軍 AI 領域的主要智慧型手機製造商,小米集團的 MiMo 系列在本次評測中表現穩定:
數學明星: MiMo-V2-Pro 以 60.67 分的成績躋身領先的閉源模型之列,在數學推理任務中更獲得了84.03分的優異成績。
雙模型入榜:除 Pro 版本外,開源的MiMo-V2-Flash 亦躋身榜單,展現出在程式碼生成等領域的強大潛力。
開源賽道:國產模型全面領先
與閉源模型的激烈競爭不同,國產模型在開源領域已確立明顯優勢:
前三名:包括Kimi-K2.5-Thinking 和Qwen3.5-397B 在內的國產開源模型,包辦了開源排行榜的前三名。
強勢下探:評估數據顯示,國產開源模型明顯優於海外競爭對手,使其成為全球開發者的首選。
結論:從參數大戰邁向實務表現
正如 2026 年 3 月的排名所示,中國的大模型已不僅止於理解中文語境。如今,它們正在邏輯推理和程式碼生成等高難度領域與全球領先者一較高下。隨著Doubao 在排名中嶄露頭角,以及小米 MiMo
相關文章
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
相關專題推薦
評論 (0)
0/500
中國的大型語言模型正迅速從單純的跟隨者,轉變為積極的協作者——甚至在某些領域成為先驅。
3月30日,中國大型語言模型基準評估

全球概況:海外閉源模型仍居領先,豆寶緊追在後
在總體排名中,海外閉源模型持續展現出強大的技術實力:
前三名:Anthropic的
國內亮點:字節跳動的
智能代理突破:在代理任務規劃維度上
小米表現:MiMo-V2 系列在數學推理方面表現優異
作為進軍 AI 領域的主要智慧型
數學明星:
雙模型入榜:除 Pro 版本外,開源的
開源賽道:國產模型全面領先
與閉源模型的激烈競爭不同,國產模型在開源領域已確立明顯優勢:
前三名:包括
強勢下探:評估數據顯示,國產開源模型明顯優於海外競爭對手,使其成為全球開發者的首選。
結論:從參數大戰邁向實務表現
正如 2026 年 3 月的排名所示,中國的大模型已不僅止於理解中文語境。如今,它們正在邏輯推理和程式碼生成等高難度領域與全球領先者一較高下。隨著
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20





首頁






