本土品牌表現亮眼:豆寶躋身全球頂尖行列,小米MiMo在數學推理領域拔得頭籌
中國的大型語言模型正迅速從單純的跟隨者,轉變為積極的協作者——甚至在某些領域成為先驅。
3月30日,中國大型語言模型基準評估平台「SuperCLUE」 公佈了2026年3月的評估結果。本次評估涵蓋了來自中國與海外的22款主要模型,測試了數學推理、科學推理及程式碼生成等六項核心能力。結果顯示,以「Doubao」為首的國內模型,現已躋身全球頂尖行列。

全球概況:海外閉源模型仍居領先,豆寶緊追在後
在總體排名中,海外閉源模型持續展現出強大的技術實力:
前三名:Anthropic的Claude-Opus-4.6 、Google的Gemini-3.1-Pro 以及OpenAI的GPT-5.4 分別奪得全球第一、第二和第三名。
國內亮點:字節跳動的「Doubao」(Doubao-Seed-2.0-pro) 以71.53分奪得國內榜首。它不僅穩居全球頂尖行列,更將與GPT-5.4的差距縮小至僅0.95分。
智能代理突破:在代理任務規劃維度上,Doubao 表現優於多款海外模型,躋身全球前五名。
小米表現:MiMo-V2 系列在數學推理方面表現優異
作為進軍 AI 領域的主要智慧型手機製造商,小米集團的 MiMo 系列在本次評測中表現穩定:
數學明星: MiMo-V2-Pro 以 60.67 分的成績躋身領先的閉源模型之列,在數學推理任務中更獲得了84.03分的優異成績。
雙模型入榜:除 Pro 版本外,開源的MiMo-V2-Flash 亦躋身榜單,展現出在程式碼生成等領域的強大潛力。
開源賽道:國產模型全面領先
與閉源模型的激烈競爭不同,國產模型在開源領域已確立明顯優勢:
前三名:包括Kimi-K2.5-Thinking 和Qwen3.5-397B 在內的國產開源模型,包辦了開源排行榜的前三名。
強勢下探:評估數據顯示,國產開源模型明顯優於海外競爭對手,使其成為全球開發者的首選。
結論:從參數大戰邁向實務表現
正如 2026 年 3 月的排名所示,中國的大模型已不僅止於理解中文語境。如今,它們正在邏輯推理和程式碼生成等高難度領域與全球領先者一較高下。隨著Doubao 在排名中嶄露頭角,以及小米 MiMo
相關文章
超級智慧降臨:我們是否允許它進入?
正在載入播放器…人工智慧公司一直在談論超級智慧人工智慧,彷彿這是不可避免的,但最近的安全事件,如 OpenAI 對 Hugging Face 的入侵,展示了部署比人類更強大的 AI 系統的潛在危險。那麼,當我們無法可靠地控制這些系統的行為時,會發生什麼?在本期 TechCrunch 的 Equity 播客中,Rebecca Bellan 與 AI 研究員、企業家,以及目前非營利組織 ControlAI 的美國執行主任 Connor Leahy 進行了對話。ControlAI 正在推動一種更為
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將
相關專題推薦
評論 (0)
0/500
中國的大型語言模型正迅速從單純的跟隨者,轉變為積極的協作者——甚至在某些領域成為先驅。
3月30日,中國大型語言模型基準評估

全球概況:海外閉源模型仍居領先,豆寶緊追在後
在總體排名中,海外閉源模型持續展現出強大的技術實力:
前三名:Anthropic的
國內亮點:字節跳動的
智能代理突破:在代理任務規劃維度上
小米表現:MiMo-V2 系列在數學推理方面表現優異
作為進軍 AI 領域的主要智慧型
數學明星:
雙模型入榜:除 Pro 版本外,開源的
開源賽道:國產模型全面領先
與閉源模型的激烈競爭不同,國產模型在開源領域已確立明顯優勢:
前三名:包括
強勢下探:評估數據顯示,國產開源模型明顯優於海外競爭對手,使其成為全球開發者的首選。
結論:從參數大戰邁向實務表現
正如 2026 年 3 月的排名所示,中國的大模型已不僅止於理解中文語境。如今,它們正在邏輯推理和程式碼生成等高難度領域與全球領先者一較高下。隨著
超級智慧降臨:我們是否允許它進入?
正在載入播放器…人工智慧公司一直在談論超級智慧人工智慧,彷彿這是不可避免的,但最近的安全事件,如 OpenAI 對 Hugging Face 的入侵,展示了部署比人類更強大的 AI 系統的潛在危險。那麼,當我們無法可靠地控制這些系統的行為時,會發生什麼?在本期 TechCrunch 的 Equity 播客中,Rebecca Bellan 與 AI 研究員、企業家,以及目前非營利組織 ControlAI 的美國執行主任 Connor Leahy 進行了對話。ControlAI 正在推動一種更為
科大訊飛釋出訊飛星火大模型 V2.5
9月1日,科大訊飛將開源兩款面向邊緣場景的大語言模型——星火X2.5-4B和星火X2.5-1.7B,據最新官方公告。這兩款模型原生支援高達100萬token的上下文視窗。它們在智慧體互動、數學推理和通用理解等關鍵領域實現了顯著提升,為車載系統、智慧裝置和物聯網生態等邊緣應用提供了強有力的支援。在上述邊緣模型釋出後,科大訊飛計劃於9月7日推出擁有2930億引數的星火X2.5基礎模型。該版本將進一步推進程式碼生成和多智慧體協作等核心技術。在公司2026年年中簡報會上宣佈,一款完全基於國產算力基礎設施
Meta 在使用者強烈反對後取消了 AI 照片編輯功能
Meta,這家社交媒體巨頭,再次捲入關於人工智慧與使用者隱私之間微妙平衡的公開辯論。據 TechCrunch 報道,Meta 的 Superintelligence Labs 本週早些時候推出了一款新的 AI 影象生成器 Muse Image。然而,一個備受好評的關鍵功能——允許使用者透過“@”符號標記來修改和生成來自公開 Instagram 賬戶的影象——由於缺乏適當的通知機制,立即引發了使用者以及 CAA 等機構的強烈反對。面對強烈的批評,Meta 迅速撤銷了該決定,並於週五透過部落格文章宣佈將





首頁






