Ali 的 Black Tech:0.6B 模型升級至 17B MoE,具 5% 活躍參數,於 CPU 上以每秒 30 個標記的速度運行
阿里國際數位商務團隊正式推出 Marco-MoE 系列的最新成員「Marco-Mini-Instruct」,展現了「小規模也能帶來大成果」的理念。 該模型總參數數為 173 億,其中僅有 8.6 億為活躍參數(約佔 5%),因此具備卓越的推論速度,即使在標準 CPU 上也能流暢運行。

超輕量級:針對 CPU 效能進行優化
根據官方數據,該模型採用 8 位元量化技術,搭配四組 DDR4 2400 記憶體模組,可實現每秒約 30 個標記的推論速度。此高效能使「專家混合」(MoE)架構更接近主流應用,大幅降低了本地部署的門檻。
關鍵創新:升級再造技術釋放潛能
Marco-Mini-Instruct 最突出的特點不在於其規模或速度,而在於其獨特的創建方法。該模型並非從頭開始訓練,而是透過升級再造技術,由 Qwen3-0.6B-Base 模型演化而來。

此過程涉及將密集型小型模型的組件拆分或複製為多個專家,並引入路由機制。同時整合了細粒度子矩陣分區與Drop-Upcycling策略——在訓練過程中隨機捨棄特定專家或路由路徑,以增加正則化並提升穩健性。 此方法成功將純密模組(Dense model)升級為 MoE 架構,為業界提供了 MoE 訓練的一條嶄新、經濟且高效的途徑。
上下文長度與訓練設定
雖然模型配置將 max_position_embeddings 擴展至 32K,但在「監督式微調」(SFT)階段僅使用 8192 個標記的上下文。因此,預設的上下文長度對於大多數實際應用場景而言已相當合適。
訓練後階段的突破:級聯策略內蒸餾
後訓練階段同樣令人印象深刻:首先進行 SFT 預熱,隨後採用級聯的策略內蒸餾策略。 初期,蒸餾過程採用 Qwen3-30B-A3B-Instruct 作為教師模型,隨後切換至更強大的 Qwen3-Next-80B-A3B-Instruct。 蒸餾數據涵蓋指令遵循、複雜推理、對齊安全性及數學能力等範疇,確保模型在維持效率的同時,能顯著提升整體智能水準。
基準測試結果:0.86B 個活躍參數 勝過 4B 密集型模型
最終的 Marco-Mini-Instruct 在大多數主流基準測試中,表現均優於許多稠密模型,例如 Qwen3-4B。僅憑 0.86 億個活躍參數,便充分驗證了 MoE 架構在實現「小而強大」效能方面的巨大潛力。
產業影響:全新的開源 MoE 訓練範式
AIbase 認為,這項成就的最大價值在於為開發者開闢了新的機會。開發團隊不再需要從頭開始訓練大規模的 MoE 模型;取而代之的是,可以選擇合適的小型密集模型,並嚴格重現論文中所述的「上循環(upcycling)」與「Drop-Upcycling」流程。 整體訓練成本仍可控:SFT 階段需 64 張 GPU 運算 24 小時,蒸餾階段則需 64 張 GPU 運算 110 小時,這大幅降低了中小型團隊嘗試 MoE 的門檻。
阿里巴巴的這項最新「改良」再次證明,模型效率的突破未必仰賴參數堆疊;創新的訓練範式同樣能推動質的飛躍。 Marco-Mini-Instruct 的發布無疑將加速 MoE 技術在邊緣裝置及個人開發者場景中的採用,使其成為整個產業值得關注的關鍵發展。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
阿里國際數位商務團隊正式推出 Marco-MoE 系列的最新成員「Marco-Mini-Instruct」,展現了「小規模也能帶來大成果」的理念。 該模型總參數數為 173 億,其中僅有 8.6 億為活躍參數(約佔 5%),因此具備卓越的推論速度,即使在標準 CPU 上也能流暢運行。

超輕量級:針對 CPU 效能進行優化
根據官方數據,該模型採用 8 位元量化技術,搭配四組 DDR4 2400 記憶體模組,可實現每秒約 30 個標記的推論速度。此高效能使「專家混合」(MoE)架構更接近主流應用,大幅降低了本地部署的門檻。
關鍵創新:升級再造技術釋放潛能
Marco-Mini-Instruct 最突出的特點不在於其規模或速度,而在於其獨特的創建方法。該模型並非從頭開始訓練,而是透過升級再造技術,由 Qwen3-0.6B-Base 模型演化而來。

此過程涉及將密集型小型模型的組件拆分或複製為多個專家,並引入路由機制。同時整合了細粒度子矩陣分區與Drop-Upcycling策略——在訓練過程中隨機捨棄特定專家或路由路徑,以增加正則化並提升穩健性。 此方法成功將純密模組(Dense model)升級為 MoE 架構,為業界提供了 MoE 訓練的一條嶄新、經濟且高效的途徑。
上下文長度與訓練設定
雖然模型配置將 max_position_embeddings 擴展至 32K,但在「監督式微調」(SFT)階段僅使用 8192 個標記的上下文。因此,預設的上下文長度對於大多數實際應用場景而言已相當合適。
訓練後階段的突破:級聯策略內蒸餾
後訓練階段同樣令人印象深刻:首先進行 SFT 預熱,隨後採用級聯的策略內蒸餾策略。 初期,蒸餾過程採用 Qwen3-30B-A3B-Instruct 作為教師模型,隨後切換至更強大的 Qwen3-Next-80B-A3B-Instruct。 蒸餾數據涵蓋指令遵循、複雜推理、對齊安全性及數學能力等範疇,確保模型在維持效率的同時,能顯著提升整體智能水準。
基準測試結果:0.86B 個活躍參數 勝過 4B 密集型模型
最終的 Marco-Mini-Instruct 在大多數主流基準測試中,表現均優於許多稠密模型,例如 Qwen3-4B。僅憑 0.86 億個活躍參數,便充分驗證了 MoE 架構在實現「小而強大」效能方面的巨大潛力。
產業影響:全新的開源 MoE 訓練範式
AIbase 認為,這項成就的最大價值在於為開發者開闢了新的機會。開發團隊不再需要從頭開始訓練大規模的 MoE 模型;取而代之的是,可以選擇合適的小型密集模型,並嚴格重現論文中所述的「上循環(upcycling)」與「Drop-Upcycling」流程。 整體訓練成本仍可控:SFT 階段需 64 張 GPU 運算 24 小時,蒸餾階段則需 64 張 GPU 運算 110 小時,這大幅降低了中小型團隊嘗試 MoE 的門檻。
阿里巴巴的這項最新「改良」再次證明,模型效率的突破未必仰賴參數堆疊;創新的訓練範式同樣能推動質的飛躍。 Marco-Mini-Instruct 的發布無疑將加速 MoE 技術在邊緣裝置及個人開發者場景中的採用,使其成為整個產業值得關注的關鍵發展。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






