Ali’s Black Tech:0.6Bモデルが17B MoEにアップグレードされ、アクティブパラメータは5%、CPU上で毎秒30トークンの速度で実行中
Ali International Digital Commerceチームは、「Marco-MoE」シリーズの最新モデルである「Marco-Mini-Instruct」を発表し、「小規模でも大きな成果をもたらす」ことを実証しました。 総パラメータ数は173億ですが、そのうちアクティブなパラメータはわずか8.6億(約5%)であり、標準的なCPUでもスムーズに動作する卓越した推論速度を実現しています。

超軽量:CPUパフォーマンスに最適化
公式データによると、8ビット量子化と4つのDDR4 2400メモリモジュールを使用した場合、このモデルは1秒あたり約30トークンの推論速度を達成します。この効率性により、Mixture-of-Experts(MoE)アーキテクチャが主流として利用しやすくなり、ローカル展開の障壁が大幅に低減されます。
主要な革新:アップサイクリング技術が可能性を変革
Marco-Mini-Instructの際立った特徴は、そのサイズや速度ではなく、そのユニークな生成方法にあります。このモデルは、ゼロから学習されたものではなく、アップサイクリング技術を用いてQwen3-0.6B-Baseモデルから進化させたものです。

このプロセスでは、密な小型モデルの構成要素を分割または複製して複数のエキスパートに分け、ルーティング機構を導入します。また、きめ細かなサブ行列の分割と「ドロップ・アップサイクリング」戦略を統合しています。これは、トレーニング中に特定のエキスパートやルーティングパスをランダムに破棄することで、正則化を追加し、堅牢性を向上させるものです。 このアプローチにより、純粋なDenseモデルをMoEアーキテクチャへと成功裏にアップグレードし、業界にMoEトレーニングのための新しく、費用対効果が高く、効率的な道筋を提供しています。
コンテキストの長さとトレーニング設定
モデル構成では max_position_embeddings を 32K に拡張していますが、教師あり微調整(SFT)フェーズでは 8192 トークンのコンテキストが使用されます。その結果、デフォルトのコンテキスト長は、ほとんどの実用的なアプリケーションシナリオに最適です。
トレーニング後の画期的な成果:カスケード型オンポリシー蒸留
トレーニング後のフェーズも同様に印象的です。まずSFTによるプレヒーティングから始まり、続いてカスケード型オンポリシー蒸留戦略が実施されます。 当初、ディスティレーションでは Qwen3-30B-A3B-Instruct をティーチャーモデルとして使用し、その後、より高性能な Qwen3-Next-80B-A3B-Instruct に切り替えます。 蒸留データは、指示の遵守、複雑な推論、セキュリティ対応、数学的能力に及び、モデルが効率を維持しつつ、全体的な知能を大幅に向上させることを保証します。
ベンチマーク結果:0.86Bのアクティブパラメータが4Bのdenseモデルを上回る
最終的なMarco-Mini-Instructは、ほとんどの主要なベンチマークにおいて、Qwen3-4Bなどの多くの高パラメータモデルを上回る性能を発揮します。わずか0.86Bのアクティブパラメータで、「小型でありながら強力」なパフォーマンスを実現するMoEアーキテクチャの膨大な可能性を完全に実証しています。
業界への影響:新たなオープンソースMoEトレーニングパラダイム
AIbaseは、この成果の最大の価値は、開発者に新たな機会を開くことにあると考えています。もはや大規模なMoEモデルをゼロから学習させる必要はなく、代わりに、チームは適切な小型のDenseモデルを選択し、論文で概説されているアップサイクリングおよびドロップ・アップサイクリングのプロセスを厳密に再現すればよいのです。 トレーニング全体のコストは管理可能な範囲に収まります。SFTフェーズには64台のGPUで24時間、蒸留フェーズには64台のGPUで110時間を要するため、中小規模のチームがMoEを実験するためのハードルが大幅に下がります。
アリババによる今回の「改良」は、モデルの効率性における飛躍的な進歩が必ずしもパラメータの積み重ねに依存するわけではなく、革新的な学習パラダイムも質的な飛躍をもたらし得ることを改めて証明しています。 Marco-Mini-Instructのリリースは、エッジデバイスや個人開発者のシナリオにおけるMoE技術の採用を間違いなく加速させ、業界全体が注目すべき重要な進展となるだろう。
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500
Ali International Digital Commerceチームは、「Marco-MoE」シリーズの最新モデルである「Marco-Mini-Instruct」を発表し、「小規模でも大きな成果をもたらす」ことを実証しました。 総パラメータ数は173億ですが、そのうちアクティブなパラメータはわずか8.6億(約5%)であり、標準的なCPUでもスムーズに動作する卓越した推論速度を実現しています。

超軽量:CPUパフォーマンスに最適化
公式データによると、8ビット量子化と4つのDDR4 2400メモリモジュールを使用した場合、このモデルは1秒あたり約30トークンの推論速度を達成します。この効率性により、Mixture-of-Experts(MoE)アーキテクチャが主流として利用しやすくなり、ローカル展開の障壁が大幅に低減されます。
主要な革新:アップサイクリング技術が可能性を変革
Marco-Mini-Instructの際立った特徴は、そのサイズや速度ではなく、そのユニークな生成方法にあります。このモデルは、ゼロから学習されたものではなく、アップサイクリング技術を用いてQwen3-0.6B-Baseモデルから進化させたものです。

このプロセスでは、密な小型モデルの構成要素を分割または複製して複数のエキスパートに分け、ルーティング機構を導入します。また、きめ細かなサブ行列の分割と「ドロップ・アップサイクリング」戦略を統合しています。これは、トレーニング中に特定のエキスパートやルーティングパスをランダムに破棄することで、正則化を追加し、堅牢性を向上させるものです。 このアプローチにより、純粋なDenseモデルをMoEアーキテクチャへと成功裏にアップグレードし、業界にMoEトレーニングのための新しく、費用対効果が高く、効率的な道筋を提供しています。
コンテキストの長さとトレーニング設定
モデル構成では max_position_embeddings を 32K に拡張していますが、教師あり微調整(SFT)フェーズでは 8192 トークンのコンテキストが使用されます。その結果、デフォルトのコンテキスト長は、ほとんどの実用的なアプリケーションシナリオに最適です。
トレーニング後の画期的な成果:カスケード型オンポリシー蒸留
トレーニング後のフェーズも同様に印象的です。まずSFTによるプレヒーティングから始まり、続いてカスケード型オンポリシー蒸留戦略が実施されます。 当初、ディスティレーションでは Qwen3-30B-A3B-Instruct をティーチャーモデルとして使用し、その後、より高性能な Qwen3-Next-80B-A3B-Instruct に切り替えます。 蒸留データは、指示の遵守、複雑な推論、セキュリティ対応、数学的能力に及び、モデルが効率を維持しつつ、全体的な知能を大幅に向上させることを保証します。
ベンチマーク結果:0.86Bのアクティブパラメータが4Bのdenseモデルを上回る
最終的なMarco-Mini-Instructは、ほとんどの主要なベンチマークにおいて、Qwen3-4Bなどの多くの高パラメータモデルを上回る性能を発揮します。わずか0.86Bのアクティブパラメータで、「小型でありながら強力」なパフォーマンスを実現するMoEアーキテクチャの膨大な可能性を完全に実証しています。
業界への影響:新たなオープンソースMoEトレーニングパラダイム
AIbaseは、この成果の最大の価値は、開発者に新たな機会を開くことにあると考えています。もはや大規模なMoEモデルをゼロから学習させる必要はなく、代わりに、チームは適切な小型のDenseモデルを選択し、論文で概説されているアップサイクリングおよびドロップ・アップサイクリングのプロセスを厳密に再現すればよいのです。 トレーニング全体のコストは管理可能な範囲に収まります。SFTフェーズには64台のGPUで24時間、蒸留フェーズには64台のGPUで110時間を要するため、中小規模のチームがMoEを実験するためのハードルが大幅に下がります。
アリババによる今回の「改良」は、モデルの効率性における飛躍的な進歩が必ずしもパラメータの積み重ねに依存するわけではなく、革新的な学習パラダイムも質的な飛躍をもたらし得ることを改めて証明しています。 Marco-Mini-Instructのリリースは、エッジデバイスや個人開発者のシナリオにおけるMoE技術の採用を間違いなく加速させ、業界全体が注目すべき重要な進展となるだろう。
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






