Дом
Ali’s Black Tech: модель объёмом 0,6 млрд была модернизирована до 17 млрд MoE с 5 % активных параметров; работает на ЦП со скоростью 30 токенов в секунду
Команда Ali International Digital Commerce представила Marco-Mini-Instruct — новейшую разработку в серии Marco-MoE, которая демонстрирует, как «небольшие масштабы могут приносить большие результаты». Из 17,3 миллиарда параметров всего 0,86 миллиарда являются активными (примерно 5%), что обеспечивает исключительную скорость инференса, позволяющую модели плавно работать даже на стандартных процессорах.

Сверхлегкая модель: оптимизирована для производительности ЦП
Согласно официальным данным, при использовании 8-битного квантования с четырьмя модулями памяти DDR4 2400 модель достигает скорости инференса примерно 30 токенов в секунду. Такая эффективность приближает архитектуру Mixture-of-Experts (MoE) к массовому использованию, значительно снижая барьеры для локального развертывания.
Ключевая инновация: технология «апсайклинга» преобразует потенциал
Отличительной особенностью Marco-Mini-Instruct является не её размер или скорость, а уникальный метод создания. Вместо обучения с нуля эта модель была разработана на основе модели Qwen3-0.6B-Base с использованием технологии «апсайклинга ».

Этот процесс включает в себя разделение или копирование компонентов плотной небольшой модели на несколько экспертов с введением механизма маршрутизации. Он также объединяет мелкозернистое разбиение на подматрицы и стратегии «Drop-Upcycling» — случайное отбрасывание определённых экспертов или путей маршрутизации во время обучения для добавления регуляризации и повышения устойчивости. Данный подход позволяет успешно преобразовать чистую плотную модель в архитектуру MoE, предлагая отрасли новый, экономичный и эффективный путь для обучения моделей MoE.
Длина контекста и настройка обучения
Конфигурация модели расширяет max_position_embeddings до 32K, хотя на этапе Supervised Fine-Tuning (SFT) используется контекст длиной 8192 токена. Следовательно, длина контекста по умолчанию хорошо подходит для большинства практических сценариев применения.
Прорыв после обучения: каскадная дистилляция по политике
Фаза после обучения не менее впечатляет: она начинается с предварительной подготовки SFT, за которой следует стратегия каскадной дистилляции по политике. Первоначально в процессе дистилляции в качестве модели-наставника используется Qwen3-30B-A3B-Instruct, а затем происходит переход на более мощную модель Qwen3-Next-80B-A3B-Instruct. Данные для дистилляции охватывают следование инструкциям, сложное рассуждение, безопасность выравнивания и математические способности, что гарантирует сохранение эффективности модели при значительном повышении общего уровня интеллекта.
Результаты тестирования: 0,86 млрд активных параметров превосходят плотные модели объемом 4 млрд
Окончательная версия Marco-Mini-Instruct превосходит многие плотные модели, такие как Qwen3-4B, по большинству основных тестов. Имея всего 0,86 млрд активных параметров, она полностью подтверждает огромный потенциал архитектуры MoE в обеспечении «небольшой, но мощной» производительности.
Влияние на отрасль: новая парадигма обучения MoE с открытым исходным кодом
В AIbase считают, что главная ценность этого достижения заключается в открытии новых возможностей для разработчиков. Больше нет необходимости обучать крупномасштабные модели MoE с нуля; вместо этого команды могут выбрать подходящую небольшую плотную модель и строго воспроизвести процессы upcycling и Drop-Upcycling, описанные в статье. Общие затраты на обучение остаются приемлемыми: фаза SFT требует 64 графических процессоров в течение 24 часов, а фаза дистилляции — 64 графических процессоров в течение 110 часов, что значительно снижает порог для малых и средних команд, желающих экспериментировать с MoE.
Последнее «усовершенствование» от Alibaba в очередной раз доказывает, что прорывы в эффективности моделей не обязательно зависят от увеличения количества параметров; инновационные парадигмы обучения также могут способствовать качественному скачку. Выпуск Marco-Mini-Instruct, несомненно, ускорит внедрение технологии MoE в периферийных устройствах и сценариях личного разработчика, что делает его ключевым событием, за которым стоит следить всей отрасли.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)
Команда Ali International Digital Commerce представила Marco-Mini-Instruct — новейшую разработку в серии Marco-MoE, которая демонстрирует, как «небольшие масштабы могут приносить большие результаты». Из 17,3 миллиарда параметров всего 0,86 миллиарда являются активными (примерно 5%), что обеспечивает исключительную скорость инференса, позволяющую модели плавно работать даже на стандартных процессорах.

Сверхлегкая модель: оптимизирована для производительности ЦП
Согласно официальным данным, при использовании 8-битного квантования с четырьмя модулями памяти DDR4 2400 модель достигает скорости инференса примерно 30 токенов в секунду. Такая эффективность приближает архитектуру Mixture-of-Experts (MoE) к массовому использованию, значительно снижая барьеры для локального развертывания.
Ключевая инновация: технология «апсайклинга» преобразует потенциал
Отличительной особенностью Marco-Mini-Instruct является не её размер или скорость, а уникальный метод создания. Вместо обучения с нуля эта модель была разработана на основе модели Qwen3-0.6B-Base с использованием технологии «апсайклинга ».

Этот процесс включает в себя разделение или копирование компонентов плотной небольшой модели на несколько экспертов с введением механизма маршрутизации. Он также объединяет мелкозернистое разбиение на подматрицы и стратегии «Drop-Upcycling» — случайное отбрасывание определённых экспертов или путей маршрутизации во время обучения для добавления регуляризации и повышения устойчивости. Данный подход позволяет успешно преобразовать чистую плотную модель в архитектуру MoE, предлагая отрасли новый, экономичный и эффективный путь для обучения моделей MoE.
Длина контекста и настройка обучения
Конфигурация модели расширяет max_position_embeddings до 32K, хотя на этапе Supervised Fine-Tuning (SFT) используется контекст длиной 8192 токена. Следовательно, длина контекста по умолчанию хорошо подходит для большинства практических сценариев применения.
Прорыв после обучения: каскадная дистилляция по политике
Фаза после обучения не менее впечатляет: она начинается с предварительной подготовки SFT, за которой следует стратегия каскадной дистилляции по политике. Первоначально в процессе дистилляции в качестве модели-наставника используется Qwen3-30B-A3B-Instruct, а затем происходит переход на более мощную модель Qwen3-Next-80B-A3B-Instruct. Данные для дистилляции охватывают следование инструкциям, сложное рассуждение, безопасность выравнивания и математические способности, что гарантирует сохранение эффективности модели при значительном повышении общего уровня интеллекта.
Результаты тестирования: 0,86 млрд активных параметров превосходят плотные модели объемом 4 млрд
Окончательная версия Marco-Mini-Instruct превосходит многие плотные модели, такие как Qwen3-4B, по большинству основных тестов. Имея всего 0,86 млрд активных параметров, она полностью подтверждает огромный потенциал архитектуры MoE в обеспечении «небольшой, но мощной» производительности.
Влияние на отрасль: новая парадигма обучения MoE с открытым исходным кодом
В AIbase считают, что главная ценность этого достижения заключается в открытии новых возможностей для разработчиков. Больше нет необходимости обучать крупномасштабные модели MoE с нуля; вместо этого команды могут выбрать подходящую небольшую плотную модель и строго воспроизвести процессы upcycling и Drop-Upcycling, описанные в статье. Общие затраты на обучение остаются приемлемыми: фаза SFT требует 64 графических процессоров в течение 24 часов, а фаза дистилляции — 64 графических процессоров в течение 110 часов, что значительно снижает порог для малых и средних команд, желающих экспериментировать с MoE.
Последнее «усовершенствование» от Alibaba в очередной раз доказывает, что прорывы в эффективности моделей не обязательно зависят от увеличения количества параметров; инновационные парадигмы обучения также могут способствовать качественному скачку. Выпуск Marco-Mini-Instruct, несомненно, ускорит внедрение технологии MoE в периферийных устройствах и сценариях личного разработчика, что делает его ключевым событием, за которым стоит следить всей отрасли.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











