Hogar
Black Tech de Ali: modelo de 0,6 mil millones actualizado a 17 mil millones de MoE con un 5 % de parámetros activos, que se ejecuta en la CPU a 30 tokens por segundo
El equipo de Ali International Digital Commerce ha presentado Marco-Mini-Instruct, la última incorporación a la serie Marco-MoE, que demuestra cómo «las escalas más pequeñas pueden ofrecer grandes resultados». De un total de 17 300 millones de parámetros, solo 860 millones están activos (aproximadamente el 5 %), lo que permite una velocidad de inferencia excepcional que funciona con fluidez incluso en CPU estándar.

Ultraligero: optimizado para el rendimiento de la CPU
Según datos oficiales, utilizando una cuantificación de 8 bits con cuatro módulos de memoria DDR4 2400, el modelo alcanza una velocidad de inferencia de aproximadamente 30 tokens por segundo. Esta eficiencia acerca la arquitectura «Mixture-of-Experts» (MoE) a la accesibilidad generalizada, reduciendo significativamente las barreras para su implementación local.
Innovación clave: la tecnología de «upcycling» transforma el potencial
La característica más destacada de Marco-Mini-Instruct no es su tamaño ni su velocidad, sino su método de creación único. En lugar de entrenarse desde cero, este modelo se desarrolló a partir del modelo Qwen3-0.6B-Base utilizando tecnología de «upcycling ».

Este proceso implica dividir o copiar componentes de un modelo pequeño denso en múltiples expertos, introduciendo un mecanismo de enrutamiento. También integra una partición de submatrices de alta precisión y estrategias de «Drop-Upcycling» —descartar aleatoriamente ciertos expertos o rutas de enrutamiento durante el entrenamiento para añadir regularización y mejorar la robustez—. Este enfoque consigue convertir con éxito un modelo «Dense» puro en una arquitectura MoE, ofreciendo al sector una vía nueva, rentable y eficiente para el entrenamiento MoE.
Longitud del contexto y configuración del entrenamiento
La configuración del modelo amplía max_position_embeddings a 32K, aunque la fase de ajuste fino supervisado (SFT) utiliza un contexto de 8192 tokens. Por consiguiente, la longitud de contexto predeterminada se adapta bien a la mayoría de los escenarios de aplicación prácticos.
Avance tras el entrenamiento: destilación en cascada «on-policy»
La fase posterior al entrenamiento es igualmente impresionante: comienza con un precalentamiento mediante SFT, seguido de una estrategia de destilación «on-policy» en cascada. Inicialmente, la destilación utiliza Qwen3-30B-A3B-Instruct como modelo maestro, para luego pasar al más potente Qwen3-Next-80B-A3B-Instruct. Los datos de destilación abarcan el seguimiento de instrucciones, el razonamiento complejo, la seguridad en la alineación y las capacidades matemáticas, lo que garantiza que el modelo mantenga su eficiencia al tiempo que potencia significativamente su inteligencia general.
Resultados de las pruebas comparativas: 0,86 mil millones de parámetros activos superan a modelos densos de 4 mil millones
El Marco-Mini-Instruct final supera a muchos modelos densos, como el Qwen3-4B, en la mayoría de las pruebas de rendimiento habituales. Con solo 860 millones de parámetros activos, confirma plenamente el enorme potencial de la arquitectura MoE para ofrecer un rendimiento «pequeño pero potente».
Impacto en el sector: un nuevo paradigma de entrenamiento MoE de código abierto
AIbase cree que el mayor valor de este logro reside en abrir nuevas oportunidades para los desarrolladores. Ya no es necesario entrenar modelos MoE a gran escala desde cero; en su lugar, los equipos pueden seleccionar un modelo denso pequeño adecuado y reproducir fielmente los procesos de «upcycling» y «drop-upcycling» descritos en el artículo. El coste total del entrenamiento sigue siendo asumible: la fase SFT requiere 64 GPU durante 24 horas, y la fase de destilación necesita 64 GPU durante 110 horas, lo que reduce considerablemente el umbral para que los equipos pequeños y medianos experimenten con MoE.
La última «modificación» de Alibaba demuestra una vez más que los avances en la eficiencia de los modelos no dependen necesariamente de la acumulación de parámetros; los paradigmas de entrenamiento innovadores también pueden impulsar saltos cualitativos. El lanzamiento de Marco-Mini-Instruct acelerará sin duda la adopción de la tecnología MoE en dispositivos periféricos y en entornos de desarrollo personal, lo que lo convierte en un avance clave al que debe prestar atención todo el sector.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El equipo de Ali International Digital Commerce ha presentado Marco-Mini-Instruct, la última incorporación a la serie Marco-MoE, que demuestra cómo «las escalas más pequeñas pueden ofrecer grandes resultados». De un total de 17 300 millones de parámetros, solo 860 millones están activos (aproximadamente el 5 %), lo que permite una velocidad de inferencia excepcional que funciona con fluidez incluso en CPU estándar.

Ultraligero: optimizado para el rendimiento de la CPU
Según datos oficiales, utilizando una cuantificación de 8 bits con cuatro módulos de memoria DDR4 2400, el modelo alcanza una velocidad de inferencia de aproximadamente 30 tokens por segundo. Esta eficiencia acerca la arquitectura «Mixture-of-Experts» (MoE) a la accesibilidad generalizada, reduciendo significativamente las barreras para su implementación local.
Innovación clave: la tecnología de «upcycling» transforma el potencial
La característica más destacada de Marco-Mini-Instruct no es su tamaño ni su velocidad, sino su método de creación único. En lugar de entrenarse desde cero, este modelo se desarrolló a partir del modelo Qwen3-0.6B-Base utilizando tecnología de «upcycling ».

Este proceso implica dividir o copiar componentes de un modelo pequeño denso en múltiples expertos, introduciendo un mecanismo de enrutamiento. También integra una partición de submatrices de alta precisión y estrategias de «Drop-Upcycling» —descartar aleatoriamente ciertos expertos o rutas de enrutamiento durante el entrenamiento para añadir regularización y mejorar la robustez—. Este enfoque consigue convertir con éxito un modelo «Dense» puro en una arquitectura MoE, ofreciendo al sector una vía nueva, rentable y eficiente para el entrenamiento MoE.
Longitud del contexto y configuración del entrenamiento
La configuración del modelo amplía max_position_embeddings a 32K, aunque la fase de ajuste fino supervisado (SFT) utiliza un contexto de 8192 tokens. Por consiguiente, la longitud de contexto predeterminada se adapta bien a la mayoría de los escenarios de aplicación prácticos.
Avance tras el entrenamiento: destilación en cascada «on-policy»
La fase posterior al entrenamiento es igualmente impresionante: comienza con un precalentamiento mediante SFT, seguido de una estrategia de destilación «on-policy» en cascada. Inicialmente, la destilación utiliza Qwen3-30B-A3B-Instruct como modelo maestro, para luego pasar al más potente Qwen3-Next-80B-A3B-Instruct. Los datos de destilación abarcan el seguimiento de instrucciones, el razonamiento complejo, la seguridad en la alineación y las capacidades matemáticas, lo que garantiza que el modelo mantenga su eficiencia al tiempo que potencia significativamente su inteligencia general.
Resultados de las pruebas comparativas: 0,86 mil millones de parámetros activos superan a modelos densos de 4 mil millones
El Marco-Mini-Instruct final supera a muchos modelos densos, como el Qwen3-4B, en la mayoría de las pruebas de rendimiento habituales. Con solo 860 millones de parámetros activos, confirma plenamente el enorme potencial de la arquitectura MoE para ofrecer un rendimiento «pequeño pero potente».
Impacto en el sector: un nuevo paradigma de entrenamiento MoE de código abierto
AIbase cree que el mayor valor de este logro reside en abrir nuevas oportunidades para los desarrolladores. Ya no es necesario entrenar modelos MoE a gran escala desde cero; en su lugar, los equipos pueden seleccionar un modelo denso pequeño adecuado y reproducir fielmente los procesos de «upcycling» y «drop-upcycling» descritos en el artículo. El coste total del entrenamiento sigue siendo asumible: la fase SFT requiere 64 GPU durante 24 horas, y la fase de destilación necesita 64 GPU durante 110 horas, lo que reduce considerablemente el umbral para que los equipos pequeños y medianos experimenten con MoE.
La última «modificación» de Alibaba demuestra una vez más que los avances en la eficiencia de los modelos no dependen necesariamente de la acumulación de parámetros; los paradigmas de entrenamiento innovadores también pueden impulsar saltos cualitativos. El lanzamiento de Marco-Mini-Instruct acelerará sin duda la adopción de la tecnología MoE en dispositivos periféricos y en entornos de desarrollo personal, lo que lo convierte en un avance clave al que debe prestar atención todo el sector.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











