opción
Hogar
Última hora
Contenido
MichaelMartinez
MichaelMartinez
14 de abril de 2026

El desarrollador JeecgBoot probó un modelo de destilación modificado por la comunidad en un Mac Studio M4Max, logrando velocidades de generación entre 5 y 6 veces más rápidas que la versión oficial. El modelo, que utiliza una arquitectura A4B MoE con un total de 26 000 millones de parámetros, activaba solo unos 4 000 millones por inferencia, alcanzando hasta 78 tokens por segundo y admitiendo un contexto de 256 000. Aunque la generación es rápida, los flujos de trabajo complejos de Agentic para tareas como la generación de código pueden tardar aproximadamente 1,5 minutos debido a las cadenas de decisión de varios pasos. La prueba generó con éxito un esqueleto de proyecto JeecgBoot estandarizado. Se recomienda una estrategia de doble modelo: utilizar el modelo modificado local para la mayoría de las tareas (como CRUD) por motivos de privacidad y ahorro de costes, y las API en la nube para necesidades de diseño complejas.

El desarrollador JeecgBoot probó un modelo de destilación modificado por la comunidad en un Mac Studio M4Max, logrando velocidades de generación entre 5 y 6 veces más rápidas que la versión oficial. El modelo, que utiliza una arquitectura A4B MoE con un total de 26 000 millones de parámetros, activaba solo unos 4 000 millones por inferencia, alcanzando hasta 78 tokens por segundo y admitiendo un contexto de 256 000. Aunque la generación es rápida, los flujos de trabajo complejos de Agentic para tareas como la generación de código pueden tardar aproximadamente 1,5 minutos debido a las cadenas de decisión de varios pasos. La prueba generó con éxito un esqueleto de proyecto JeecgBoot estandarizado. Se recomienda una estrategia de doble modelo: utilizar el modelo modificado local para la mayoría de las tareas (como CRUD) por motivos de privacidad y ahorro de costes, y las API en la nube para necesidades de diseño complejas. El desarrollador JeecgBoot probó un modelo de destilación modificado por la comunidad en un Mac Studio M4Max, logrando velocidades de generación entre 5 y 6 veces más rápidas que la versión oficial. El modelo, que utiliza una arquitectura A4B MoE con un total de 26 000 millones de parámetros, activaba solo unos 4 000 millones por inferencia, alcanzando hasta 78 tokens por segundo y admitiendo un contexto de 256 000. Aunque la generación es rápida, los flujos de trabajo complejos de Agentic para tareas como la generación de código pueden tardar aproximadamente 1,5 minutos debido a las cadenas de decisión de varios pasos. La prueba generó con éxito un esqueleto de proyecto JeecgBoot estandarizado. Se recomienda una estrategia de doble modelo: utilizar el modelo modificado local para la mayoría de las tareas (como CRUD) por motivos de privacidad y ahorro de costes, y las API en la nube para necesidades de diseño complejas. El desarrollador JeecgBoot probó un modelo de destilación modificado por la comunidad en un Mac Studio M4Max, logrando velocidades de generación entre 5 y 6 veces más rápidas que la versión oficial. El modelo, que utiliza una arquitectura A4B MoE con un total de 26 000 millones de parámetros, activaba solo unos 4 000 millones por inferencia, alcanzando hasta 78 tokens por segundo y admitiendo un contexto de 256 000. Aunque la generación es rápida, los flujos de trabajo complejos de Agentic para tareas como la generación de código pueden tardar aproximadamente 1,5 minutos debido a las cadenas de decisión de varios pasos. La prueba generó con éxito un esqueleto de proyecto JeecgBoot estandarizado. Se recomienda una estrategia de doble modelo: utilizar el modelo modificado local para la mayoría de las tareas (como CRUD) por motivos de privacidad y ahorro de costes, y las API en la nube para necesidades de diseño complejas.
comentario (0)
0/300
OR