Hogar
Liquid AI publica en código abierto el modelo híbrido de expertos LFM2.5 para la IA en el borde
La startup de IA Liquid AI ha presentado hoy oficialmente y ha publicado en código abierto su último modelo de gran tamaño para el borde, el LFM2.5-8B-A1B . Diseñado para la ejecución de herramientas y el seguimiento de instrucciones complejas en hardware de consumo, el modelo mejora el rendimiento del razonamiento y la inferencia en dispositivos periféricos, al tiempo que mantiene los costes computacionales extremadamente bajos.
Desde el punto de vista arquitectónico, utiliza un diseño de mezcla de expertos (MoE) disperso con un total de 8.300 millones de parámetros. Gracias a esa dispersión, solo activa 1.500 millones de parámetros por token, lo que permite un funcionamiento local fluido en smartphones, ordenadores portátiles y dispositivos similares.

Contexto ampliado y razonamiento más sólido
En comparación con su predecesor, LFM2.5 amplía la ventana de contexto de 32 000 a 128 000 tokens y aumenta los datos de preentrenamiento de 12 T a 38 T de tokens. Como modelo de inferencia pura, genera una cadena de razonamiento explícita antes de ofrecer la respuesta final. Su vocabulario altamente comprimido maneja de manera eficiente nueve idiomas, incluidos el chino y el árabe.
Para reducir los bucles lógicos sin salida y las alucinaciones durante el razonamiento prolongado, el equipo de desarrollo aplicó el aprendizaje por refuerzo (RL) en dos etapas durante el entrenamiento. La optimización de preferencias reduce eficazmente los «bucles sin salida» en el razonamiento de cadena larga, mientras que un mecanismo de recompensa especializado contra las alucinaciones permite al modelo negarse activamente a responder preguntas fuera de su base de conocimientos.
Potente rendimiento en el borde y amplio soporte del ecosistema
En cuanto al rendimiento, LFM2.5 ha experimentado mejoras espectaculares. Sus puntuaciones en las pruebas de referencia de razonamiento lógico y anti-alucinaciones superan con creces a las de su predecesor, e incluso compite con modelos más grandes en el seguimiento de instrucciones. Para la llamada a herramientas, el modelo genera de forma predeterminada llamadas a funciones de Python eficientes y admite el cambio fluido al formato JSON a través de indicaciones del sistema.
El modelo recibió el soporte completo de los principales marcos de inferencia el día de su lanzamiento, incluidos llama.cpp, MLX, vLLM y SGLang. En las pruebas de hardware, alcanzó velocidades de decodificación de hasta 253 bytes por segundo en el chip M5 Max y de unos 30 bytes por segundo en dispositivos móviles, equilibrando a la perfección la privacidad y la eficiencia para implementaciones en el borde.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
La startup de IA Liquid AI ha presentado hoy oficialmente y ha publicado en código abierto su último modelo de gran tamaño para el borde,
Desde el punto de vista arquitectónico, utiliza un diseño de mezcla de expertos (MoE) disperso con un total de 8.300 millones de parámetros. Gracias a esa dispersión, solo activa 1.500 millones de parámetros por token, lo que permite un funcionamiento local fluido en smartphones, ordenadores portátiles y dispositivos similares.

Contexto ampliado y razonamiento más sólido
En comparación con su predecesor, LFM2.5 amplía la ventana de contexto de 32 000 a 128 000 tokens y aumenta los datos de preentrenamiento de 12 T a 38 T de tokens. Como modelo de inferencia pura, genera una cadena de razonamiento explícita antes de ofrecer la respuesta final. Su vocabulario altamente comprimido maneja de manera eficiente nueve idiomas, incluidos el chino y el árabe.
Para reducir los bucles lógicos sin salida y las alucinaciones durante el razonamiento prolongado, el equipo de desarrollo aplicó el aprendizaje por refuerzo (RL) en dos etapas durante el entrenamiento. La optimización de preferencias reduce eficazmente los «bucles sin salida» en el razonamiento de cadena larga, mientras que un mecanismo de recompensa especializado contra las alucinaciones permite al modelo negarse activamente a responder preguntas fuera de su base de conocimientos.
Potente rendimiento en el borde y amplio soporte del ecosistema
En cuanto al rendimiento, LFM2.5 ha experimentado mejoras espectaculares. Sus puntuaciones en las pruebas de referencia de razonamiento lógico y anti-alucinaciones superan con creces a las de su predecesor, e incluso compite con modelos más grandes en el seguimiento de instrucciones. Para la llamada a herramientas, el modelo genera de forma predeterminada llamadas a funciones de Python eficientes y admite el cambio fluido al formato JSON a través de indicaciones del sistema.
El modelo recibió el soporte completo de los principales marcos de inferencia el día de su lanzamiento, incluidos llama.cpp, MLX, vLLM y SGLang. En las pruebas de hardware, alcanzó velocidades de decodificación de hasta 253 bytes por segundo en el chip M5 Max y de unos 30 bytes por segundo en dispositivos móviles, equilibrando a la perfección la privacidad y la eficiencia para implementaciones en el borde.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











