Maison
Liquid AI met en open source son modèle expert hybride LFM2.5 destiné à l'IA en périphérie
La start-up spécialisée dans l'IA Liquid AI a officiellement lancé et mis en open source aujourd'hui son dernier modèle de grande envergure destiné à la périphérie, le LFM2.5-8B-A1B . Conçu pour l'appel d'outils et l'exécution d'instructions complexes sur du matériel grand public, ce modèle améliore les performances de raisonnement et d'inférence sur les appareils périphériques tout en maintenant des coûts de calcul extrêmement bas.
Sur le plan architectural, il utilise une conception de type « mixture-of-experts » (MoE) clairsemée, avec un total de 8,3 milliards de paramètres. Grâce à cette clairsemée, il n'active que 1,5 milliard de paramètres par token, ce qui permet un fonctionnement local fluide sur les smartphones, les ordinateurs portables et les appareils similaires.

Contexte étendu et raisonnement plus solide
Par rapport à son prédécesseur, LFM2.5 étend la fenêtre de contexte de 32 000 à 128 000 tokens et augmente le volume de données de pré-entraînement de 12 T à 38 T de tokens. En tant que modèle d'inférence pur, il produit une chaîne de raisonnement explicite avant de fournir la réponse finale. Son vocabulaire hautement compressé prend efficacement en charge neuf langues, dont le chinois et l'arabe.
Afin de réduire les boucles logiques sans issue et les hallucinations lors de raisonnements longs, l'équipe de développement a appliqué un apprentissage par renforcement (RL) en deux étapes pendant l'entraînement. L'optimisation des préférences réduit efficacement les « boucles sans issue » dans les raisonnements à longue chaîne, tandis qu'un mécanisme de récompense anti-hallucination spécialisé permet au modèle de refuser activement de répondre à des questions hors de sa base de connaissances.
Performances de pointe en périphérie et prise en charge d'un vaste écosystème
En termes de performances, LFM2.5 a enregistré des gains spectaculaires. Ses scores aux benchmarks de raisonnement logique et d’anti-hallucination surpassent de loin ceux de son prédécesseur, et il rivalise même avec des modèles plus volumineux en matière de suivi d’instructions. Pour l’appel d’outils, le modèle génère par défaut des appels de fonctions Python efficaces et prend en charge le passage transparent au format JSON via des invites système.
Le modèle a bénéficié d'une prise en charge complète par les principaux frameworks d'inférence dès son lancement, notamment llama.cpp, MLX, vLLM et SGLang. Lors des tests matériels, il a atteint des vitesses de décodage allant jusqu'à 253 octets par seconde sur la puce M5 Max et environ 30 octets par seconde sur les appareils mobiles, offrant un équilibre parfait entre confidentialité et efficacité pour les déploiements en périphérie.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (1)
La start-up spécialisée dans l'IA Liquid AI a officiellement lancé et mis en open source aujourd'hui son dernier modèle de grande envergure destiné à la périphérie,
Sur le plan architectural, il utilise une conception de type « mixture-of-experts » (MoE) clairsemée, avec un total de 8,3 milliards de paramètres. Grâce à cette clairsemée, il n'active que 1,5 milliard de paramètres par token, ce qui permet un fonctionnement local fluide sur les smartphones, les ordinateurs portables et les appareils similaires.

Contexte étendu et raisonnement plus solide
Par rapport à son prédécesseur, LFM2.5 étend la fenêtre de contexte de 32 000 à 128 000 tokens et augmente le volume de données de pré-entraînement de 12 T à 38 T de tokens. En tant que modèle d'inférence pur, il produit une chaîne de raisonnement explicite avant de fournir la réponse finale. Son vocabulaire hautement compressé prend efficacement en charge neuf langues, dont le chinois et l'arabe.
Afin de réduire les boucles logiques sans issue et les hallucinations lors de raisonnements longs, l'équipe de développement a appliqué un apprentissage par renforcement (RL) en deux étapes pendant l'entraînement. L'optimisation des préférences réduit efficacement les « boucles sans issue » dans les raisonnements à longue chaîne, tandis qu'un mécanisme de récompense anti-hallucination spécialisé permet au modèle de refuser activement de répondre à des questions hors de sa base de connaissances.
Performances de pointe en périphérie et prise en charge d'un vaste écosystème
En termes de performances, LFM2.5 a enregistré des gains spectaculaires. Ses scores aux benchmarks de raisonnement logique et d’anti-hallucination surpassent de loin ceux de son prédécesseur, et il rivalise même avec des modèles plus volumineux en matière de suivi d’instructions. Pour l’appel d’outils, le modèle génère par défaut des appels de fonctions Python efficaces et prend en charge le passage transparent au format JSON via des invites système.
Le modèle a bénéficié d'une prise en charge complète par les principaux frameworks d'inférence dès son lancement, notamment llama.cpp, MLX, vLLM et SGLang. Lors des tests matériels, il a atteint des vitesses de décodage allant jusqu'à 253 octets par seconde sur la puce M5 Max et environ 30 octets par seconde sur les appareils mobiles, offrant un équilibre parfait entre confidentialité et efficacité pour les déploiements en périphérie.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











