Maison
Ant Group dévoile Ling-2.6-flash, un modèle open source qui vient compléter la famille de modèles Baoling
La série de grands modèles Baoling d'Ant Group a fait l'objet d'une mise à jour majeure aujourd'hui, Ling-2.6-flash étant désormais officiellement accessible aux développeurs du monde entier. Afin de s'adapter à différents environnements matériels et de réduire les obstacles au déploiement, ce modèle propose également plusieurs versions de précision, notamment BF16, FP8 et INT4, offrant ainsi aux développeurs des options d'inférence plus flexibles.
Modèle Instruct comptant 104 milliards de paramètres au total et 7,4 milliards de paramètres activés, Ling-2.6-flash avait auparavant été testé sous le nom de code « Elephant Alpha » sur la plateforme OpenRouter. Au cours d'une période d'essai de deux semaines, l'équipe de développement a recueilli de nombreux retours d'expérience concrets et procédé à des optimisations ciblées, améliorant notamment la fluidité du passage du chinois à l'anglais et la compatibilité avec les principaux frameworks de programmation.

Points forts techniques : architecture hybride et efficacité supérieure
La force principalede Ling-2.6-flash réside dans son architecture unique et sa grande efficacité opérationnelle :
Architecture linéaire hybride : grâce à une optimisation computationnelle de bas niveau, le modèle atteint une excellente vitesse d'inférence. Avec 4 cartes H20, il atteint jusqu'à 340 tokens/s. En débit de préremplissage, il offre un rendement 2,2 fois supérieur à celui de Nemotron-3-Super, réduisant ainsi considérablement la latence de réponse.
Ratio d'efficacité des tokens remarquable : l'équipe a méticuleusement calibré l'efficacité des tokens pendant l'entraînement. Les données d'évaluation montrent que pour des tâches de qualité équivalente, Ling-2.6-flash ne consomme qu'environ 15 millions de tokens — soit environ un dixième de ses concurrents comparables —, ce qui réduit considérablement les coûts commerciaux.
Approfondissement des scénarios : améliorations ciblées des capacités des agents
Pour les scénarios d'agents — l'un des cas d'utilisation les plus courants des grands modèles —,Ling-2.6-flash a été spécifiquement amélioré. Qu'il s'agisse de gérer des appels d'outils complexes, une planification en plusieurs étapes ou l'exécution finale d'une tâche, le modèle fonctionne de manière fiable. Dans plusieurs évaluations de référence telles que BFCL-V4 et SWE-bench, même comparé à des modèles dotés d'un plus grand nombre de paramètres activés, Ling-2.6-flash maintient des performances comparables, voire de pointe (SOTA).
Les développeurs peuvent désormais accéder aux ressources open source du modèle via Hugging Face et ModelScope (Moba Community), ce qui ouvre la voie à une exploration plus approfondie de son potentiel dans diverses applications industrielles.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
La série de grands modèles Baoling d'Ant Group a fait l'objet d'une mise à jour majeure aujourd'hui,
Modèle Instruct comptant 104 milliards de paramètres au total et 7,4 milliards de paramètres activés,

Points forts techniques : architecture hybride et efficacité supérieure
La force principale
Architecture linéaire hybride : grâce à une optimisation computationnelle de bas niveau, le modèle atteint une excellente vitesse d'inférence. Avec 4 cartes H20, il atteint jusqu'à 340 tokens/s. En débit de préremplissage, il offre un rendement 2,2 fois supérieur à celui de Nemotron-3-Super, réduisant ainsi considérablement la latence de réponse.
Ratio d'efficacité des tokens remarquable : l'équipe a méticuleusement calibré l'efficacité des tokens pendant l'entraînement. Les données d'évaluation montrent que pour des tâches de qualité équivalente,
Approfondissement des scénarios : améliorations ciblées des capacités des agents
Pour les scénarios d'agents — l'un des cas d'utilisation les plus courants des grands modèles —,
Les développeurs peuvent désormais accéder aux ressources open source du modèle via Hugging Face et ModelScope (Moba Community), ce qui ouvre la voie à une exploration plus approfondie de son potentiel dans diverses applications industrielles.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











