Maison
AntGroup dévoile Ling-3.0-flash-VL, un grand modèle multimodal natif de 124 milliards de paramètres

L’équipe Ant Open Source a officiellement lancé Ling-3.0-flash-VL, le premier modèle de langage multimodal natif de la série Bailing. Basé sur l’architecture MoE de Ling-3.0-flash, ce modèle compte 124 milliards de paramètres au total, avec seulement 5,5 milliards activés par inférence. Il prend nativement en charge les entrées d’images, de texte et de vidéo dans une fenêtre de contexte de 256K tokens.
Au cours du développement, l’équipe a priorisé l’amélioration de la fiabilité et de l’efficacité des grands modèles dans des tâches réelles. Face aux préoccupations de l’industrie selon lesquelles l’ajout de capacités visuelles pourrait dégrader l’intelligence textuelle, les résultats de l’entraînement ont prouvé le contraire : l’entraînement multimodal natif conjoint non seulement a élargi les frontières des applications, mais a également encore stimulé l’intelligence textuelle.
Pour garantir une exécution précise, Ling-3.0-flash-VL introduit un mécanisme de feedback visuel innovant. En mettant en œuvre un processus en boucle fermée consistant à observer les résultats, à les comparer aux objectifs, à identifier les écarts et à corriger continuellement, le modèle passe d’une génération statique à une auto-correction dynamique, améliorant significativement la fiabilité des résultats.
De plus, le modèle conserve la force principale de Ling-3.0-flash en tant que nœud d’exécution efficace dans les workflows d’agents. Au sein des boucles de feedback visuel, il équilibre parfaitement la qualité de sortie et l’efficacité d’exécution, permettant d’achever des tâches complexes plus rapidement et à moindre coût.
Article connexe
OpenAI reporte son introduction en bourse à 2027, alors que sa valorisation atteint 1 200 milliards de dollars
OpenAI, pionnier de l’intelligence artificielle, négocie actuellement un financement privé avec des investisseurs en vue d’une valorisation stupéfiante de 1 200 milliards de dollars. Ce chiffre marque un bond spectaculaire par rapport à la valorisati
Microsoft Outlook Classic va intégrer l'IA Copilot pour la rédaction d'e-mails sous Windows 10 et 11
Selon Windows Latest, Microsoft prévoit de déployer la mise à jour Copilot sur la version classique d’Outlook pour Windows 10 et 11 d’ici fin 2026, introduisant ainsi une fonctionnalité de « rédaction
L'IA « Seedance » de Volcano Engine réoriente ses priorités : désormais, la commercialisation de la propriété intellectuelle prime sur la protection des droits d'auteur
Yule Capital rapporte que Huoshan Engine, filiale de ByteDance, a invité plusieurs titulaires de droits d’auteur à tester la version bêta de sa nouvelle « plateforme de gestion des droits d’auteur bas
Recommandations de sujets spéciaux liés
commentaires (0)

L’équipe Ant Open Source a officiellement lancé Ling-3.0-flash-VL, le premier modèle de langage multimodal natif de la série Bailing. Basé sur l’architecture MoE de Ling-3.0-flash, ce modèle compte 124 milliards de paramètres au total, avec seulement 5,5 milliards activés par inférence. Il prend nativement en charge les entrées d’images, de texte et de vidéo dans une fenêtre de contexte de 256K tokens.
Au cours du développement, l’équipe a priorisé l’amélioration de la fiabilité et de l’efficacité des grands modèles dans des tâches réelles. Face aux préoccupations de l’industrie selon lesquelles l’ajout de capacités visuelles pourrait dégrader l’intelligence textuelle, les résultats de l’entraînement ont prouvé le contraire : l’entraînement multimodal natif conjoint non seulement a élargi les frontières des applications, mais a également encore stimulé l’intelligence textuelle.
Pour garantir une exécution précise, Ling-3.0-flash-VL introduit un mécanisme de feedback visuel innovant. En mettant en œuvre un processus en boucle fermée consistant à observer les résultats, à les comparer aux objectifs, à identifier les écarts et à corriger continuellement, le modèle passe d’une génération statique à une auto-correction dynamique, améliorant significativement la fiabilité des résultats.
De plus, le modèle conserve la force principale de Ling-3.0-flash en tant que nœud d’exécution efficace dans les workflows d’agents. Au sein des boucles de feedback visuel, il équilibre parfaitement la qualité de sortie et l’efficacité d’exécution, permettant d’achever des tâches complexes plus rapidement et à moindre coût.
OpenAI reporte son introduction en bourse à 2027, alors que sa valorisation atteint 1 200 milliards de dollars
OpenAI, pionnier de l’intelligence artificielle, négocie actuellement un financement privé avec des investisseurs en vue d’une valorisation stupéfiante de 1 200 milliards de dollars. Ce chiffre marque un bond spectaculaire par rapport à la valorisati
Microsoft Outlook Classic va intégrer l'IA Copilot pour la rédaction d'e-mails sous Windows 10 et 11
Selon Windows Latest, Microsoft prévoit de déployer la mise à jour Copilot sur la version classique d’Outlook pour Windows 10 et 11 d’ici fin 2026, introduisant ainsi une fonctionnalité de « rédaction
L'IA « Seedance » de Volcano Engine réoriente ses priorités : désormais, la commercialisation de la propriété intellectuelle prime sur la protection des droits d'auteur
Yule Capital rapporte que Huoshan Engine, filiale de ByteDance, a invité plusieurs titulaires de droits d’auteur à tester la version bêta de sa nouvelle « plateforme de gestion des droits d’auteur bas











