option
Maison
Nouvelles
Meituan dévoile son modèle d'IA LongCat-Next, doté d'une architecture unifiée pour la vision et la parole

Meituan dévoile son modèle d'IA LongCat-Next, doté d'une architecture unifiée pour la vision et la parole

12 avril 2026
179

Meituan dévoile son modèle d

Le 3 avril, l'équipe MiTi a officiellement lancé LongCat-Next, un grand modèle multimodal natif. Ce modèle va au-delà de l'approche classique « base linguistique plus plugins » en convertissant les images, l'audio et le texte en un flux unifié de tokens discrets. Cela permet à l'IA de « voir » et d'« entendre » le monde physique de manière native, en traitant ces données de la même manière qu'elle traite le texte.

Cœur technique : l'architecture DiNA permet l'« internalisation des modalités »

Afin d'éliminer les barrières entre les différents types de données, MiTi a développé l'architecture DiNA (Discrete Native Autoregressive), parvenant ainsi à une unification profonde de la modélisation multimodale :

Unification complète des modalités : le modèle utilise les mêmes paramètres, mécanismes d'attention et fonctions de perte pour le texte, les images et l'audio.

Symétrie entre compréhension et génération : au sein d’un cadre mathématique unique, la prédiction du prochain token de texte constitue la « compréhension », tandis que la prédiction d’un token d’image correspond à la « génération ». Ces deux processus présentent des avantages synergiques significatifs pendant l’entraînement.

Compression extrême : grâce au dNaViT Visual Tokenizer, il traite les entrées quelle que soit leur résolution. Grâce à un processus de quantification vectorielle résiduelle à 8 couches, il atteint une compression pouvant aller jusqu’à 28 fois dans l’espace pixel tout en préservant les détails critiques pour des tâches telles que la reconnaissance optique de caractères (OCR) et l’analyse de documents financiers.

Performances empiriques : la modélisation discrète n'a pas de limites intrinsèques

LongCat-Next offre des performances qui surpassent celles des modèles spécialisés sur plusieurs benchmarks, remettant ainsi en cause la notion traditionnelle selon laquelle « la discrétisation entraîne inévitablement une perte d'informations » :

Perception fine : sur l'OmniDocBench pour les scénarios de texte dense, il surpasse non seulement Qwen3-Omni, mais aussi le modèle de vision spécialisé Qwen3-VL.

Raisonnement visuel : il a obtenu un score impressionnant de 83,1 sur MathVista, démontrant un raisonnement logique robuste et de niveau industriel.

Collaboration intermodale : tout en conservant des capacités linguistiques de pointe (C-Eval 86,80), il prend en charge la génération parallèle à faible latence de texte et de parole, ainsi que le clonage vocal personnalisable.

Perspective industrielle : un fondement pour l'IA du monde physique

Les grands modèles linguistiques ont longtemps été centrés sur le texte. La percée de LongCat-Next réside dans la preuve qu'il est possible de discrétiser et de modéliser les informations du monde physique à l'instar du langage. Lorsqu'une IA possède une « langue maternelle » unifiée, elle devient plus intelligente et intuitive pour utiliser des outils, écrire du code ou interpréter des graphiques complexes.

MiTi a désormais mis en open source le modèle LongCat-Next et le tokeniseur dNaViT. Cette architecture native discrète, efficace et à fort potentiel, fournit aux développeurs les outils essentiels pour créer une IA capable de percevoir le monde réel et d'interagir avec lui.

Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin. PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin. Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
chatbot Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne
Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne

2026 Dernières Meilleures Applications de Chat IA pour le Jeu de Rôle, les plus bien notées pour la Pratique des Langues, la Préparation aux Entretiens et la Fluidité Quotidienne ! XIX.AI sélectionne une collection puissante et révolutionnaire qui propose une comparaison gratuit vs payant, des tests en conditions réelles et des classements mis à jour chaque semaine. Ces outils à essayer absolument vous aident à améliorer vos compétences en écriture, à surmonter les défis de fluidité et à optimiser l’efficacité de la communication dans tous les scénarios quotidiens. Explorez dès maintenant pour découvrir l’outil parfait pour votre progression linguistique !

10 outils
xix.ai
Composition musicale Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké
Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké

2026 : Les meilleures et plus récentes outils de séparation des pistes audio par IA, hautement notés, sélectionnés spécialement pour la production de remix, la préparation de samples et l’enregistrement de karaokés. Ces outils puissants et révolutionnaires, éprouvés dans des conditions réelles, permettent une isolation audio précise, ce qui améliore considérablement la productivité. XIX.AI propose un guide de comparaison gratuit mis à jour chaque semaine entre les versions payantes et gratuites, afin de vous aider à trouver la solution idéale adaptée à vos besoins. Découvrez-les dès maintenant pour tirer parti des avantages offerts par l’IA.

8 outils
xix.ai
Analyse des données Copilotes SQL basés sur l’IA pour les tableaux de bord de chiffre d’affaires, l’analyse des funnels et les indicateurs de produits
Copilotes SQL basés sur l’IA pour les tableaux de bord de chiffre d’affaires, l’analyse des funnels et les indicateurs de produits

2026 : Les meilleurs copilotes AI SQL actuels, classés parmi les plus performants ! XIX.AI a sélectionné une collection puissante et révolutionnaire, mise à jour chaque semaine grâce à des tests concrets. Ces outils indispensables vous aident à créer des tableaux de bord financiers précis, à analyser les canaux de vente et à suivre en temps réel les indicateurs produits, ce qui améliore considérablement votre productivité. Découvrez-les dès maintenant pour trouver l’outil idéal pour des décisions basées sur les données ! 238 caractères

9 outils
xix.ai
Composition musicale Meilleurs outils d’écriture de mélodies par IA pour les ébauches de chansons
Meilleurs outils d’écriture de mélodies par IA pour les ébauches de chansons

2026 Derniers Meilleurs Outils d’Écriture de Mélodie par IA les Mieux Notés pour des Ébauches de Chansons ! XIX.AI a sélectionné une collection hautement puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles, afin d’offrir la meilleure expérience d’écriture. Vous pouvez y trouver des comparaisons détaillées entre versions gratuites et payantes, des classements précis, ainsi que des options incontournables conçues pour vous aider à créer sans effort des ébauches de chansons remarquables et à booster significativement votre productivité créative. Explorez dès maintenant pour découvrir l’outil qui vous correspond parfaitement !

8 outils
xix.ai
chatbot Meilleurs outils d’entraînement à la conversation par IA pour la préparation aux entretiens
Meilleurs outils d’entraînement à la conversation par IA pour la préparation aux entretiens

Les derniers outils de formation à la conversation par IA les mieux notés pour 2026 sont disponibles sur XIX.AI ! Cette sélection rigoureuse propose des outils puissants et révolutionnaires, testés rigoureusement dans des conditions réelles pour fournir des retours précis. Vous y trouverez une comparaison entre les versions gratuites et payantes, ainsi que des classements détaillés pour vous aider à choisir l’option incontournable qui renforce votre confiance et vos compétences. Explorez dès maintenant pour découvrir l’outil parfait pour réussir vos entretiens !

12 outils
xix.ai
Conception et art Les meilleurs outils de transfert de style basés sur l'IA pour des expériences créatives
Les meilleurs outils de transfert de style basés sur l'IA pour des expériences créatives

Les meilleurs outils de transfert de style par IA de 2026, les mieux notés, pour des expériences créatives ! XIX.AI a sélectionné une collection d’outils puissants et révolutionnaires à essayer absolument, qui offrent des résultats exceptionnels grâce à des tests en conditions réelles et à un classement rigoureux. Ces solutions de pointe aident les créatifs à booster considérablement leur productivité en accélérant la création de contenu et en ouvrant la voie à des possibilités créatives infinies. Découvrez-les dès maintenant pour trouver l'outil qui vous convient le mieux et commencez à créer dès aujourd'hui !

9 outils
xix.ai
commentaires (1)
0/500
CharlesHernández
CharlesHernández 16 mai 2026 20:00:15 UTC+02:00

Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐

OR