Maison
L'attaque de réduction des dimensions du modèle 1.3B de MiniCPM-V 4.6 redéfinit la technologie multimodale en périphérie
Le 11 mai, Mingshi Intelligence s'est associée à l'université de Tsinghua et à la communauté open source OpenBMB pour dévoiler le nouveau modèle multimodal de grande envergure destiné à la périphérie , le MiniCPM-V4.6. Malgré sa taille compacte — seulement 1,3 milliard de paramètres —, ce modèle léger repousse les limites des modèles plus volumineux grâce à une densité intelligente exceptionnelle et à une adaptabilité multiplateforme, accélérant ainsi le déploiement concret de l’IA en périphérie.

1. Performances de pointe : 1,3 milliard de paramètres pour des résultats exceptionnels
MiniCPM-V4.6 se décline en deux versions — « Instruct » et « Thinking » — qui font toutes deux preuve d’une capacité de raisonnement et de compréhension impressionnante dans divers tests de performance, par rapport à des modèles de taille similaire.
Leadership mondial : dans le classement Artificial Analysis (AA), MiniCPM-V4.6 a obtenu un score impressionnant de 13 points, surpassant largement ses concurrents de taille similaire (par exemple, le Qwen3.5-0.8B d’Alibaba et le Gemma4-E2B-it de Google) tout en égalant presque les performances de modèles plus volumineux comme le Qwen3.5-2B. Cela établit une nouvelle référence pour les modèles à 1 milliard de paramètres.
Capacités avancées : De la compréhension générale image-texte et du raisonnement mathématique complexe en sciences, technologie, ingénierie et mathématiques (STEM) à la reconnaissance optique de caractères (OCR) de documents exigeants et à la compréhension temporelle des vidéos, le modèle fait preuve d’une grande intelligence. La version « Thinking », en particulier, excelle dans le raisonnement multi-images et la suppression des hallucinations.
2. Percée en matière d’efficacité : une densité intelligente extrême en périphérie
Pour pallier les contraintes de mémoire liées au déploiement en périphérie, MiniCPM-V4.6 a été profondément optimisé en termes de vitesse d’inférence et d’efficacité des ressources.
Faible empreinte mémoire : les besoins en mémoire sont réduits à seulement 6 Go, ce qui permet un fonctionnement fluide sur les smartphones, PC et appareils domestiques connectés courants.
Efficacité de l’inférence : grâce à la technologie vLLM, le débit d’inférence est 1,5 fois supérieur à celui des concurrents. Lors du traitement d’une image ultra-haute définition de 3 136² à la périphérie, la latence de la première réponse n’est que de 75,7 ms, soit 2,2 fois plus rapide que les modèles concurrents.
Débit : un seul GPU permet de générer du texte à un rythme de 7 013 tokens par seconde et peut traiter des images de 1 344² à une cadence de 54,79 images par seconde, démontrant ainsi une efficacité remarquable.
3. Technologie de base : LLaVA-UHD v4 minimise la surcharge
La conception allégée du modèle est rendue possible par LLaVA-UHD v4, développé conjointement par Mingshi Intelligence et l’université de Tsinghua.
Refonte de l’encodage : grâce à un module d’encodage d’images ViT repensé et à un module de compression superficielle, la surcharge liée à l’encodage des images est réduite de 50 % et les opérations en virgule flottante haute résolution de 55,8 %.
Compression hybride : elle introduit une compression hybride de jetons 4×/16× qui permet de basculer de manière flexible entre les modes « performance d’abord » et « vitesse d’abord ». Cette technologie a été validée dans le modèle de recommandation OneRec de Kuaishou, qui gère un trafic massif.
4. Déploiement dans l’écosystème : du laboratoire à l’industrie
La publication en open source de MiniCPM-V4.6 marque une étape importante tant sur le plan technique que pour l’écosystème.
Développement simplifié : elle s’intègre de manière transparente à des frameworks de réglage fin tels que ms-swift et LLaMA-Factory, permettant un réglage fin à grande échelle sur un seul GPU RTX 4090.
Prise en charge multiplateforme : compatible avec vLLM, Ollama et d’autres frameworks majeurs, il propose des versions de test pour iOS, Android et HarmonyOS, étendant ainsi l’IA à une gamme plus large de matériels.
Impact concret : cette série de modèles est déjà déployée dans les secteurs de l’automobile, de l’informatique, de la maison connectée et de l’inspection industrielle, avec des partenaires tels que Lenovo, Geely, SAIC Volkswagen, Xiaomi et OPPO.
Article connexe
L'équipe de Li Feifei dévoile une méthode permettant de générer une infinité de terrains d'entraînement pour robots à partir d'une seule vidéo
Dans le domaine de l’intelligence incarnée, combler le fossé entre la simulation et la réalité — un processus connu sous le nom de « Sim2Real » — constitue depuis longtemps un obstacle tenace. Les ins
Rapport Adobe Creator : 80 % des personnes interrogées affirment que l'IA favorise la croissance de leur communauté et de leur activité
Alors que l'intelligence artificielle accélère son expansion mondiale, le secteur de la création de contenu connaît une mutation profonde. Les outils d'IA créative ne se contentent plus d'optimiser le
Google se déclare un acteur majeur dans la conception de l'IA
Lors de sa conférence annuelle I/O mardi, Google a dévoilé Pics, un nouvel outil de conception et de création d’images alimenté par l’intelligence artificielle pour Google Workspace. L’entreprise indique que cette application est conçue pour être acc
Recommandations de sujets spéciaux liés
commentaires (0)
Le 11 mai, Mingshi Intelligence s'est associée à l'université de Tsinghua et à la communauté open source OpenBMB pour dévoiler le nouveau modèle multimodal de grande envergure destiné à la périphérie , le MiniCPM-V4.6. Malgré sa taille compacte — seulement 1,3 milliard de paramètres —, ce modèle léger repousse les limites des modèles plus volumineux grâce à une densité intelligente exceptionnelle et à une adaptabilité multiplateforme, accélérant ainsi le déploiement concret de l’IA en périphérie.

1. Performances de pointe : 1,3 milliard de paramètres pour des résultats exceptionnels
MiniCPM-V4.6 se décline en deux versions — « Instruct » et « Thinking » — qui font toutes deux preuve d’une capacité de raisonnement et de compréhension impressionnante dans divers tests de performance, par rapport à des modèles de taille similaire.
Leadership mondial : dans le classement Artificial Analysis (AA), MiniCPM-V4.6 a obtenu un score impressionnant de 13 points, surpassant largement ses concurrents de taille similaire (par exemple, le Qwen3.5-0.8B d’Alibaba et le Gemma4-E2B-it de Google) tout en égalant presque les performances de modèles plus volumineux comme le Qwen3.5-2B. Cela établit une nouvelle référence pour les modèles à 1 milliard de paramètres.
Capacités avancées : De la compréhension générale image-texte et du raisonnement mathématique complexe en sciences, technologie, ingénierie et mathématiques (STEM) à la reconnaissance optique de caractères (OCR) de documents exigeants et à la compréhension temporelle des vidéos, le modèle fait preuve d’une grande intelligence. La version « Thinking », en particulier, excelle dans le raisonnement multi-images et la suppression des hallucinations.
2. Percée en matière d’efficacité : une densité intelligente extrême en périphérie
Pour pallier les contraintes de mémoire liées au déploiement en périphérie, MiniCPM-V4.6 a été profondément optimisé en termes de vitesse d’inférence et d’efficacité des ressources.
Faible empreinte mémoire : les besoins en mémoire sont réduits à seulement 6 Go, ce qui permet un fonctionnement fluide sur les smartphones, PC et appareils domestiques connectés courants.
Efficacité de l’inférence : grâce à la technologie vLLM, le débit d’inférence est 1,5 fois supérieur à celui des concurrents. Lors du traitement d’une image ultra-haute définition de 3 136² à la périphérie, la latence de la première réponse n’est que de 75,7 ms, soit 2,2 fois plus rapide que les modèles concurrents.
Débit : un seul GPU permet de générer du texte à un rythme de 7 013 tokens par seconde et peut traiter des images de 1 344² à une cadence de 54,79 images par seconde, démontrant ainsi une efficacité remarquable.
3. Technologie de base : LLaVA-UHD v4 minimise la surcharge
La conception allégée du modèle est rendue possible par LLaVA-UHD v4, développé conjointement par Mingshi Intelligence et l’université de Tsinghua.
Refonte de l’encodage : grâce à un module d’encodage d’images ViT repensé et à un module de compression superficielle, la surcharge liée à l’encodage des images est réduite de 50 % et les opérations en virgule flottante haute résolution de 55,8 %.
Compression hybride : elle introduit une compression hybride de jetons 4×/16× qui permet de basculer de manière flexible entre les modes « performance d’abord » et « vitesse d’abord ». Cette technologie a été validée dans le modèle de recommandation OneRec de Kuaishou, qui gère un trafic massif.
4. Déploiement dans l’écosystème : du laboratoire à l’industrie
La publication en open source de MiniCPM-V4.6 marque une étape importante tant sur le plan technique que pour l’écosystème.
Développement simplifié : elle s’intègre de manière transparente à des frameworks de réglage fin tels que ms-swift et LLaMA-Factory, permettant un réglage fin à grande échelle sur un seul GPU RTX 4090.
Prise en charge multiplateforme : compatible avec vLLM, Ollama et d’autres frameworks majeurs, il propose des versions de test pour iOS, Android et HarmonyOS, étendant ainsi l’IA à une gamme plus large de matériels.
Impact concret : cette série de modèles est déjà déployée dans les secteurs de l’automobile, de l’informatique, de la maison connectée et de l’inspection industrielle, avec des partenaires tels que Lenovo, Geely, SAIC Volkswagen, Xiaomi et OPPO.
L'équipe de Li Feifei dévoile une méthode permettant de générer une infinité de terrains d'entraînement pour robots à partir d'une seule vidéo
Dans le domaine de l’intelligence incarnée, combler le fossé entre la simulation et la réalité — un processus connu sous le nom de « Sim2Real » — constitue depuis longtemps un obstacle tenace. Les ins
Rapport Adobe Creator : 80 % des personnes interrogées affirment que l'IA favorise la croissance de leur communauté et de leur activité
Alors que l'intelligence artificielle accélère son expansion mondiale, le secteur de la création de contenu connaît une mutation profonde. Les outils d'IA créative ne se contentent plus d'optimiser le
Google se déclare un acteur majeur dans la conception de l'IA
Lors de sa conférence annuelle I/O mardi, Google a dévoilé Pics, un nouvel outil de conception et de création d’images alimenté par l’intelligence artificielle pour Google Workspace. L’entreprise indique que cette application est conçue pour être acc











