Maison
DeepSeek V4.1 Flash est lancé avec une vision multimodale native, surpassant la version Pro alors que les prix baissent
DeepSeek a officiellement lancé aujourd’hui le modèle le plus léger de sa dernière série d’architectures : DeepSeek V4.1Flash. Conçu comme un modèle léger doté d’une compréhension visuelle multimodale native, il vise à offrir des performances supérieures, une inférence plus rapide, un débit accru et une évolutivité vers des tailles de paramètres plus importantes.
Au cœur de DeepSeek V4.1Flash se trouve une architecture Mixture of Experts (MoE) de 552 milliards de paramètres, intégrant une structure Causal-Encoder-Decoder innovante. Son design asymétrique ne génère que 8 milliards d’activations en entrée et 16 milliards en sortie, réduisant considérablement les coûts par rapport à des modèles de taille similaire. Renforcé par une nouvelle approche de pré-entraînement et un apprentissage par renforcement à grande échelle, ce modèle surpasse les modèles phares tels que DeepSeek V4Pro dans divers benchmarks.

En matière d’efficacité et de maîtrise des coûts, le nouveau modèle réduit drastiquement la taille du KV Cache. Par rapport à son prédécesseur, V4.1Flash nécessite seulement 1/4 de la mémoire haute bande passante (HBM) et 1/8 de la capacité du disque à semi-conducteurs (SSD). Cette compression est particulièrement bénéfique pour les scénarios d’agents, où les coûts de stockage du contexte et de taux de hit du cache sont élevés, réduisant ainsi significativement les dépenses opérationnelles. Les statistiques montrent que le KV Cache a été réduit à 1/437 de la taille du modèle initial.
Avec le lancement de ce nouveau modèle, DeepSeek a mis à jour sa gamme de produits et sa stratégie de facturation. DeepSeek V4.1Flash est désormais disponible via l’API DeepSeek sous le nom de modèle deepseek-flash. Les versions précédentes, V4Flash et V4Flash Vision Exp, ont été abandonnées, les anciens noms (deepseek-v4-flash et deepseek-v4-flash-vision-exp) étant temporairement redirigés vers V4.1Flash. Étant donné que V4.1Flash surpasse V4Pro en termes de performances, de coût, de vitesse et de durée d’utilisation, l’entreprise prévoit de progressivement retirer V4Pro : après 12h00 le 14 septembre 2026, les requêtes adressées à deepseek-v4-pro seront redirigées vers V4.1Flash et facturées selon son tarif. Des partenaires officiels tels que WorkBuddy, CodeBuddy et OpenCode de Tencent ont déjà intégré ce modèle.
Article connexe
Lancement de la Plateforme Ouverte Qwen d'Aliyun, permettant l'intégration de l'IA sur les téléphones, les ordinateurs et les lunettes, que ce soit pour la location, l'expédition ou d'autres usages
Alors que les applications d’IA se développent rapidement, Qwen a considérablement amélioré son écosystème. Lancée le 10 août, la Plateforme Ouverte Qwen offre désormais un accès élargi aux partenaires de l’écosystème et aux développeurs, que ce soit
Dou Bao prévoit de lancer des offres payantes à la mi-juin, avec une campagne de promotion sur le commerce électronique prévue pour le troisième trimestre
Douyin, l’application phare de ByteDance en matière de grands modèles linguistiques, prévoit de lancer des fonctionnalités de contenu payant d’ici la fin juin, avec des mises à jour annoncées lors de la conférence Force. Cette initiative marque une é
La CCTV met au jour une arnaque aux rencontres par intelligence artificielle ciblant les femmes d’âge mûr et âgées, 28 personnes arrêtées
Les derniers rapports de CCTV News mettent en lumière une nouvelle vague d’arnaques aux rencontres basées sur l’intelligence artificielle, ciblant les femmes d’âge mûr et âgées. Les criminels exploitent des profils générés par l’IA pour attirer les v
Recommandations de sujets spéciaux liés
commentaires (0)
DeepSeek a officiellement lancé aujourd’hui le modèle le plus léger de sa dernière série d’architectures : DeepSeek V4.1Flash. Conçu comme un modèle léger doté d’une compréhension visuelle multimodale native, il vise à offrir des performances supérieures, une inférence plus rapide, un débit accru et une évolutivité vers des tailles de paramètres plus importantes.
Au cœur de DeepSeek V4.1Flash se trouve une architecture Mixture of Experts (MoE) de 552 milliards de paramètres, intégrant une structure Causal-Encoder-Decoder innovante. Son design asymétrique ne génère que 8 milliards d’activations en entrée et 16 milliards en sortie, réduisant considérablement les coûts par rapport à des modèles de taille similaire. Renforcé par une nouvelle approche de pré-entraînement et un apprentissage par renforcement à grande échelle, ce modèle surpasse les modèles phares tels que DeepSeek V4Pro dans divers benchmarks.

En matière d’efficacité et de maîtrise des coûts, le nouveau modèle réduit drastiquement la taille du KV Cache. Par rapport à son prédécesseur, V4.1Flash nécessite seulement 1/4 de la mémoire haute bande passante (HBM) et 1/8 de la capacité du disque à semi-conducteurs (SSD). Cette compression est particulièrement bénéfique pour les scénarios d’agents, où les coûts de stockage du contexte et de taux de hit du cache sont élevés, réduisant ainsi significativement les dépenses opérationnelles. Les statistiques montrent que le KV Cache a été réduit à 1/437 de la taille du modèle initial.
Avec le lancement de ce nouveau modèle, DeepSeek a mis à jour sa gamme de produits et sa stratégie de facturation. DeepSeek V4.1Flash est désormais disponible via l’API DeepSeek sous le nom de modèle deepseek-flash. Les versions précédentes, V4Flash et V4Flash Vision Exp, ont été abandonnées, les anciens noms (deepseek-v4-flash et deepseek-v4-flash-vision-exp) étant temporairement redirigés vers V4.1Flash. Étant donné que V4.1Flash surpasse V4Pro en termes de performances, de coût, de vitesse et de durée d’utilisation, l’entreprise prévoit de progressivement retirer V4Pro : après 12h00 le 14 septembre 2026, les requêtes adressées à deepseek-v4-pro seront redirigées vers V4.1Flash et facturées selon son tarif. Des partenaires officiels tels que WorkBuddy, CodeBuddy et OpenCode de Tencent ont déjà intégré ce modèle.
Lancement de la Plateforme Ouverte Qwen d'Aliyun, permettant l'intégration de l'IA sur les téléphones, les ordinateurs et les lunettes, que ce soit pour la location, l'expédition ou d'autres usages
Alors que les applications d’IA se développent rapidement, Qwen a considérablement amélioré son écosystème. Lancée le 10 août, la Plateforme Ouverte Qwen offre désormais un accès élargi aux partenaires de l’écosystème et aux développeurs, que ce soit
Dou Bao prévoit de lancer des offres payantes à la mi-juin, avec une campagne de promotion sur le commerce électronique prévue pour le troisième trimestre
Douyin, l’application phare de ByteDance en matière de grands modèles linguistiques, prévoit de lancer des fonctionnalités de contenu payant d’ici la fin juin, avec des mises à jour annoncées lors de la conférence Force. Cette initiative marque une é
La CCTV met au jour une arnaque aux rencontres par intelligence artificielle ciblant les femmes d’âge mûr et âgées, 28 personnes arrêtées
Les derniers rapports de CCTV News mettent en lumière une nouvelle vague d’arnaques aux rencontres basées sur l’intelligence artificielle, ciblant les femmes d’âge mûr et âgées. Les criminels exploitent des profils générés par l’IA pour attirer les v











