Maison
DeepSeek-V4.1-Flash fait ses débuts sur la plateforme d'IA Qwen avec une API et un plan de jetons déjà opérationnels
DeepSeek-V4.1-Flash est désormais disponible sur la plateforme Qwen AI, offrant à la fois un accès via API et un « Token Plan » flexible. Les développeurs peuvent intégrer le modèle de manière transparente dans leurs flux de travail via des API standard ou exploiter le forfait de jetons directement au sein d’outils tels que Qoder, l’application Qwen et Codex pour le codage, la documentation, l’analyse visuelle et les tâches pilotées par des agents.

Décrit comme le nouveau fleuron léger de DeepSeek, ce modèle utilise une architecture MoE comptant 552 milliards de paramètres au total. Il emploie une structure asymétrique de type « Causal-Encoder-Decoder », n’activant qu’environ 8 milliards de paramètres pour l’entrée et environ 16 milliards pour la sortie. Prenant en charge nativement la compréhension du texte et des images, il gère des fenêtres de contexte pouvant atteindre 1 million de tokens et génère des sorties d’environ 393 000 tokens. Les benchmarks officiels indiquent des améliorations significatives en termes de performances des agents et du code, offrant un débit élevé et une faible latence malgré des coûts d’activation réduits.
La rentabilité est l’un de ses principaux atouts. Une compression avancée du cache réduit les besoins en cache KV HBM à 25 % et les besoins en stockage SSD à 12,5 % par rapport aux générations précédentes, optimisant ainsi les ressources pour les contextes longs et les interactions à plusieurs tours. La tarification sur la plateforme Qwen est échelonnée : l’entrée coûte 1 CNY par million de tokens en heures creuses (2 CNY en heures de pointe), tandis que la sortie coûte 4 CNY par million de tokens (8 CNY en heures de pointe). Les limites de débit sont fixées à 15 000 RPM et 1 million de TPM, prenant en charge la complétion de préfixes, l’appel de fonctions, la mise en cache, les sorties structurées, le traitement par lots et la recherche en ligne.
Alibaba Cloud BaiLian s’est associé à la communauté open source vLLM afin d’assurer un déploiement à grande échelle en Chine et à l’international, notamment à Pékin, à Singapour, aux États-Unis, en Allemagne, au Japon et à Hong Kong. Le modèle prend en charge les conversations à plusieurs tours, les appels de fonction, la recherche en ligne, la mise en cache du contexte et la sortie structurée, avec une limite max_tokens d’environ 393 216. Cela le rend idéal pour les entreprises qui souhaitent migrer l’analyse de longs documents, les bases de connaissances du service client, les questions-réponses sur les dépôts de code et les examens de commandes multimodales vers une interface unifiée.
Les analystes du secteur estiment que l’intégration de « paramètres de grande taille, d’une activation réduite et d’une mise en cache robuste » dans l’écosystème Qwen réduit les coûts liés aux essais et erreurs pour les agents traitant des contextes longs. Pour les petites équipes, la combinaison de tarifs réduits en dehors des heures de pointe et d’abonnements flexibles au Token Plan permet une inférence par lots plus agile et une validation rapide des prototypes.
Article connexe
GitHub Copilot intègre GPT-5.4 en quelques heures
GitHub Copilot a une fois de plus prouvé ses capacités de réponse rapide. Quelques heures seulement après le lancement par OpenAI de son tout dernier modèle phare, GPT-5.4, GitHub a annoncé une intégration complète, offrant aux développeurs du monde
Anthropic mène la voie en matière d’introduction en bourse, l’industrie de l’intelligence artificielle entre dans une nouvelle ère de revenus atteignant le trillion de dollars
Le secteur mondial de l’intelligence artificielle a franchi une nouvelle étape majeure. Les récentes données du marché révèlent qu’Anthropic, une startup spécialisée dans l’IA, a déposé une demande confidentielle d’introduction en bourse (IPO) le 1er
Comment optimiser le référencement naturel (SEO) pour Google Japan et Yahoo Japan ?
La ville connectée est déjà là, mais elle a l’air ordinaireL’infrastructure IoT la plus utile n’a rarement l’apparence du futurisme. Elle ressemble à une poubelle qui sait quand elle est pleine, à une fourgonnette qui signale les pannes moteur avant
Recommandations de sujets spéciaux liés
commentaires (0)
DeepSeek-V4.1-Flash est désormais disponible sur la plateforme Qwen AI, offrant à la fois un accès via API et un « Token Plan » flexible. Les développeurs peuvent intégrer le modèle de manière transparente dans leurs flux de travail via des API standard ou exploiter le forfait de jetons directement au sein d’outils tels que Qoder, l’application Qwen et Codex pour le codage, la documentation, l’analyse visuelle et les tâches pilotées par des agents.

Décrit comme le nouveau fleuron léger de DeepSeek, ce modèle utilise une architecture MoE comptant 552 milliards de paramètres au total. Il emploie une structure asymétrique de type « Causal-Encoder-Decoder », n’activant qu’environ 8 milliards de paramètres pour l’entrée et environ 16 milliards pour la sortie. Prenant en charge nativement la compréhension du texte et des images, il gère des fenêtres de contexte pouvant atteindre 1 million de tokens et génère des sorties d’environ 393 000 tokens. Les benchmarks officiels indiquent des améliorations significatives en termes de performances des agents et du code, offrant un débit élevé et une faible latence malgré des coûts d’activation réduits.
La rentabilité est l’un de ses principaux atouts. Une compression avancée du cache réduit les besoins en cache KV HBM à 25 % et les besoins en stockage SSD à 12,5 % par rapport aux générations précédentes, optimisant ainsi les ressources pour les contextes longs et les interactions à plusieurs tours. La tarification sur la plateforme Qwen est échelonnée : l’entrée coûte 1 CNY par million de tokens en heures creuses (2 CNY en heures de pointe), tandis que la sortie coûte 4 CNY par million de tokens (8 CNY en heures de pointe). Les limites de débit sont fixées à 15 000 RPM et 1 million de TPM, prenant en charge la complétion de préfixes, l’appel de fonctions, la mise en cache, les sorties structurées, le traitement par lots et la recherche en ligne.
Alibaba Cloud BaiLian s’est associé à la communauté open source vLLM afin d’assurer un déploiement à grande échelle en Chine et à l’international, notamment à Pékin, à Singapour, aux États-Unis, en Allemagne, au Japon et à Hong Kong. Le modèle prend en charge les conversations à plusieurs tours, les appels de fonction, la recherche en ligne, la mise en cache du contexte et la sortie structurée, avec une limite max_tokens d’environ 393 216. Cela le rend idéal pour les entreprises qui souhaitent migrer l’analyse de longs documents, les bases de connaissances du service client, les questions-réponses sur les dépôts de code et les examens de commandes multimodales vers une interface unifiée.
Les analystes du secteur estiment que l’intégration de « paramètres de grande taille, d’une activation réduite et d’une mise en cache robuste » dans l’écosystème Qwen réduit les coûts liés aux essais et erreurs pour les agents traitant des contextes longs. Pour les petites équipes, la combinaison de tarifs réduits en dehors des heures de pointe et d’abonnements flexibles au Token Plan permet une inférence par lots plus agile et une validation rapide des prototypes.
GitHub Copilot intègre GPT-5.4 en quelques heures
GitHub Copilot a une fois de plus prouvé ses capacités de réponse rapide. Quelques heures seulement après le lancement par OpenAI de son tout dernier modèle phare, GPT-5.4, GitHub a annoncé une intégration complète, offrant aux développeurs du monde
Anthropic mène la voie en matière d’introduction en bourse, l’industrie de l’intelligence artificielle entre dans une nouvelle ère de revenus atteignant le trillion de dollars
Le secteur mondial de l’intelligence artificielle a franchi une nouvelle étape majeure. Les récentes données du marché révèlent qu’Anthropic, une startup spécialisée dans l’IA, a déposé une demande confidentielle d’introduction en bourse (IPO) le 1er











