DeepSeek-V4.1-Flash debütiert auf der Qwen-KI-Plattform mit API und Token-Plan
DeepSeek-V4.1-Flash ist nun auf der Qwen KI-Plattform verfügbar und bietet sowohl API-Zugriff als auch einen flexiblen Token-Plan. Entwickler können das Modell nahtlos in ihre Arbeitsabläufe integrieren, indem sie Standard-APIs nutzen oder den Token-Plan direkt in Tools wie Qoder, der Qwen-App und Codex für Programmierung, Dokumentation, visuelle Analyse und agentengestützte Aufgaben einsetzen.

Als DeepSeeks neues leichtgewichtiges Flaggschiff beschrieben, nutzt dieses Modell eine MoE-Architektur mit insgesamt 552 Milliarden Parametern. Es verwendet eine asymmetrische Causal-Encoder-Decoder-Struktur, die nur etwa 8 Milliarden Parameter für die Eingabe und etwa 16 Milliarden Parameter für die Ausgabe aktiviert. Mit nativer Unterstützung für Text- und Bildverständnis verarbeitet es Kontextfenster von bis zu 1 Million Token und generiert Ausgaben von etwa 393K. Offizielle Benchmarks zeigen erhebliche Verbesserungen in den Bereichen Agenten und Code, wobei trotz reduzierter Aktivierungskosten hohe Durchsatzraten und niedrige Latenzzeiten erreicht werden.
Kosteneffizienz ist ein Hauptmerkmal. Durch fortschrittliche Cache-Komprimierung werden die Anforderungen an den KV-Cache-HBM auf 25 % und an die SSD-Speicherung auf 12,5 % der vorherigen Generationen reduziert, was die Ressourcen für lange Kontexte und Mehrinteraktionsgespräche optimiert. Die Preisgestaltung auf der Qwen-Plattform ist gestaffelt: Eingaben kosten 1 CNY pro Million Token in Stoßzeiten (2 CNY Spitzenzeiten), während Ausgaben 4 CNY pro Million Token kosten (8 CNY Spitzenzeiten). Die Ratenlimits liegen bei 15.000 RPM und 1 Million TPM, wobei Prefix-Vervollständigung, Funktionsaufrufe, Caching, strukturierte Ausgaben, Stapelverarbeitung und Online-Suche unterstützt werden.
Alibaba Cloud BaiLian hat sich mit der vLLM Open-Source-Community zusammengeschlossen, um eine breite Bereitstellung in China und internationalen Regionen sicherzustellen, darunter Peking, Singapur, die USA, Deutschland, Japan und Hongkong. Das Modell unterstützt Mehrinteraktionsgespräche, Funktionsaufrufe, Online-Suche, Kontext-Caching und strukturierte Ausgaben, mit einem max_tokens-Limit von etwa 393.216. Dies macht es ideal für Unternehmen, die lange Dokumentenanalysen, Kundenservice-Wissensdatenbanken, Code-Repository-Fragen und -Antworten sowie multimodale Bestellprüfungen in eine einheitliche Schnittstelle migrieren.
Branchenanalysten sind der Ansicht, dass die Integration von „großen Parametern, kleiner Aktivierung und robustem Caching“ in das Qwen-Ökosystem die Kosten für Versuch und Irrtum bei langkontextuellen Agenten senkt. Für kleine Teams ermöglicht die Kombination aus niedrigen Stoßzeitenpreisen und flexiblen Token-Plan-Abonnements eine agilere Stapelinferenz und schnelle Prototypenvalidierung.
Verwandter Artikel
GitHub Copilot integriert GPT-5.4 innerhalb weniger Stunden
GitHub Copilot hat erneut seine schnelle Reaktionsfähigkeit unter Beweis gestellt. Wenige Stunden nach der Veröffentlichung des neuesten Flaggschiff-Modells GPT-5.4 durch OpenAI kündigte GitHub die vollständige Integration an und bietet Entwicklern w
Anthropic führt den Weg im Börsengang, die KI-Branche betritt ein neues Zeitalter mit Billionen-Umsatz
Der globale KI-Sektor hat einen weiteren wichtigen Meilenstein erreicht. Aktuelle Marktdaten zeigen, dass das KI-Startup Anthropic am 1. Juni einen vertraulichen Börsengang beantragt hat. Wenn dieser genehmigt wird, ist Anthropic darauf vorbereitet,
Wie optimiert man SEO für Google Japan und Yahoo Japan?
Die vernetzte Stadt ist bereits da, sieht aber gewöhnlich ausDie nützlichste IoT-Infrastruktur wirkt selten futuristisch. Sie sieht aus wie eine Mülltonne, die weiß, wann sie voll ist, ein Lieferwagen, der Motorfehler meldet, bevor er ausfällt, ein P
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
DeepSeek-V4.1-Flash ist nun auf der Qwen KI-Plattform verfügbar und bietet sowohl API-Zugriff als auch einen flexiblen Token-Plan. Entwickler können das Modell nahtlos in ihre Arbeitsabläufe integrieren, indem sie Standard-APIs nutzen oder den Token-Plan direkt in Tools wie Qoder, der Qwen-App und Codex für Programmierung, Dokumentation, visuelle Analyse und agentengestützte Aufgaben einsetzen.

Als DeepSeeks neues leichtgewichtiges Flaggschiff beschrieben, nutzt dieses Modell eine MoE-Architektur mit insgesamt 552 Milliarden Parametern. Es verwendet eine asymmetrische Causal-Encoder-Decoder-Struktur, die nur etwa 8 Milliarden Parameter für die Eingabe und etwa 16 Milliarden Parameter für die Ausgabe aktiviert. Mit nativer Unterstützung für Text- und Bildverständnis verarbeitet es Kontextfenster von bis zu 1 Million Token und generiert Ausgaben von etwa 393K. Offizielle Benchmarks zeigen erhebliche Verbesserungen in den Bereichen Agenten und Code, wobei trotz reduzierter Aktivierungskosten hohe Durchsatzraten und niedrige Latenzzeiten erreicht werden.
Kosteneffizienz ist ein Hauptmerkmal. Durch fortschrittliche Cache-Komprimierung werden die Anforderungen an den KV-Cache-HBM auf 25 % und an die SSD-Speicherung auf 12,5 % der vorherigen Generationen reduziert, was die Ressourcen für lange Kontexte und Mehrinteraktionsgespräche optimiert. Die Preisgestaltung auf der Qwen-Plattform ist gestaffelt: Eingaben kosten 1 CNY pro Million Token in Stoßzeiten (2 CNY Spitzenzeiten), während Ausgaben 4 CNY pro Million Token kosten (8 CNY Spitzenzeiten). Die Ratenlimits liegen bei 15.000 RPM und 1 Million TPM, wobei Prefix-Vervollständigung, Funktionsaufrufe, Caching, strukturierte Ausgaben, Stapelverarbeitung und Online-Suche unterstützt werden.
Alibaba Cloud BaiLian hat sich mit der vLLM Open-Source-Community zusammengeschlossen, um eine breite Bereitstellung in China und internationalen Regionen sicherzustellen, darunter Peking, Singapur, die USA, Deutschland, Japan und Hongkong. Das Modell unterstützt Mehrinteraktionsgespräche, Funktionsaufrufe, Online-Suche, Kontext-Caching und strukturierte Ausgaben, mit einem max_tokens-Limit von etwa 393.216. Dies macht es ideal für Unternehmen, die lange Dokumentenanalysen, Kundenservice-Wissensdatenbanken, Code-Repository-Fragen und -Antworten sowie multimodale Bestellprüfungen in eine einheitliche Schnittstelle migrieren.
Branchenanalysten sind der Ansicht, dass die Integration von „großen Parametern, kleiner Aktivierung und robustem Caching“ in das Qwen-Ökosystem die Kosten für Versuch und Irrtum bei langkontextuellen Agenten senkt. Für kleine Teams ermöglicht die Kombination aus niedrigen Stoßzeitenpreisen und flexiblen Token-Plan-Abonnements eine agilere Stapelinferenz und schnelle Prototypenvalidierung.
GitHub Copilot integriert GPT-5.4 innerhalb weniger Stunden
GitHub Copilot hat erneut seine schnelle Reaktionsfähigkeit unter Beweis gestellt. Wenige Stunden nach der Veröffentlichung des neuesten Flaggschiff-Modells GPT-5.4 durch OpenAI kündigte GitHub die vollständige Integration an und bietet Entwicklern w
Anthropic führt den Weg im Börsengang, die KI-Branche betritt ein neues Zeitalter mit Billionen-Umsatz
Der globale KI-Sektor hat einen weiteren wichtigen Meilenstein erreicht. Aktuelle Marktdaten zeigen, dass das KI-Startup Anthropic am 1. Juni einen vertraulichen Börsengang beantragt hat. Wenn dieser genehmigt wird, ist Anthropic darauf vorbereitet,





Heim






