Heim
DeepSeek V4 soll im April zusammen mit Tencent’s Mengyuan-Modell auf den Markt kommen

Laut einem Exklusivbericht von BaiMing Lab sollen das mit Spannung erwartete DeepSeek V4 und Yao Shunyus neues MixFormer-Modell im April 2026 offiziell veröffentlicht werden. DeepSeek V4 ist ein multimodales Großmodell, das von Liang Wenfeng geleitet wird. Nach umfangreicher Weiterentwicklung wird erwartet, dass es bedeutende Durchbrüche in den Bereichen Codierungskompetenz und Langzeitgedächtnis erzielen wird. Diese Veröffentlichung steht im Einklang mit der Forschungsausrichtung des DeepSeek-Teams in den letzten Jahren, insbesondere in den Bereichen visuelle Inhaltsverarbeitung und KI-gestützte Suchfunktionen.
Liang Wenfengs Forschung konzentriert sich auf die Erforschung von Mechanismen des „bedingten Gedächtnisses“. Im Januar 2026 veröffentlichte er einen Artikel mit dem Titel „Conditional Memory via Scalable Lookup“, in dem er die wichtigsten Theorien darlegte. Darüber hinaus veröffentlichte er im Dezember 2025 eine weitere Studie mit dem Titel „mHC: Manifold-Constrained Hyper-Connections“, die die zugrunde liegende Architektur weiter optimiert. Diese Arbeit zielt darauf ab, bekannte Einschränkungen von Transformer-Modellen in Bezug auf Speicher und Trainingsstabilität zu beheben. DeepSeek V4 verfügt nicht nur über eine robuste multimodale Rechenleistung, sondern wird auch intensiv für inländische Chips optimiert, mit dem Ziel, ein Kernmodell zu werden, das vollständig auf der heimischen Recheninfrastruktur basiert.
Gleichzeitig ist für April die Veröffentlichung von Yao Shunyus neuem MixFormer-Modell geplant. Seit Dezember 2025 ist Yao als Chief AI Scientist im Vorstand von Tencent tätig und leitet gleichzeitig die Abteilungen für KI-Infrastruktur und große Sprachmodelle. Im Februar 2026 stellte er CL-bench vor, einen neuartigen Bewertungs-Benchmark für „kontextuelles Lernen“, der den Schwerpunkt auf die Verarbeitung langer Kontexte und die Benutzerfreundlichkeit für Agenten legt. Berichten zufolge wird Yaos neues Modell rund 3 Milliarden Parameter umfassen, wobei sein Team von Anfang an den praktischen Einsatz gegenüber einem reinen Wettstreit um die Parametergröße priorisiert.
Die bevorstehende Einführung beider Modelle hat großes Interesse am Markt geweckt und unterstreicht Chinas rasanten Fortschritt im Bereich der künstlichen Intelligenz. Ob es sich nun um die Fortschritte von DeepSeek V4 im Bereich des Langzeitgedächtnisses oder um die Verbesserungen des MixFormer-Modells von Tencent bei der Bewertung realer Aufgaben handelt – beide Ansätze befassen sich grundlegend damit, wie zukünftige große Modelle effektiver in Produktionsumgebungen integriert werden können.
Verwandter Artikel
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter
Einhaltung der Vorschriften für autonome Fahrzeuge in Kalifornien: Eine neue Ära von Bußgeldern, Geofences und 1 Million Meilen
Guident betreibt einen AuveTech-Shuttle in Südflorida und verwaltet mithilfe seiner Fernüberwachungstechnologie eine vier Meilen lange Strecke in West Palm Beach sowie eine eine Meile lange Strecke in
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Laut einem Exklusivbericht von BaiMing Lab sollen das mit Spannung erwartete DeepSeek V4 und Yao Shunyus neues MixFormer-Modell im April 2026 offiziell veröffentlicht werden. DeepSeek V4 ist ein multimodales Großmodell, das von Liang Wenfeng geleitet wird. Nach umfangreicher Weiterentwicklung wird erwartet, dass es bedeutende Durchbrüche in den Bereichen Codierungskompetenz und Langzeitgedächtnis erzielen wird. Diese Veröffentlichung steht im Einklang mit der Forschungsausrichtung des DeepSeek-Teams in den letzten Jahren, insbesondere in den Bereichen visuelle Inhaltsverarbeitung und KI-gestützte Suchfunktionen.
Liang Wenfengs Forschung konzentriert sich auf die Erforschung von Mechanismen des „bedingten Gedächtnisses“. Im Januar 2026 veröffentlichte er einen Artikel mit dem Titel „Conditional Memory via Scalable Lookup“, in dem er die wichtigsten Theorien darlegte. Darüber hinaus veröffentlichte er im Dezember 2025 eine weitere Studie mit dem Titel „mHC: Manifold-Constrained Hyper-Connections“, die die zugrunde liegende Architektur weiter optimiert. Diese Arbeit zielt darauf ab, bekannte Einschränkungen von Transformer-Modellen in Bezug auf Speicher und Trainingsstabilität zu beheben. DeepSeek V4 verfügt nicht nur über eine robuste multimodale Rechenleistung, sondern wird auch intensiv für inländische Chips optimiert, mit dem Ziel, ein Kernmodell zu werden, das vollständig auf der heimischen Recheninfrastruktur basiert.
Gleichzeitig ist für April die Veröffentlichung von Yao Shunyus neuem MixFormer-Modell geplant. Seit Dezember 2025 ist Yao als Chief AI Scientist im Vorstand von Tencent tätig und leitet gleichzeitig die Abteilungen für KI-Infrastruktur und große Sprachmodelle. Im Februar 2026 stellte er CL-bench vor, einen neuartigen Bewertungs-Benchmark für „kontextuelles Lernen“, der den Schwerpunkt auf die Verarbeitung langer Kontexte und die Benutzerfreundlichkeit für Agenten legt. Berichten zufolge wird Yaos neues Modell rund 3 Milliarden Parameter umfassen, wobei sein Team von Anfang an den praktischen Einsatz gegenüber einem reinen Wettstreit um die Parametergröße priorisiert.
Die bevorstehende Einführung beider Modelle hat großes Interesse am Markt geweckt und unterstreicht Chinas rasanten Fortschritt im Bereich der künstlichen Intelligenz. Ob es sich nun um die Fortschritte von DeepSeek V4 im Bereich des Langzeitgedächtnisses oder um die Verbesserungen des MixFormer-Modells von Tencent bei der Bewertung realer Aufgaben handelt – beide Ansätze befassen sich grundlegend damit, wie zukünftige große Modelle effektiver in Produktionsumgebungen integriert werden können.
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter











