Heim
DeepSeek stellt das erste für KI-Agenten entwickelte Open-Source-Multimodalmodell vor
DeepSeek hat „DeepSeek-V4-Flash-Vision-Exp“ auf Hugging Face veröffentlicht und damit das erste experimentelle multimodale Modell der V4-Serie unter der MIT-Lizenz vorgestellt. Mit 305 Milliarden Parametern und auf der Grundlage von V4-Flash-0731 integriert dieses Modell einen visuellen Encoder und einen Aligner in seine zentrale Spracharchitektur und ermöglicht so durch kontinuierliches Training ein robustes Bildverständnis.

Ausgerichtet auf multimodale Agenten, nicht nur auf Bildbeschreibungen
Im Gegensatz zu herkömmlichen multimodalen Modellen, die sich auf die Beantwortung visueller Fragen konzentrieren, hat DeepSeek den Zweck der Vision-Version neu definiert: Die Priorität liegt auf den Fähigkeiten multimodaler Agenten. Die offizielle Dokumentation hebt hervor, dass Agenten visuelle Eingaben – wie Web-Screenshots, Software-Oberflächen und Diagramme – direkt interpretieren und Aufgaben durch den Aufruf von Tools ausführen können. Im Wesentlichen ist dieses „Auge“ für Maschinenagenten und nicht für menschliche Nutzer konzipiert.
Das Open-Source-Paket ist umfassend und enthält Modellgewichte, einen Tokenizer, Referenzimplementierungen für die Prompt-Kodierung sowie eine minimale PyTorch-Inferenzumgebung. Es umfasst wesentliche Module wie den visuellen Encoder, den Aligner, DFlash Attention, MoE und Hyper-Connections. Die Community reagierte rasch: Auf Hugging Face sind bereits sieben quantisierte Versionen für llama.cpp, LM Studio und Ollama verfügbar.
Bemerkenswerte Details zum Zeitplan lassen eine strategische Einführung erkennen: Das Modell erschien erstmals am 21. August in der DeepSeek-API, wo es ausschließlich über die API ohne Verteilung der Gewichte zugänglich war. Entwickler konnten Text und Bilder gleichzeitig eingeben, wobei die Bildverarbeitung pro Token abgerechnet wurde. Zehn Tage später wurden die Gewichte offiziell veröffentlicht, was eine lokale Bereitstellung und Weiterentwicklung ermöglichte. Diese Strategie „zuerst API, dann Open Source“ unterstreicht die primäre Positionierung von DeepSeek als API-Dienstleister.

Leistung nahe an Claude Opus 4.8, mit gemessenen offiziellen Angaben
Benchmark-Ergebnisse zeigen, dass das Hinzufügen visueller Fähigkeiten die Leistung reiner Textagenten nicht wesentlich beeinträchtigt: Die Terminal-Bench-2.1-Werte stiegen von 82,7 auf 83,9, und DeepSWE verbesserte sich von 54,4 auf 59,3 und übertraf damit die 58,0 von Opus 4.8. Die Verbesserungen bei multimodalen Agenten sind noch deutlicher: ApexBench Pass@1 erreichte 36,5, „Agents’ Last Exam“ erzielte 27,3 (und übertraf damit die 25,7 von Opus 4.8), und ZeroBench Pass@5 erreichte 35,0 und übertraf damit die 34,0 des Konkurrenten.
DeepSeek vermeidet es jedoch, eine „umfassende Überlegenheit“ zu behaupten: Beim NL2Repo-Projekt erzielte es 57,7 und lag damit hinter den 69,7 von Opus 4.8 zurück. Die offizielle Stellungnahme bleibt zurückhaltend und stellt lediglich fest, dass „die Fähigkeiten multimodaler Agenten denen von Claude Opus 4.8 nahekommen“. Jüngste Updates zeigen, dass DeepSeek einen vollständigen Agenten-Technologie-Stack aufbaut: Das Modell übernimmt das Schlussfolgern und den Aufruf von Tools, Harness verwaltet die kontinuierliche Aufgabenausführung und Vision ermöglicht es den Agenten, visuelle Computerinformationen direkt zu interpretieren. Diese Open-Source-Veröffentlichung ist ein entscheidender Schritt zur Vervollständigung dieses Ökosystems.
Verwandter Artikel
US-Gesundheitsbehörden bewerten KI-Modelle von OpenAI und Anthropic
Gesundheitsbehörden im ganzen Land sollen im Rahmen einer neuen Initiative unter der Leitung der „Coalition for Health AI“ in Zusammenarbeit mit OpenAI, Anthropic und Accenture generative KI evaluiere
Alipays „Touch and Pay“ verwandelt 30 Millionen Offline-Kontaktpunkte in ein KI-gesteuertes Geschäftsnetzwerk
Nach der Einführung eines Full-Stack-KI-Zahlungssystems und des KI-gestützten Alipay-Assistenten „Abao“ gab Alipay am 8. Juli bekannt, dass seine „Touch and Pay“-Lösung ein umfassendes KI-Upgrade erfa
Tealium: Warum die RAG-Qualität von Echtzeitdaten abhängt
Freddy Berlanti, Principal Product Manager für angewandte KI bei Tealium, befasst sich mit dem Thema „Retrieval-Augmented Generation“ (RAG). Bild: Getty ImagesFreddy Berlanti, Principal Product Manage
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
DeepSeek hat „DeepSeek-V4-Flash-Vision-Exp“ auf Hugging Face veröffentlicht und damit das erste experimentelle multimodale Modell der V4-Serie unter der MIT-Lizenz vorgestellt. Mit 305 Milliarden Parametern und auf der Grundlage von V4-Flash-0731 integriert dieses Modell einen visuellen Encoder und einen Aligner in seine zentrale Spracharchitektur und ermöglicht so durch kontinuierliches Training ein robustes Bildverständnis.

Ausgerichtet auf multimodale Agenten, nicht nur auf Bildbeschreibungen
Im Gegensatz zu herkömmlichen multimodalen Modellen, die sich auf die Beantwortung visueller Fragen konzentrieren, hat DeepSeek den Zweck der Vision-Version neu definiert: Die Priorität liegt auf den Fähigkeiten multimodaler Agenten. Die offizielle Dokumentation hebt hervor, dass Agenten visuelle Eingaben – wie Web-Screenshots, Software-Oberflächen und Diagramme – direkt interpretieren und Aufgaben durch den Aufruf von Tools ausführen können. Im Wesentlichen ist dieses „Auge“ für Maschinenagenten und nicht für menschliche Nutzer konzipiert.
Das Open-Source-Paket ist umfassend und enthält Modellgewichte, einen Tokenizer, Referenzimplementierungen für die Prompt-Kodierung sowie eine minimale PyTorch-Inferenzumgebung. Es umfasst wesentliche Module wie den visuellen Encoder, den Aligner, DFlash Attention, MoE und Hyper-Connections. Die Community reagierte rasch: Auf Hugging Face sind bereits sieben quantisierte Versionen für llama.cpp, LM Studio und Ollama verfügbar.
Bemerkenswerte Details zum Zeitplan lassen eine strategische Einführung erkennen: Das Modell erschien erstmals am 21. August in der DeepSeek-API, wo es ausschließlich über die API ohne Verteilung der Gewichte zugänglich war. Entwickler konnten Text und Bilder gleichzeitig eingeben, wobei die Bildverarbeitung pro Token abgerechnet wurde. Zehn Tage später wurden die Gewichte offiziell veröffentlicht, was eine lokale Bereitstellung und Weiterentwicklung ermöglichte. Diese Strategie „zuerst API, dann Open Source“ unterstreicht die primäre Positionierung von DeepSeek als API-Dienstleister.

Leistung nahe an Claude Opus 4.8, mit gemessenen offiziellen Angaben
Benchmark-Ergebnisse zeigen, dass das Hinzufügen visueller Fähigkeiten die Leistung reiner Textagenten nicht wesentlich beeinträchtigt: Die Terminal-Bench-2.1-Werte stiegen von 82,7 auf 83,9, und DeepSWE verbesserte sich von 54,4 auf 59,3 und übertraf damit die 58,0 von Opus 4.8. Die Verbesserungen bei multimodalen Agenten sind noch deutlicher: ApexBench Pass@1 erreichte 36,5, „Agents’ Last Exam“ erzielte 27,3 (und übertraf damit die 25,7 von Opus 4.8), und ZeroBench Pass@5 erreichte 35,0 und übertraf damit die 34,0 des Konkurrenten.
DeepSeek vermeidet es jedoch, eine „umfassende Überlegenheit“ zu behaupten: Beim NL2Repo-Projekt erzielte es 57,7 und lag damit hinter den 69,7 von Opus 4.8 zurück. Die offizielle Stellungnahme bleibt zurückhaltend und stellt lediglich fest, dass „die Fähigkeiten multimodaler Agenten denen von Claude Opus 4.8 nahekommen“. Jüngste Updates zeigen, dass DeepSeek einen vollständigen Agenten-Technologie-Stack aufbaut: Das Modell übernimmt das Schlussfolgern und den Aufruf von Tools, Harness verwaltet die kontinuierliche Aufgabenausführung und Vision ermöglicht es den Agenten, visuelle Computerinformationen direkt zu interpretieren. Diese Open-Source-Veröffentlichung ist ein entscheidender Schritt zur Vervollständigung dieses Ökosystems.
US-Gesundheitsbehörden bewerten KI-Modelle von OpenAI und Anthropic
Gesundheitsbehörden im ganzen Land sollen im Rahmen einer neuen Initiative unter der Leitung der „Coalition for Health AI“ in Zusammenarbeit mit OpenAI, Anthropic und Accenture generative KI evaluiere
Alipays „Touch and Pay“ verwandelt 30 Millionen Offline-Kontaktpunkte in ein KI-gesteuertes Geschäftsnetzwerk
Nach der Einführung eines Full-Stack-KI-Zahlungssystems und des KI-gestützten Alipay-Assistenten „Abao“ gab Alipay am 8. Juli bekannt, dass seine „Touch and Pay“-Lösung ein umfassendes KI-Upgrade erfa
Tealium: Warum die RAG-Qualität von Echtzeitdaten abhängt
Freddy Berlanti, Principal Product Manager für angewandte KI bei Tealium, befasst sich mit dem Thema „Retrieval-Augmented Generation“ (RAG). Bild: Getty ImagesFreddy Berlanti, Principal Product Manage











