Heim
DeepSeek führt im Rahmen interner Tests einen umfassenden Bilderkennungsmodus mit multimodalem Verständnis ein
DeepSeek hat mit internen Tests seines Modus zur groß angelegten Bilderkennung begonnen und markiert damit den vollständigen Übergang dieses inländischen Großmodells in das multimodale Text-und-Bild-Zeitalter. Nach einer Beta-Phase in kleinem Umfang Ende April hat das Unternehmen am 9. Mai den Zugang zum „Bilderkennungsmodus“ deutlich erweitert, sodass die meisten Testkonten diese Funktion nun über einen eigenen Einstiegspunkt in der Chat-Oberfläche nutzen können. Obwohl die Funktion weiterhin als „interne Testphase“ bezeichnet wird, zeigt die Tatsache, dass sie neben dem „Schnellmodus“ und dem „Expertenmodus“ oberhalb der Eingabeleiste angezeigt wird, dass multimodales Verständnis nun ein zentraler Bestandteil der Produktpalette ist.

Im Gegensatz zur einfachen OCR-Textextraktion konzentriert sich das neueste Upgrade von DeepSeek auf tiefgehende Bilderkennung und semantisches Verständnis. In Praxistests kann dieser Modus visuelle Informationen logisch analysieren, sodass Nutzer komplexe medienübergreifende Interaktionen durchführen können, indem sie einfach Bilder hochladen. Dieser Schritt schließt eine Lücke in den multimodalen Fähigkeiten von DeepSeek und bringt das Modell deutlich näher an internationale Top-Modelle wie GPT-4o heran.
Verwandter Artikel
Musk sagt, 99 % des Wertes von SpaceX würden aus KI-Raketen stammen; die Weltraumforschung werde zum Nebengeschäft
SpaceX hat ein Video von Elon Musks jüngster Ansprache an die Mitarbeiter veröffentlicht. Während er die Fortschritte des Unternehmens nachzeichnete, stellte er erstmals die drei Kernsäulen Starship,
Universal Robots stellt die 7. Generation für den Einsatz physischer KI vor
Will Healy, Leiter Produkt- und Branchenmarketing bei Universal Robots, BildnachweisWill Healy, Leiter für Produkt- und Branchenmarketing bei Universal Robots, betont, dass KI-gesteuerte Roboter nach
Offizielle Bestätigung: KI-generiertes Bild einer Fußgängerin mit Besen wurde aus dem Verkehr gezogen
Eine ungewöhnliche öffentliche Werbekampagne auf einem Aushangbrett in Linfen, Provinz Shanxi, hat aufgrund ihrer bizarren Bildsprache die öffentliche Aufmerksamkeit auf sich gezogen. Passanten wirken seltsam platziert, und ein Besen scheint aus der
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
DeepSeek hat mit internen Tests seines Modus zur groß angelegten Bilderkennung begonnen und markiert damit den vollständigen Übergang dieses inländischen Großmodells in das multimodale Text-und-Bild-Zeitalter. Nach einer Beta-Phase in kleinem Umfang Ende April hat das Unternehmen am 9. Mai den Zugang zum „Bilderkennungsmodus“ deutlich erweitert, sodass die meisten Testkonten diese Funktion nun über einen eigenen Einstiegspunkt in der Chat-Oberfläche nutzen können. Obwohl die Funktion weiterhin als „interne Testphase“ bezeichnet wird, zeigt die Tatsache, dass sie neben dem „Schnellmodus“ und dem „Expertenmodus“ oberhalb der Eingabeleiste angezeigt wird, dass multimodales Verständnis nun ein zentraler Bestandteil der Produktpalette ist.

Im Gegensatz zur einfachen OCR-Textextraktion konzentriert sich das neueste Upgrade von DeepSeek auf tiefgehende Bilderkennung und semantisches Verständnis. In Praxistests kann dieser Modus visuelle Informationen logisch analysieren, sodass Nutzer komplexe medienübergreifende Interaktionen durchführen können, indem sie einfach Bilder hochladen. Dieser Schritt schließt eine Lücke in den multimodalen Fähigkeiten von DeepSeek und bringt das Modell deutlich näher an internationale Top-Modelle wie GPT-4o heran.
Musk sagt, 99 % des Wertes von SpaceX würden aus KI-Raketen stammen; die Weltraumforschung werde zum Nebengeschäft
SpaceX hat ein Video von Elon Musks jüngster Ansprache an die Mitarbeiter veröffentlicht. Während er die Fortschritte des Unternehmens nachzeichnete, stellte er erstmals die drei Kernsäulen Starship,
Universal Robots stellt die 7. Generation für den Einsatz physischer KI vor
Will Healy, Leiter Produkt- und Branchenmarketing bei Universal Robots, BildnachweisWill Healy, Leiter für Produkt- und Branchenmarketing bei Universal Robots, betont, dass KI-gesteuerte Roboter nach
Offizielle Bestätigung: KI-generiertes Bild einer Fußgängerin mit Besen wurde aus dem Verkehr gezogen
Eine ungewöhnliche öffentliche Werbekampagne auf einem Aushangbrett in Linfen, Provinz Shanxi, hat aufgrund ihrer bizarren Bildsprache die öffentliche Aufmerksamkeit auf sich gezogen. Passanten wirken seltsam platziert, und ein Besen scheint aus der











