Heim
Tencent schüttelt das Large-Model-Team um, während Yao Shunyu die Verantwortung für das Basismodell übernimmt

Das multimodale Team von Tencent Hunyuan hat kürzlich eine bedeutende Umstrukturierung und strategische Neuausrichtung abgeschlossen. Lu Xudong, der zuvor die multimodalen Verständnisarbeiten bei xAI geleitet hatte, ist zu Hunyuan gewechselt, um die Algorithmen für die multimodale Inhaltsgenerierung zu leiten. Diese Verschiebung fällt mit wichtigen Personalwechseln zusammen, darunter der Ausscheiden des ehemaligen Leiters für multimodales Verständnis, Hu Han, der unternehmerisch tätig werden möchte, sowie dem Zuzug von Tian Yonglong, einem ehemaligen OpenAI-Forscher. Diese Maßnahmen signalisieren eine massive Neuausrichtung von Tencent bei der Entwicklung multimodaler Großmodelle.
Die multimodale Entwicklung von Tencent Hunyuan konzentrierte sich auf mehrere Kernprodukte. Ende 2024 stellte das Team HunyuanVideo vor, das größte Open-Source-Modell für Text-zu-Video-Generierung, gefolgt von Erweiterungen im Jahr 2025 in die Bereiche Bild-zu-Video, benutzerdefinierte Generierung und digitale Menschenanimation. Die Bildgenerierungsfähigkeiten haben sich von HunyuanImage zu Version 2.1 weiterentwickelt, die native 2K-Auflösung unterstützt, sowie zu Version 3.0 mit 80 Milliarden Parametern, was einen Wandel hin zu industrietauglicher Leistung markiert. Hy3D, ein einheitliches 3D-Modell, wird weit verbreitet im E-Commerce und im Produktdesign eingesetzt. Im Bereich der räumlichen Intelligenz stellte Tencent Hy World 1.0 vor, das weltweit erste Open-Source-Modell für immersive 3D-Generierung, das bereit für Simulationen ist, wobei nachfolgende Versionen die Forschung zur räumlichen Intelligenz kontinuierlich vorantreiben.
Als Tencent seine Abteilungen für große Sprachmodelle und multimodale Modelle unter der Leitung von Yao Shunyu zur „Abteilung für Grundmodelle“ konsolidierte, erfuhr seine Forschungs- und Entwicklungsstrategie eine grundlegende Verschiebung. Der aktuelle technische Fahrplan spiegelt die branchenweite Debatte über die Rolle multimodaler Systeme im Hauptverlauf der KI wider. Fei-Fei Lis World Labs vertritt die Auffassung, dass Weltmodelle als Komponenten der räumlichen Intelligenz zentral für die Erreichung von AGI sind. Im Gegensatz dazu befürwortet DeepSeek den Einsatz visueller Modalitäten als Werkzeuge zur Unterstützung von Sprachmodellen und betont die eigenständige Entwicklung von 3D- oder Weltmodellen weniger.
Yao Shunyus jüngste strategische Initiativen, einschließlich des Flaggschiff-Produkts Hy3, deuten auf eine Präferenz für den letzteren Ansatz hin. Er hat wiederholt betont, dass der nächste Wettbewerbsvorteil der KI in der Kontextverarbeitung und Schlussfolgerung liegt, nicht allein in der Parameteranzahl. Durch die Integration multimodalen Verstehens in die Kernmodellarchitektur sowie die Verbesserung der Stabilität von Tool-Aufrufen und der Unterstützung langer Kontexte zielt Tencent darauf ab, die Modellleistung in realen Büroumgebungen und GUI-Agent-Anwendungen zu steigern. Lu Xudongs Hinzukunft stärkt das multimodale Verständnis und adressiert häufige Probleme wie Inkonsistenzen bei der Generierung und räumliche Instabilität. Diese Umstrukturierung unterstreicht Tencent’s interne strategische Evolution und sein Engagement, sich in der nächsten Phase der AGI-Entwicklung auf Produktivität und Kernfähigkeiten zu konzentrieren.
Verwandter Artikel
Trumps KI-Strategie: Wie geht es mit der US-Politik weiter?
Am 3. August forderten fünf demokratische Senatoren die Trump-Regierung auf, ihre Aufsicht über Open-Weight-KI-Modelle zu präzisieren, und wiesen dabei auf Bedenken hinsichtlich der Wettbewerbsbedrohu
Tongyi Qianwen Open Platform wird gestartet und bringt Conversational-as-a-Service in den Alltag.
Die Tongyi Qianwen Open Platform ist offiziell gestartet und bietet Entwicklern Zugriff auf Dienste über mobile Geräte, PCs und KI-Brillen. Nutzer müssen nicht mehr zwischen Apps wechseln; sie können verschiedene tägliche Serviceoperationen direkt in
Swiftlet-Packs 80B Qwen in Mac mit 4,3 GB Speicher; iPhone 17 soll 35B nativ ausführen
Ein zur Laufzeit kompiliertes Swift- und Metal-Laufzeitsystem namens Swiftlet definiert neu, „wo große Modelle ausgeführt werden können“. Es ist speziell auf die Familie der MoE-Modelle (Mixture of Experts) Qwen3-Next und Qwen3.5/3.6 zugeschnitten. D
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Das multimodale Team von Tencent Hunyuan hat kürzlich eine bedeutende Umstrukturierung und strategische Neuausrichtung abgeschlossen. Lu Xudong, der zuvor die multimodalen Verständnisarbeiten bei xAI geleitet hatte, ist zu Hunyuan gewechselt, um die Algorithmen für die multimodale Inhaltsgenerierung zu leiten. Diese Verschiebung fällt mit wichtigen Personalwechseln zusammen, darunter der Ausscheiden des ehemaligen Leiters für multimodales Verständnis, Hu Han, der unternehmerisch tätig werden möchte, sowie dem Zuzug von Tian Yonglong, einem ehemaligen OpenAI-Forscher. Diese Maßnahmen signalisieren eine massive Neuausrichtung von Tencent bei der Entwicklung multimodaler Großmodelle.
Die multimodale Entwicklung von Tencent Hunyuan konzentrierte sich auf mehrere Kernprodukte. Ende 2024 stellte das Team HunyuanVideo vor, das größte Open-Source-Modell für Text-zu-Video-Generierung, gefolgt von Erweiterungen im Jahr 2025 in die Bereiche Bild-zu-Video, benutzerdefinierte Generierung und digitale Menschenanimation. Die Bildgenerierungsfähigkeiten haben sich von HunyuanImage zu Version 2.1 weiterentwickelt, die native 2K-Auflösung unterstützt, sowie zu Version 3.0 mit 80 Milliarden Parametern, was einen Wandel hin zu industrietauglicher Leistung markiert. Hy3D, ein einheitliches 3D-Modell, wird weit verbreitet im E-Commerce und im Produktdesign eingesetzt. Im Bereich der räumlichen Intelligenz stellte Tencent Hy World 1.0 vor, das weltweit erste Open-Source-Modell für immersive 3D-Generierung, das bereit für Simulationen ist, wobei nachfolgende Versionen die Forschung zur räumlichen Intelligenz kontinuierlich vorantreiben.
Als Tencent seine Abteilungen für große Sprachmodelle und multimodale Modelle unter der Leitung von Yao Shunyu zur „Abteilung für Grundmodelle“ konsolidierte, erfuhr seine Forschungs- und Entwicklungsstrategie eine grundlegende Verschiebung. Der aktuelle technische Fahrplan spiegelt die branchenweite Debatte über die Rolle multimodaler Systeme im Hauptverlauf der KI wider. Fei-Fei Lis World Labs vertritt die Auffassung, dass Weltmodelle als Komponenten der räumlichen Intelligenz zentral für die Erreichung von AGI sind. Im Gegensatz dazu befürwortet DeepSeek den Einsatz visueller Modalitäten als Werkzeuge zur Unterstützung von Sprachmodellen und betont die eigenständige Entwicklung von 3D- oder Weltmodellen weniger.
Yao Shunyus jüngste strategische Initiativen, einschließlich des Flaggschiff-Produkts Hy3, deuten auf eine Präferenz für den letzteren Ansatz hin. Er hat wiederholt betont, dass der nächste Wettbewerbsvorteil der KI in der Kontextverarbeitung und Schlussfolgerung liegt, nicht allein in der Parameteranzahl. Durch die Integration multimodalen Verstehens in die Kernmodellarchitektur sowie die Verbesserung der Stabilität von Tool-Aufrufen und der Unterstützung langer Kontexte zielt Tencent darauf ab, die Modellleistung in realen Büroumgebungen und GUI-Agent-Anwendungen zu steigern. Lu Xudongs Hinzukunft stärkt das multimodale Verständnis und adressiert häufige Probleme wie Inkonsistenzen bei der Generierung und räumliche Instabilität. Diese Umstrukturierung unterstreicht Tencent’s interne strategische Evolution und sein Engagement, sich in der nächsten Phase der AGI-Entwicklung auf Produktivität und Kernfähigkeiten zu konzentrieren.
Trumps KI-Strategie: Wie geht es mit der US-Politik weiter?
Am 3. August forderten fünf demokratische Senatoren die Trump-Regierung auf, ihre Aufsicht über Open-Weight-KI-Modelle zu präzisieren, und wiesen dabei auf Bedenken hinsichtlich der Wettbewerbsbedrohu
Tongyi Qianwen Open Platform wird gestartet und bringt Conversational-as-a-Service in den Alltag.
Die Tongyi Qianwen Open Platform ist offiziell gestartet und bietet Entwicklern Zugriff auf Dienste über mobile Geräte, PCs und KI-Brillen. Nutzer müssen nicht mehr zwischen Apps wechseln; sie können verschiedene tägliche Serviceoperationen direkt in
Swiftlet-Packs 80B Qwen in Mac mit 4,3 GB Speicher; iPhone 17 soll 35B nativ ausführen
Ein zur Laufzeit kompiliertes Swift- und Metal-Laufzeitsystem namens Swiftlet definiert neu, „wo große Modelle ausgeführt werden können“. Es ist speziell auf die Familie der MoE-Modelle (Mixture of Experts) Qwen3-Next und Qwen3.5/3.6 zugeschnitten. D











