Hogar
Tencent reorganiza su equipo de modelos grandes mientras Yao Shunyu asume el liderazgo del modelo base

El equipo multimodal de Hunyuan de Tencent ha completado recientemente una reestructuración significativa y un cambio estratégico. Lu Xudong, anteriormente al frente de los esfuerzos de comprensión multimodal de xAI, se ha unido a Hunyuan para dirigir los algoritmos de generación de contenido multimodal. Este cambio coincide con cambios clave en el personal, incluida la partida del ex responsable de comprensión multimodal Hu Han para emprender su propia actividad empresarial y la llegada de Tian Yonglong, un ex investigador de OpenAI. Estos movimientos señalan una importante reorientación en el enfoque de Tencent para el desarrollo de grandes modelos multimodales.
La evolución multimodal de Tencent Hunyuan se ha centrado en varios productos clave. A finales de 2024, el equipo lanzó HunyuanVideo, el modelo de texto a vídeo de código abierto más grande, seguido de las expansiones de 2025 hacia la generación de vídeo a partir de imágenes, generación personalizada y animación de avatares digitales. Las capacidades de generación de imágenes han avanzado desde HunyuanImage hasta la versión 2.1, que admite resolución nativa 2K, y la versión 3.0, con 80 mil millones de parámetros, lo que marca un cambio hacia un rendimiento de grado industrial. Mientras tanto, Hy3D, un modelo 3D unificado, se utiliza ampliamente en el comercio electrónico y el diseño de productos. En el ámbito de la inteligencia espacial, Tencent presentó Hy World 1.0, el primer modelo de generación 3D inmersiva de código abierto y listo para simulación del mundo, con versiones posteriores que continúan avanzando en la investigación de la inteligencia espacial.
A medida que Tencent consolidó sus divisiones de modelos de lenguaje grande y modelos multimodales en el «Departamento de Modelos Básicos» bajo el liderazgo de Yao Shunyu, su estrategia de I+D experimentó un cambio fundamental. La hoja de ruta técnica actual refleja el debate de la industria sobre el papel de los sistemas multimodales en la trayectoria principal de la IA. World Labs de Fei-Fei Li sostiene que los modelos del mundo, como componentes de la inteligencia espacial, son centrales para lograr la AGI. En contraste, DeepSeek aboga por utilizar modalidades visuales como herramientas para apoyar los modelos de lenguaje, minimizando el desarrollo independiente de modelos 3D o del mundo.
Las recientes iniciativas estratégicas de Yao Shunyu, incluido el producto insignia Hy3, sugieren una preferencia por este último enfoque. Ha afirmado consistentemente que la próxima ventaja competitiva de la IA radica en el manejo del contexto y el razonamiento, no simplemente en el número de parámetros. Al integrar la comprensión multimodal en la arquitectura central del modelo y mejorar la estabilidad de la llamada a herramientas y el soporte de contexto largo, Tencent busca aumentar la eficiencia del modelo en entornos de oficina reales y aplicaciones de Agentes GUI. La incorporación de Lu Xudong refuerza la comprensión multimodal, abordando problemas comunes como la inconsistencia en la generación y la inestabilidad espacial. Esta reestructura resalta la evolución estratégica interna de Tencent y su compromiso con centrarse en la productividad y las capacidades centrales en la próxima fase del desarrollo de la AGI.
Artículo relacionado
La estrategia de Trump en materia de inteligencia artificial: ¿qué le depara el futuro a la política estadounidense?
El 3 de agosto, cinco senadores demócratas instaron al Gobierno de Trump a aclarar su política de supervisión de los modelos de IA de vanguardia, haciendo hincapié en la preocupación que suscita la am
Se lanza la Plataforma Abierta de Tongyi Qianwen, llevando la conversación como servicio a la vida cotidiana
La plataforma abierta Tongyi Qianwen ha sido lanzada oficialmente, proporcionando a los desarrolladores acceso a servicios en dispositivos móviles, ordenadores y gafas de realidad aumentada. Los usuarios ya no necesitan cambiar entre aplicaciones; pu
Paquetes de Swiftlet 80B Qwen en Mac con 4.3GB de memoria; iPhone 17 ejecutará 35B de forma nativa
Un entorno de ejecución en Swift + Metal llamado Swiftlet está redefiniendo «dónde pueden ejecarse los grandes modelos». Está específicamente diseñado para la familia de modelos MoE (Mixture of Experts) Qwen3-Next y Qwen3.5/3.6. La idea central es ba
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El equipo multimodal de Hunyuan de Tencent ha completado recientemente una reestructuración significativa y un cambio estratégico. Lu Xudong, anteriormente al frente de los esfuerzos de comprensión multimodal de xAI, se ha unido a Hunyuan para dirigir los algoritmos de generación de contenido multimodal. Este cambio coincide con cambios clave en el personal, incluida la partida del ex responsable de comprensión multimodal Hu Han para emprender su propia actividad empresarial y la llegada de Tian Yonglong, un ex investigador de OpenAI. Estos movimientos señalan una importante reorientación en el enfoque de Tencent para el desarrollo de grandes modelos multimodales.
La evolución multimodal de Tencent Hunyuan se ha centrado en varios productos clave. A finales de 2024, el equipo lanzó HunyuanVideo, el modelo de texto a vídeo de código abierto más grande, seguido de las expansiones de 2025 hacia la generación de vídeo a partir de imágenes, generación personalizada y animación de avatares digitales. Las capacidades de generación de imágenes han avanzado desde HunyuanImage hasta la versión 2.1, que admite resolución nativa 2K, y la versión 3.0, con 80 mil millones de parámetros, lo que marca un cambio hacia un rendimiento de grado industrial. Mientras tanto, Hy3D, un modelo 3D unificado, se utiliza ampliamente en el comercio electrónico y el diseño de productos. En el ámbito de la inteligencia espacial, Tencent presentó Hy World 1.0, el primer modelo de generación 3D inmersiva de código abierto y listo para simulación del mundo, con versiones posteriores que continúan avanzando en la investigación de la inteligencia espacial.
A medida que Tencent consolidó sus divisiones de modelos de lenguaje grande y modelos multimodales en el «Departamento de Modelos Básicos» bajo el liderazgo de Yao Shunyu, su estrategia de I+D experimentó un cambio fundamental. La hoja de ruta técnica actual refleja el debate de la industria sobre el papel de los sistemas multimodales en la trayectoria principal de la IA. World Labs de Fei-Fei Li sostiene que los modelos del mundo, como componentes de la inteligencia espacial, son centrales para lograr la AGI. En contraste, DeepSeek aboga por utilizar modalidades visuales como herramientas para apoyar los modelos de lenguaje, minimizando el desarrollo independiente de modelos 3D o del mundo.
Las recientes iniciativas estratégicas de Yao Shunyu, incluido el producto insignia Hy3, sugieren una preferencia por este último enfoque. Ha afirmado consistentemente que la próxima ventaja competitiva de la IA radica en el manejo del contexto y el razonamiento, no simplemente en el número de parámetros. Al integrar la comprensión multimodal en la arquitectura central del modelo y mejorar la estabilidad de la llamada a herramientas y el soporte de contexto largo, Tencent busca aumentar la eficiencia del modelo en entornos de oficina reales y aplicaciones de Agentes GUI. La incorporación de Lu Xudong refuerza la comprensión multimodal, abordando problemas comunes como la inconsistencia en la generación y la inestabilidad espacial. Esta reestructura resalta la evolución estratégica interna de Tencent y su compromiso con centrarse en la productividad y las capacidades centrales en la próxima fase del desarrollo de la AGI.
La estrategia de Trump en materia de inteligencia artificial: ¿qué le depara el futuro a la política estadounidense?
El 3 de agosto, cinco senadores demócratas instaron al Gobierno de Trump a aclarar su política de supervisión de los modelos de IA de vanguardia, haciendo hincapié en la preocupación que suscita la am
Se lanza la Plataforma Abierta de Tongyi Qianwen, llevando la conversación como servicio a la vida cotidiana
La plataforma abierta Tongyi Qianwen ha sido lanzada oficialmente, proporcionando a los desarrolladores acceso a servicios en dispositivos móviles, ordenadores y gafas de realidad aumentada. Los usuarios ya no necesitan cambiar entre aplicaciones; pu
Paquetes de Swiftlet 80B Qwen en Mac con 4.3GB de memoria; iPhone 17 ejecutará 35B de forma nativa
Un entorno de ejecución en Swift + Metal llamado Swiftlet está redefiniendo «dónde pueden ejecarse los grandes modelos». Está específicamente diseñado para la familia de modelos MoE (Mixture of Experts) Qwen3-Next y Qwen3.5/3.6. La idea central es ba











