Lar
A Tencent reorganiza sua equipe de grandes modelos, com Yao Shunyu assumindo a responsabilidade pelos modelos básicos

A equipe multimodal do Hunyuan da Tencent concluiu recentemente uma reestruturação significativa e uma mudança estratégica. Lu Xudong, que anteriormente liderava os esforços de compreensão multimodal da xAI, juntou-se ao Hunyuan para comandar os algoritmos de geração de conteúdo multimodal. Essa mudança coincide com alterações-chave no quadro de pessoal, incluindo a saída do ex-chefe de compreensão multimodal Hu Han para empreender e a chegada de Tian Yonglong, um ex-pesquisador da OpenAI. Esses movimentos sinalizam uma grande realinhamento na abordagem da Tencent para o desenvolvimento de grandes modelos multimodais.
A evolução multimodal do Hunyuan da Tencent concentrou-se em vários produtos principais. No final de 2024, a equipe lançou o HunyuanVideo, o maior modelo de texto para vídeo de código aberto, seguido por expansões em 2025 para vídeo a partir de imagens, geração personalizada e animação de humanos digitais. As capacidades de geração de imagens evoluíram do HunyuanImage para a versão 2.1, que suporta resolução nativa 2K, e para a versão 3.0, com 80 bilhões de parâmetros, marcando uma mudança em direção a desempenho de nível industrial. Enquanto isso, o Hy3D, um modelo 3D unificado, é amplamente utilizado em comércio eletrônico e design de produtos. Na inteligência espacial, a Tencent apresentou o Hy World 1.0, o primeiro modelo de geração 3D imersiva de código aberto e pronto para simulação do mundo, com versões subsequentes continuando a avançar na pesquisa de inteligência espacial.
À medida que a Tencent consolidou suas divisões de modelos de linguagem grande e modelos multimodais no “Departamento de Modelos Básicos” sob a liderança de Yao Shunyu, sua estratégia de P&D passou por uma mudança fundamental. O atual roteiro técnico reflete o debate da indústria sobre o papel dos sistemas multimodais na trajetória principal da IA. A World Labs de Fei-Fei Li argumenta que os modelos do mundo, como componentes da inteligência espacial, são centrais para alcançar a AGI. Em contraste, a DeepSeek defende o uso de modalidades visuais como ferramentas para apoiar modelos de linguagem, minimizando o desenvolvimento independente de modelos 3D ou de mundo.
As recentes iniciativas estratégicas de Yao Shunyu, incluindo o produto principal Hy3, sugerem uma preferência pela segunda abordagem. Ele afirmou consistentemente que a próxima vantagem competitiva da IA reside no tratamento de contexto e raciocínio, não apenas na contagem de parâmetros. Ao integrar a compreensão multimodal na arquitetura central do modelo e melhorar a estabilidade da chamada de ferramentas e o suporte a contexto longo, a Tencent visa aumentar a eficiência do modelo em ambientes de escritório reais e aplicações de Agentes de Interface Gráfica (GUI Agent). A adição de Lu Xudong fortalece a compreensão multimodal, abordando problemas comuns como inconsistência na geração e instabilidade espacial. Essa reestruturação destaca a evolução estratégica interna da Tencent e seu compromisso em focar na produtividade e nas capacidades essenciais na próxima fase do desenvolvimento da AGI.
Artigo relacionado
A estratégia de IA de Trump: o que vem por aí para a política dos EUA
Em 3 de agosto, cinco senadores democratas instaram o governo Trump a esclarecer sua política de supervisão dos modelos de IA de ponta, destacando preocupações quanto à ameaça competitiva representada
Plataforma Aberta Tongyi Qianwen é Lançada, Trazendo Conversação como Serviço para o Cotidiano
A Plataforma Aberta Tongyi Qianwen foi oficialmente lançada, fornecendo aos desenvolvedores acesso a serviços em dispositivos móveis, computadores e óculos de realidade aumentada. Os usuários não precisam mais alternar entre aplicativos; eles podem c
Pacotes de Swiftlet 80B Qwen no Mac com 4,3 GB de Memória; iPhone 17 executará nativamente 35B
Uma runtime Swift + Metal chamada Swiftlet está redefinindo "onde grandes modelos podem ser executados". Ela foi especificamente projetada para a família de modelos MoE (Mixture of Experts) Qwen3-Next e Qwen3.5/3.6. A ideia central é bastante engenho
Recomendações de tópicos especiais relacionados
Comentários (0)

A equipe multimodal do Hunyuan da Tencent concluiu recentemente uma reestruturação significativa e uma mudança estratégica. Lu Xudong, que anteriormente liderava os esforços de compreensão multimodal da xAI, juntou-se ao Hunyuan para comandar os algoritmos de geração de conteúdo multimodal. Essa mudança coincide com alterações-chave no quadro de pessoal, incluindo a saída do ex-chefe de compreensão multimodal Hu Han para empreender e a chegada de Tian Yonglong, um ex-pesquisador da OpenAI. Esses movimentos sinalizam uma grande realinhamento na abordagem da Tencent para o desenvolvimento de grandes modelos multimodais.
A evolução multimodal do Hunyuan da Tencent concentrou-se em vários produtos principais. No final de 2024, a equipe lançou o HunyuanVideo, o maior modelo de texto para vídeo de código aberto, seguido por expansões em 2025 para vídeo a partir de imagens, geração personalizada e animação de humanos digitais. As capacidades de geração de imagens evoluíram do HunyuanImage para a versão 2.1, que suporta resolução nativa 2K, e para a versão 3.0, com 80 bilhões de parâmetros, marcando uma mudança em direção a desempenho de nível industrial. Enquanto isso, o Hy3D, um modelo 3D unificado, é amplamente utilizado em comércio eletrônico e design de produtos. Na inteligência espacial, a Tencent apresentou o Hy World 1.0, o primeiro modelo de geração 3D imersiva de código aberto e pronto para simulação do mundo, com versões subsequentes continuando a avançar na pesquisa de inteligência espacial.
À medida que a Tencent consolidou suas divisões de modelos de linguagem grande e modelos multimodais no “Departamento de Modelos Básicos” sob a liderança de Yao Shunyu, sua estratégia de P&D passou por uma mudança fundamental. O atual roteiro técnico reflete o debate da indústria sobre o papel dos sistemas multimodais na trajetória principal da IA. A World Labs de Fei-Fei Li argumenta que os modelos do mundo, como componentes da inteligência espacial, são centrais para alcançar a AGI. Em contraste, a DeepSeek defende o uso de modalidades visuais como ferramentas para apoiar modelos de linguagem, minimizando o desenvolvimento independente de modelos 3D ou de mundo.
As recentes iniciativas estratégicas de Yao Shunyu, incluindo o produto principal Hy3, sugerem uma preferência pela segunda abordagem. Ele afirmou consistentemente que a próxima vantagem competitiva da IA reside no tratamento de contexto e raciocínio, não apenas na contagem de parâmetros. Ao integrar a compreensão multimodal na arquitetura central do modelo e melhorar a estabilidade da chamada de ferramentas e o suporte a contexto longo, a Tencent visa aumentar a eficiência do modelo em ambientes de escritório reais e aplicações de Agentes de Interface Gráfica (GUI Agent). A adição de Lu Xudong fortalece a compreensão multimodal, abordando problemas comuns como inconsistência na geração e instabilidade espacial. Essa reestruturação destaca a evolução estratégica interna da Tencent e seu compromisso em focar na produtividade e nas capacidades essenciais na próxima fase do desenvolvimento da AGI.
A estratégia de IA de Trump: o que vem por aí para a política dos EUA
Em 3 de agosto, cinco senadores democratas instaram o governo Trump a esclarecer sua política de supervisão dos modelos de IA de ponta, destacando preocupações quanto à ameaça competitiva representada
Plataforma Aberta Tongyi Qianwen é Lançada, Trazendo Conversação como Serviço para o Cotidiano
A Plataforma Aberta Tongyi Qianwen foi oficialmente lançada, fornecendo aos desenvolvedores acesso a serviços em dispositivos móveis, computadores e óculos de realidade aumentada. Os usuários não precisam mais alternar entre aplicativos; eles podem c
Pacotes de Swiftlet 80B Qwen no Mac com 4,3 GB de Memória; iPhone 17 executará nativamente 35B
Uma runtime Swift + Metal chamada Swiftlet está redefinindo "onde grandes modelos podem ser executados". Ela foi especificamente projetada para a família de modelos MoE (Mixture of Experts) Qwen3-Next e Qwen3.5/3.6. A ideia central é bastante engenho











