Lar
Equipe principal do GPT Image2, composta por 13 membros, é revelada após quatro meses de reformulação
Recentemente, o GPT Image2 causou furor nas redes sociais com sua geração de imagens incrivelmente realistas. À medida que a popularidade do projeto disparava, a pequena equipe discreta por trás dele ganhou destaque. Informações revelam que a equipe principal é composta por apenas 13 pessoas, que conseguiram reescrever completamente a arquitetura subjacente em meros quatro meses. Embora o líder de pesquisa Chen Boyuan não tenha divulgado detalhes técnicos específicos, ele descreve esse novo modelo como “o GPT para o domínio visual”, sinalizando um grande salto em frente nas capacidades de uso geral.
A figura-chave da equipe, Chen Boyuan , tem uma trajetória pessoal notável. Durante seu doutorado, ele foi pioneiro em abordagens inovadoras como “Diffusion Forcing” e contribuiu para técnicas de ajuste de instruções posteriormente adotadas pelo Gemini 2.0 do Google. Curiosamente, ele nem mesmo conhecia Python quando participou pela primeira vez de um acampamento de ciências no ensino médio. Depois de passar para a OpenAI, ele não apenas liderou todo o treinamento do modelo de imagem GPT, mas também foi um membro central da equipe de geração de vídeo Sora. Em uma demonstração, ele destacou a compreensão avançada de linguagem do modelo ao gerar pôsteres com texto perfeitamente renderizado em chinês, coreano e bengali.

Além da renderização de texto, o GPT Image2 alcançou novos patamares na compreensão do conhecimento do mundo e no cumprimento de instruções complexas. Este módulo, liderado pelo Dr. Jianfeng Wang, da Universidade de Ciência e Tecnologia da China, aborda uma questão persistente na geração de imagens por IA — como os modelos mais antigos que sempre padronizam o desenho de relógios marcando 10h10. O novo modelo interpreta com precisão qualquer horário especificado e layouts espaciais complexos. O Dr. Wang observa que o modelo está efetivamente preenchendo a lacuna entre a visão criativa do usuário e o resultado final gerado.
No que diz respeito à produtividade, Yuguang Yang, do Zhuyuan College da Universidade de Zhejiang, demonstrou a capacidade da ferramenta de converter instantaneamente longos artigos de pesquisa em apresentações de PowerPoint e infográficos de alta precisão. Essa capacidade decorre da profunda integração da equipe entre compreensão multimodal, arquitetura Mixture of Experts (MoE) e tecnologia de orientação de contexto longo.
Do DALL-E original ao GPT Image2 de hoje
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
Recentemente,
A figura-chave da equipe,

Além da renderização de texto,
No que diz respeito à produtividade, Yuguang Yang, do Zhuyuan College da Universidade de Zhejiang, demonstrou a capacidade da ferramenta de converter instantaneamente longos artigos de pesquisa em apresentações de PowerPoint e infográficos de alta precisão. Essa capacidade decorre da profunda integração da equipe entre compreensão multimodal, arquitetura Mixture of Experts (MoE) e tecnologia de orientação de contexto longo.
Do DALL-E original ao
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











