Hogar
Se da a conocer el equipo principal de 13 miembros de GPT Image2 tras cuatro meses de rediseño
Recientemente, GPT Image2 ha causado sensación en las redes sociales gracias a su generación de imágenes de un realismo asombroso. A medida que la popularidad del proyecto se disparaba, el pequeño y discreto equipo que lo desarrollaba pasó a ocupar el centro de la atención. La información revela que el equipo principal está compuesto por tan solo 13 personas, que lograron reescribir por completo la arquitectura subyacente en apenas cuatro meses. Aunque el director de investigación, Chen Boyuan, no ha revelado detalles técnicos específicos, describe este nuevo modelo como «el GPT para el ámbito visual», lo que supone un gran avance en las capacidades de uso general.
La figura clave del equipo, Chen Boyuan , tiene una trayectoria personal notable. Durante su doctorado, fue pionero en enfoques innovadores como el «Diffusion Forcing» y contribuyó a las técnicas de ajuste de instrucciones que posteriormente adoptó Gemini 2.0 de Google. Curiosamente, ni siquiera sabía Python cuando se unió por primera vez a un campamento de ciencias en el instituto. Tras incorporarse a OpenAI, no solo dirigió todo el entrenamiento del modelo de imágenes GPT, sino que también fue miembro clave del equipo de generación de vídeo Sora. En una demostración, destacó la avanzada comprensión del lenguaje del modelo generando carteles con texto perfectamente renderizado en chino, coreano y bengalí.

Más allá de la representación de texto, GPT Image2 ha alcanzado nuevas cotas en la comprensión del conocimiento del mundo y el seguimiento de instrucciones complejas. Este módulo, dirigido por el Dr. Jianfeng Wang de la Universidad de Ciencia y Tecnología de China, aborda un problema persistente en la generación de imágenes con IA, como que los modelos más antiguos siempre dibujaban relojes a las 10:10 por defecto. El nuevo modelo interpreta con precisión cualquier hora especificada y diseños espaciales complejos. El Dr. Wang señala que el modelo está reduciendo de manera efectiva la brecha entre la visión creativa del usuario y el resultado final generado.
En cuanto a la productividad, Yuguang Yang, del Zhuyuan College de la Universidad de Zhejiang, mostró la capacidad de la herramienta para convertir al instante largos artículos de investigación en presentaciones de PowerPoint e infografías de alta precisión. Esta capacidad se deriva de la profunda integración por parte del equipo de la comprensión multimodal, la arquitectura Mixture of Experts (MoE) y la tecnología de orientación de contexto largo.
Desde el DALL-E original hasta el GPT Image2 actual
Artículo relacionado
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
El 14 de mayo de 2026, la plataforma de desarrollo de aplicaciones de IA Lovable anunció su participación en la ronda de financiación semilla de 800.000 dólares para la startup danesa de hardware Atech. Liderada por Lovable, la ronda atrajo a firmas
Anthropic amplía las herramientas de codificación de Claude AI a Japón en su impulso por el crecimiento en el extranjero
Anthropic, una destacada empresa estadounidense de inteligencia artificial, está intensificando su alcance global. El miércoles, la compañía organizó una importante reunión de desarrolladores, "Code with Claude", en Tokio, que reunió a cerca de 500 i
El gigante del software de India reduce la contratación y promete no realizar despidos a medida que los agentes de IA se escalan
Mientras la inteligencia artificial remodela los modelos de negocio tradicionales intensivos en mano de obra, Tata Consultancy Services (TCS), una destacada empresa india de externalización de software, ha presentado su respuesta estratégica. Durante
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Recientemente,
La figura clave del equipo,

Más allá de la representación de texto,
En cuanto a la productividad, Yuguang Yang, del Zhuyuan College de la Universidad de Zhejiang, mostró la capacidad de la herramienta para convertir al instante largos artículos de investigación en presentaciones de PowerPoint e infografías de alta precisión. Esta capacidad se deriva de la profunda integración por parte del equipo de la comprensión multimodal, la arquitectura Mixture of Experts (MoE) y la tecnología de orientación de contexto largo.
Desde el DALL-E original hasta
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
El 14 de mayo de 2026, la plataforma de desarrollo de aplicaciones de IA Lovable anunció su participación en la ronda de financiación semilla de 800.000 dólares para la startup danesa de hardware Atech. Liderada por Lovable, la ronda atrajo a firmas
Anthropic amplía las herramientas de codificación de Claude AI a Japón en su impulso por el crecimiento en el extranjero
Anthropic, una destacada empresa estadounidense de inteligencia artificial, está intensificando su alcance global. El miércoles, la compañía organizó una importante reunión de desarrolladores, "Code with Claude", en Tokio, que reunió a cerca de 500 i
El gigante del software de India reduce la contratación y promete no realizar despidos a medida que los agentes de IA se escalan
Mientras la inteligencia artificial remodela los modelos de negocio tradicionales intensivos en mano de obra, Tata Consultancy Services (TCS), una destacada empresa india de externalización de software, ha presentado su respuesta estratégica. Durante











