ChatGPT의 Images 2.0 모델은 텍스트 생성에서 뛰어난 성능을 발휘합니다
불과 몇 년 전만 해도 사람이 만든 이미지와 AI가 생성한 이미지를 구분하는 것은 비교적 간단했습니다. 그 당시에는 이미지 모델에게 멕시코 음식점 메뉴를 만들어 달라고 요청하면, “엔추이타(enchuita)”, “추리로스(churiros)”, “부르토(burrto)”, “마르가르타스(margartas)”와 같은 기괴하고 엉뚱한 요리들이 나오는 경우가 흔했습니다.
오늘날, 최신 ChatGPT Images 2.0 모델에 멕시코 음식 메뉴를 요청하면, 실제 식당에서 당장 사용할 수 있을 만큼 완성도 높은 결과물이 나오며, 손님들이 이상함을 눈치채기 어려울 정도입니다. (비록 13.50달러짜리 세비체는 생선 품질에 대해 의문을 제기할 수도 있겠지만요).

이미지 출처: ChatGPT Images 2.0
비교를 위해, 2년 전 DALL-E 3에서 받은 결과물을 보여드립니다. (당시 ChatGPT에는 이미지 생성 기능이 없었습니다):

이미지 출처: Microsoft Designer (DALL-E 3)
역사적으로 AI 이미지 생성기는 철자 처리에서 상당한 어려움을 겪어왔습니다. 이는 주로 무작위 노이즈로부터 이미지를 재구성하는 확산 모델에 의존했기 때문입니다.
"확산 모델은 [...] 주어진 입력을 재구성합니다,"라고 Lesan AI의 창립자이자 CEO인 아스멜라시 테카 하드구(Asmelash Teka Hadgu)는 2024년 테크크런치(TechCrunch)와의 인터뷰에서 설명했습니다. "이미지 속 텍스트는 매우 사소한 요소로 간주할 수 있으므로, 이미지 생성기는 더 많은 픽셀을 차지하는 시각적 패턴을 학습하는 데 우선순위를 둡니다."
그 이후 연구자들은 자기회귀 모델과 같은 이미지 생성을 위한 다른 접근 방식을 탐구해 왔습니다. 이러한 모델은 이미지가 어떻게 보여야 할지 단계별로 예측하며, 대규모 언어 모델(LLM)과 더 유사한 방식으로 작동합니다.
안타깝게도 오픈AI는 이번 주 열린 기자 간담회에서 ChatGPT Images 2.0을 구동하는 구체적인 모델 아키텍처에 대한 질문에 답변을 거부했다.
하지만 회사는 새로운 모델이 "사고 능력"을 갖추고 있다는 점은 분명히 했다. 이를 통해 웹 검색, 단일 프롬프트로 여러 이미지 생성, 자체 출력물 검토가 가능하다. 이러한 기능 덕분에 Images 2.0은 다양한 크기의 마케팅 자료는 물론, 여러 칸으로 구성된 만화도 제작할 수 있다.
또한 OpenAI는 Images 2.0이 일본어, 한국어, 힌디어, 벵골어를 포함한 비라틴 문자 렌더링 능력을 향상시켰다고 밝혔습니다. 이 모델의 지식은 2025년 12월 기준으로 최신화되어 있어, 매우 최근의 사건과 관련된 이미지를 생성할 때 정확도에 영향을 미칠 수 있습니다.
OpenAI는 보도자료를 통해 "Images 2.0은 이미지 생성 분야에서 전례 없는 수준의 디테일과 정확도를 제공합니다. 이 모델은 더 복잡한 장면을 구상할 뿐만 아니라 그 비전을 효과적으로 구현할 수 있습니다. 지시를 정확하게 따르고 요청된 세부 사항을 유지하며, 작은 텍스트, 아이콘, UI 구성 요소, 정교한 구도, 미묘한 스타일적 뉘앙스 등 다른 이미지 모델들이 종종 어려움을 겪는 세밀한 요소들을 최대 2K 해상도로 렌더링합니다"라고 설명했습니다.
이러한 고급 기능 덕분에 이미지 생성은 ChatGPT에 텍스트 질문을 하는 것만큼 즉각적이지는 않습니다. 하지만 다중 패널 만화와 같은 복잡한 콘텐츠를 생성하는 데도 여전히 몇 분밖에 걸리지 않습니다.
화요일부터 모든 ChatGPT 및 Codex 사용자는 Images 2.0을 이용할 수 있으며, 유료 구독자는 더 정교한 결과물을 생성할 수 있습니다. 또한 회사는 gpt-image-2 API를 출시할 예정이며, 가격은 원하는 출력 품질과 해상도에 따라 책정됩니다.
관련 기사
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L
관련 특별 주제 추천
의견 (0)
0/500
불과 몇 년 전만 해도 사람이 만든 이미지와 AI가 생성한 이미지를 구분하는 것은 비교적 간단했습니다. 그 당시에는 이미지 모델에게 멕시코 음식점 메뉴를 만들어 달라고 요청하면, “엔추이타(enchuita)”, “추리로스(churiros)”, “부르토(burrto)”, “마르가르타스(margartas)”와 같은 기괴하고 엉뚱한 요리들이 나오는 경우가 흔했습니다.
오늘날, 최신 ChatGPT Images 2.0 모델에 멕시코 음식 메뉴를 요청하면, 실제 식당에서 당장 사용할 수 있을 만큼 완성도 높은 결과물이 나오며, 손님들이 이상함을 눈치채기 어려울 정도입니다. (비록 13.50달러짜리 세비체는 생선 품질에 대해 의문을 제기할 수도 있겠지만요).

이미지 출처: ChatGPT Images 2.0
비교를 위해, 2년 전 DALL-E 3에서 받은 결과물을 보여드립니다. (당시 ChatGPT에는 이미지 생성 기능이 없었습니다):

이미지 출처: Microsoft Designer (DALL-E 3)
역사적으로 AI 이미지 생성기는 철자 처리에서 상당한 어려움을 겪어왔습니다. 이는 주로 무작위 노이즈로부터 이미지를 재구성하는 확산 모델에 의존했기 때문입니다.
"확산 모델은 [...] 주어진 입력을 재구성합니다,"라고 Lesan AI의 창립자이자 CEO인 아스멜라시 테카 하드구(Asmelash Teka Hadgu)는 2024년 테크크런치(TechCrunch)와의 인터뷰에서 설명했습니다. "이미지 속 텍스트는 매우 사소한 요소로 간주할 수 있으므로, 이미지 생성기는 더 많은 픽셀을 차지하는 시각적 패턴을 학습하는 데 우선순위를 둡니다."
그 이후 연구자들은 자기회귀 모델과 같은 이미지 생성을 위한 다른 접근 방식을 탐구해 왔습니다. 이러한 모델은 이미지가 어떻게 보여야 할지 단계별로 예측하며, 대규모 언어 모델(LLM)과 더 유사한 방식으로 작동합니다.
안타깝게도 오픈AI는 이번 주 열린 기자 간담회에서 ChatGPT Images 2.0을 구동하는 구체적인 모델 아키텍처에 대한 질문에 답변을 거부했다.
하지만 회사는 새로운 모델이 "사고 능력"을 갖추고 있다는 점은 분명히 했다. 이를 통해 웹 검색, 단일 프롬프트로 여러 이미지 생성, 자체 출력물 검토가 가능하다. 이러한 기능 덕분에 Images 2.0은 다양한 크기의 마케팅 자료는 물론, 여러 칸으로 구성된 만화도 제작할 수 있다.
또한 OpenAI는 Images 2.0이 일본어, 한국어, 힌디어, 벵골어를 포함한 비라틴 문자 렌더링 능력을 향상시켰다고 밝혔습니다. 이 모델의 지식은 2025년 12월 기준으로 최신화되어 있어, 매우 최근의 사건과 관련된 이미지를 생성할 때 정확도에 영향을 미칠 수 있습니다.
OpenAI는 보도자료를 통해 "Images 2.0은 이미지 생성 분야에서 전례 없는 수준의 디테일과 정확도를 제공합니다. 이 모델은 더 복잡한 장면을 구상할 뿐만 아니라 그 비전을 효과적으로 구현할 수 있습니다. 지시를 정확하게 따르고 요청된 세부 사항을 유지하며, 작은 텍스트, 아이콘, UI 구성 요소, 정교한 구도, 미묘한 스타일적 뉘앙스 등 다른 이미지 모델들이 종종 어려움을 겪는 세밀한 요소들을 최대 2K 해상도로 렌더링합니다"라고 설명했습니다.
이러한 고급 기능 덕분에 이미지 생성은 ChatGPT에 텍스트 질문을 하는 것만큼 즉각적이지는 않습니다. 하지만 다중 패널 만화와 같은 복잡한 콘텐츠를 생성하는 데도 여전히 몇 분밖에 걸리지 않습니다.
화요일부터 모든 ChatGPT 및 Codex 사용자는 Images 2.0을 이용할 수 있으며, 유료 구독자는 더 정교한 결과물을 생성할 수 있습니다. 또한 회사는 gpt-image-2 API를 출시할 예정이며, 가격은 원하는 출력 품질과 해상도에 따라 책정됩니다.
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L





집






