오픈AI의 GPT-5, 다양한 직종에서 인간 수준의 성능 과시
목요일, OpenAI는 다양한 산업 분야에서 자사의 AI 모델이 인간 전문가들과 어떻게 비교되는지를 평가하는 획기적인 벤치마크인 GDPval을 발표했습니다. 이 평가는 OpenAI의 시스템이 경제적으로 영향력 있는 업무에서 인간을 능가할 수 있는지 측정하기 위한 첫걸음으로, 이는 기업이 인공 일반 지능(AGI)을 추구하는 데 있어 핵심 목표입니다.
OpenAI에 따르면, GPT-5와 Anthropic의 Claude Opus 4.1 모두 산업 전문가에 버금가는 출력 품질을 보여줍니다.
이러한 결과가 인간의 일자리가 조만간 대체될 것을 의미하는 것은 아니지만, 중요한 진전을 추적하는 지표가 됩니다. OpenAI는 GDPval이 현재 실제 전문가 업무의 일부분만 평가하고 있다고 인정하며, 몇몇 CEO들이 예측한 수년 내에 광범위한 AI로 인한 업무 교란에 대한 주장에 반박합니다.
GDPval은 의료, 금융, 제조, 정부를 포함한 미국 GDP의 9개 주요 부문 전반의 성과를 평가하며, 소프트웨어 엔지니어링부터 언론에 이르기까지 44개 직종을 테스트합니다.
GDPval-v0의 경우, 전문가들이 AI가 생성한 보고서를 인간이 작성한 동료들의 작업과 비교했습니다. 한 샘플 작업에서는 투자 은행원들이 라스트마일 배송 경쟁사 환경을 분석한 결과를 AI 버전과 비교하는 작업이 포함되었습니다. OpenAI는 모든 직종에 걸쳐 인간의 출력 대비 각 모델의 "승률"을 계산했습니다.
향상된 GPT-5-high 모델은 40.6%의 경우에서 전문가의 출력을 맞추거나 능가했으며, Claude Opus 4.1은 49%의 동등 비율을 달성했습니다. OpenAI는 이 더 높은 점수가 실질적인 우위보다는 Claude의 시각적 표현력이 뛰어나기 때문일 수 있다고 시사합니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 혁신가들과 연결하세요
Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil을 비롯한 250명 이상의 산업 리더들이 200개 이상의 성장 중심 세션을 주최합니다. TechCrunch의 20주년을 기념하면서 기술계 최고 사상가들로부터 경쟁력 있는 통찰력을 얻으세요. 9월 26일 이전 조기 등록 시 최대 $668을 절약할 수 있습니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 혁신가들과 연결하세요
Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil을 비롯한 250명 이상의 산업 리더들이 200개 이상의 성장 중심 세션을 주최합니다. TechCrunch의 20주년을 기념하면서 기술계 최고 사상가들로부터 경쟁력 있는 통찰력을 얻으세요. 9월 26일 이전 조기 등록 시 최대 $668을 절약할 수 있습니다.

이미지 출처: OpenAI OpenAI는 GDPval-v0의 초점이 현재 연구 보고서 생성만 테스트하는 데 국한되어 있으며, 향후 버전에서는 더 넓은 업무 상호작용을 평가할 계획이라고 인정했습니다.
수석 경제학자인 Aaron Chatterji 박사는 TechCrunch에 이러한 결과가 전문가들이 점점 더 일상적인 업무를 AI에 위임함으로써 더 높은 가치의 작업에 집중할 수 있게 될 것임을 시사한다고 밝혔습니다.
평가를 주도하는 Tejal Patwardhan은 빠른 진전을 지적합니다: 15개월 전에는 GPT-4o가 겨우 13.7%의 점수를 받았던 반면, GPT-5는 그 성능을 거의 3배 가까이 향상시켰으며, 이러한 추세는 계속될 것으로 예상됩니다.
AIME 2025 및 GPQA Diamond와 같은 벤치마크가 AI 평가를 주도하고 있지만, 많은 모델들이 이러한 학술 테스트에서 포화 상태에 접근하고 있습니다. GDPval은 실용적이고 산업 관련 평가 기준에 대한 점증하는 강조를 나타내며, 비록 OpenAI가 전문 분야 전반에 걸쳐 인간 수준의 성능을 결정적으로 입증하기 위해서는 더 포괄적인 테스트가 필요합니다.
관련 기사
Anthropic, 새로운 동적 워크플로우 도구를 탑재한 Opus 4.8 출시
앤트로픽은 목요일, 자사의 주력 공개 모델인 ‘오푸스(Opus)’의 최신 버전인 4.8을 공개했다. 이전 버전과 가격이 동일한 이번 업데이트는 이제 모든 플랫폼에서 이용할 수 있다.Opus 4.7 출시 불과 41일 만에 Opus 4.8을 공개한 Anthropic은 개발 주기를 대폭 단축했으며, 이는 최근 Sonnet 및 Haiku 출시 시 보였던 3개월 및
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
관련 특별 주제 추천
의견 (0)
0/500
목요일, OpenAI는 다양한 산업 분야에서 자사의 AI 모델이 인간 전문가들과 어떻게 비교되는지를 평가하는 획기적인 벤치마크인 GDPval을 발표했습니다. 이 평가는 OpenAI의 시스템이 경제적으로 영향력 있는 업무에서 인간을 능가할 수 있는지 측정하기 위한 첫걸음으로, 이는 기업이 인공 일반 지능(AGI)을 추구하는 데 있어 핵심 목표입니다.
OpenAI에 따르면, GPT-5와 Anthropic의 Claude Opus 4.1 모두 산업 전문가에 버금가는 출력 품질을 보여줍니다.
이러한 결과가 인간의 일자리가 조만간 대체될 것을 의미하는 것은 아니지만, 중요한 진전을 추적하는 지표가 됩니다. OpenAI는 GDPval이 현재 실제 전문가 업무의 일부분만 평가하고 있다고 인정하며, 몇몇 CEO들이 예측한 수년 내에 광범위한 AI로 인한 업무 교란에 대한 주장에 반박합니다.
GDPval은 의료, 금융, 제조, 정부를 포함한 미국 GDP의 9개 주요 부문 전반의 성과를 평가하며, 소프트웨어 엔지니어링부터 언론에 이르기까지 44개 직종을 테스트합니다.
GDPval-v0의 경우, 전문가들이 AI가 생성한 보고서를 인간이 작성한 동료들의 작업과 비교했습니다. 한 샘플 작업에서는 투자 은행원들이 라스트마일 배송 경쟁사 환경을 분석한 결과를 AI 버전과 비교하는 작업이 포함되었습니다. OpenAI는 모든 직종에 걸쳐 인간의 출력 대비 각 모델의 "승률"을 계산했습니다.
향상된 GPT-5-high 모델은 40.6%의 경우에서 전문가의 출력을 맞추거나 능가했으며, Claude Opus 4.1은 49%의 동등 비율을 달성했습니다. OpenAI는 이 더 높은 점수가 실질적인 우위보다는 Claude의 시각적 표현력이 뛰어나기 때문일 수 있다고 시사합니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 혁신가들과 연결하세요
Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil을 비롯한 250명 이상의 산업 리더들이 200개 이상의 성장 중심 세션을 주최합니다. TechCrunch의 20주년을 기념하면서 기술계 최고 사상가들로부터 경쟁력 있는 통찰력을 얻으세요. 9월 26일 이전 조기 등록 시 최대 $668을 절약할 수 있습니다.
Disrupt 2025에서 10,000명 이상의 기술 및 VC 혁신가들과 연결하세요
Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil을 비롯한 250명 이상의 산업 리더들이 200개 이상의 성장 중심 세션을 주최합니다. TechCrunch의 20주년을 기념하면서 기술계 최고 사상가들로부터 경쟁력 있는 통찰력을 얻으세요. 9월 26일 이전 조기 등록 시 최대 $668을 절약할 수 있습니다.

OpenAI는 GDPval-v0의 초점이 현재 연구 보고서 생성만 테스트하는 데 국한되어 있으며, 향후 버전에서는 더 넓은 업무 상호작용을 평가할 계획이라고 인정했습니다.
수석 경제학자인 Aaron Chatterji 박사는 TechCrunch에 이러한 결과가 전문가들이 점점 더 일상적인 업무를 AI에 위임함으로써 더 높은 가치의 작업에 집중할 수 있게 될 것임을 시사한다고 밝혔습니다.
평가를 주도하는 Tejal Patwardhan은 빠른 진전을 지적합니다: 15개월 전에는 GPT-4o가 겨우 13.7%의 점수를 받았던 반면, GPT-5는 그 성능을 거의 3배 가까이 향상시켰으며, 이러한 추세는 계속될 것으로 예상됩니다.
AIME 2025 및 GPQA Diamond와 같은 벤치마크가 AI 평가를 주도하고 있지만, 많은 모델들이 이러한 학술 테스트에서 포화 상태에 접근하고 있습니다. GDPval은 실용적이고 산업 관련 평가 기준에 대한 점증하는 강조를 나타내며, 비록 OpenAI가 전문 분야 전반에 걸쳐 인간 수준의 성능을 결정적으로 입증하기 위해서는 더 포괄적인 테스트가 필요합니다.
Anthropic, 새로운 동적 워크플로우 도구를 탑재한 Opus 4.8 출시
앤트로픽은 목요일, 자사의 주력 공개 모델인 ‘오푸스(Opus)’의 최신 버전인 4.8을 공개했다. 이전 버전과 가격이 동일한 이번 업데이트는 이제 모든 플랫폼에서 이용할 수 있다.Opus 4.7 출시 불과 41일 만에 Opus 4.8을 공개한 Anthropic은 개발 주기를 대폭 단축했으며, 이는 최근 Sonnet 및 Haiku 출시 시 보였던 3개월 및
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh





집






