오픈AI, GPT-5.4 Pro 및 Thinking 에디션 공개

목요일, OpenAI는 “전문적인 업무를 위한 가장 강력하고 효율적인 최첨단 모델”로 소개된 새로운 파운데이션 모델인 GPT-5.4를 공개했습니다. 표준 버전 외에도 GPT-5.4는 추론에 중점을 둔 변형 모델(GPT-5.4 Thinking)과 성능이 최적화된 버전(GPT-5.4 Pro)으로 제공됩니다.
이 모델의 API 버전은 최대 100만 토큰 규모의 컨텍스트 윈도우를 지원하며, 이는 OpenAI가 지금까지 제공한 것 중 가장 큰 컨텍스트 용량입니다.
또한 OpenAI는 토큰 효율성이 향상되었다고 강조하며, GPT-5.4가 이전 모델보다 훨씬 적은 토큰 수로 동일한 문제를 해결할 수 있다고 밝혔습니다.
이 새로운 모델은 벤치마크 결과에서 상당한 개선을 보여주며, 컴퓨터 활용 벤치마크인 OSWorld-Verified와 WebArena Verified에서 기록적인 점수를 달성했습니다. 또한 지식 작업 과제를 평가하는 OpenAI의 GDPval 테스트에서 83%의 점수를 기록하며 새로운 기록을 세웠습니다.
Mercor의 브렌던 푸디(Brendan Foody) CEO의 성명에 따르면, GPT-5.4는 법률 및 금융 분야의 전문 기술을 평가하는 Mercor의 APEX-Agents 벤치마크에서 선두를 달리고 있습니다.
푸디 CEO는 "[GPT-5.4]는 슬라이드 자료, 재무 모델, 법률 분석과 같은 장기적인 결과물 생성에서 탁월한 성능을 발휘하며, 경쟁 모델보다 더 빠르고 저렴한 비용으로 최고 수준의 성능을 제공합니다"라고 밝혔다.
GPT-5.4는 환각 현상과 사실적 오류 감소를 위한 OpenAI의 노력을 이어가고 있다. 회사에 따르면, 이 새로운 모델은 GPT-5.2에 비해 개별 주장에서 오류를 범할 확률이 33% 낮으며, 전체 응답에서 오류가 포함될 확률도 18% 감소했다.
출시와 함께 OpenAI는 GPT-5.4 API의 도구 호출 방식을 재설계하여 'Tool Search'라는 새로운 시스템을 도입했습니다. 이전에는 시스템 프롬프트가 사용 가능한 모든 도구를 사전에 정의해야 했으며, 이는 도구 라이브러리가 확장됨에 따라 상당한 토큰을 소모하는 과정이었습니다. 새로운 시스템은 모델이 필요에 따라 도구 정의를 검색할 수 있게 하여, 도구가 많은 환경에서 요청을 더 빠르고 비용 효율적으로 처리할 수 있게 합니다.
또한 OpenAI는 다단계 작업 수행 중 모델의 추론 과정을 보여주는 '사고의 연쇄(chain-of-thought)'를 평가하기 위한 새로운 안전성 평가 기능을 추가했습니다. AI 안전성 연구자들은 오랫동안 추론 모델이 자신의 사고의 연쇄를 왜곡할 수 있다는 우려를 제기해 왔으며, 테스트 결과 특정 조건 하에서 이러한 현상이 발생할 수 있음이 확인되었습니다.
OpenAI의 새로운 평가 결과에 따르면, GPT-5.4의 'Thinking' 버전에서는 이러한 속임수가 발생할 가능성이 더 낮은 것으로 나타났으며, 이는 "모델이 자신의 추론을 숨길 능력이 부족하며, CoT 모니터링이 여전히 효과적인 안전 도구임을 시사한다"고 합니다.
관련 기사
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L
관련 특별 주제 추천
의견 (0)
0/500

목요일, OpenAI는 “전문적인 업무를 위한 가장 강력하고 효율적인 최첨단 모델”로 소개된 새로운 파운데이션 모델인 GPT-5.4를 공개했습니다. 표준 버전 외에도 GPT-5.4는 추론에 중점을 둔 변형 모델(GPT-5.4 Thinking)과 성능이 최적화된 버전(GPT-5.4 Pro)으로 제공됩니다.
이 모델의 API 버전은 최대 100만 토큰 규모의 컨텍스트 윈도우를 지원하며, 이는 OpenAI가 지금까지 제공한 것 중 가장 큰 컨텍스트 용량입니다.
또한 OpenAI는 토큰 효율성이 향상되었다고 강조하며, GPT-5.4가 이전 모델보다 훨씬 적은 토큰 수로 동일한 문제를 해결할 수 있다고 밝혔습니다.
이 새로운 모델은 벤치마크 결과에서 상당한 개선을 보여주며, 컴퓨터 활용 벤치마크인 OSWorld-Verified와 WebArena Verified에서 기록적인 점수를 달성했습니다. 또한 지식 작업 과제를 평가하는 OpenAI의 GDPval 테스트에서 83%의 점수를 기록하며 새로운 기록을 세웠습니다.
Mercor의 브렌던 푸디(Brendan Foody) CEO의 성명에 따르면, GPT-5.4는 법률 및 금융 분야의 전문 기술을 평가하는 Mercor의 APEX-Agents 벤치마크에서 선두를 달리고 있습니다.
푸디 CEO는 "[GPT-5.4]는 슬라이드 자료, 재무 모델, 법률 분석과 같은 장기적인 결과물 생성에서 탁월한 성능을 발휘하며, 경쟁 모델보다 더 빠르고 저렴한 비용으로 최고 수준의 성능을 제공합니다"라고 밝혔다.
GPT-5.4는 환각 현상과 사실적 오류 감소를 위한 OpenAI의 노력을 이어가고 있다. 회사에 따르면, 이 새로운 모델은 GPT-5.2에 비해 개별 주장에서 오류를 범할 확률이 33% 낮으며, 전체 응답에서 오류가 포함될 확률도 18% 감소했다.
출시와 함께 OpenAI는 GPT-5.4 API의 도구 호출 방식을 재설계하여 'Tool Search'라는 새로운 시스템을 도입했습니다. 이전에는 시스템 프롬프트가 사용 가능한 모든 도구를 사전에 정의해야 했으며, 이는 도구 라이브러리가 확장됨에 따라 상당한 토큰을 소모하는 과정이었습니다. 새로운 시스템은 모델이 필요에 따라 도구 정의를 검색할 수 있게 하여, 도구가 많은 환경에서 요청을 더 빠르고 비용 효율적으로 처리할 수 있게 합니다.
또한 OpenAI는 다단계 작업 수행 중 모델의 추론 과정을 보여주는 '사고의 연쇄(chain-of-thought)'를 평가하기 위한 새로운 안전성 평가 기능을 추가했습니다. AI 안전성 연구자들은 오랫동안 추론 모델이 자신의 사고의 연쇄를 왜곡할 수 있다는 우려를 제기해 왔으며, 테스트 결과 특정 조건 하에서 이러한 현상이 발생할 수 있음이 확인되었습니다.
OpenAI의 새로운 평가 결과에 따르면, GPT-5.4의 'Thinking' 버전에서는 이러한 속임수가 발생할 가능성이 더 낮은 것으로 나타났으며, 이는 "모델이 자신의 추론을 숨길 능력이 부족하며, CoT 모니터링이 여전히 효과적인 안전 도구임을 시사한다"고 합니다.
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L





집






