옵션
뉴스
새로운 벤치마크, AI 에이전트의 업무 준비도 의문 제기

새로운 벤치마크, AI 에이전트의 업무 준비도 의문 제기

2026년 2월 20일
114

거의 2년 전, 마이크로소프트 CEO 사티아 나델라는 인공지능이 지식 노동—변호사, 투자은행가, 사서, 회계사, IT 전문가 및 유사한 화이트칼라 직종의 영역—을 재편할 것이라고 예측했다.

그러나 기초 모델의 상당한 발전에도 불구하고 지식 노동의 변혁은 더딘 모습을 보이고 있다. 모델들이 심층 연구와 행위적 계획 수립에 탁월함에도 불구하고, 대부분의 화이트칼라 직업군은 아직까지 불분명한 이유로 상대적으로 적은 수준의 변화를 경험하고 있다.

이는 인공지능의 큰 수수께끼 중 하나로 남아 있다. 훈련 데이터 분야의 선도 기업 머코어(Mercor)의 새로운 연구가 이제 중요한 통찰력을 제공하고 있다.

이 연구는 컨설팅, 투자은행, 법률 분야의 실제 화이트칼라 업무를 최상위 AI 모델들이 어떻게 처리하는지 평가했다. 이를 통해 APEX-Agents 벤치마크가 개발되었으며, 현재 모든 AI 연구실은 이 벤치마크에서 실패하고 있다. 실제 전문가들의 질의를 제시했을 때, 최고 성능 모델조차도 4분의 1 미만만 정확히 답변했다. 대부분은 잘못된 답변을 제공하거나 아예 답변을 하지 못했다.

연구에 참여한 머코어의 브렌던 푸디 CEO에 따르면, 모델의 주요 약점은 인간 지식 작업의 핵심 요소인 다중 영역에 걸친 정보 종합 능력이었다.

푸디는 테크크런치와의 인터뷰에서 "이 벤치마크의 핵심 혁신은 실제 전문 서비스를 모델링한 완전한 환경을 구축했다는 점"이라며 "우리 작업은 한 사람이 모든 맥락을 한곳에서 제공하는 방식이 아닙니다. 현실에서는 슬랙, 구글 드라이브 등 다양한 도구를 넘나들며 작업하죠"라고 설명했다. 많은 에이전트형 AI 모델에게 이러한 영역 간 추론은 여전히 일관성이 부족하다.

스크린샷

테스트 시나리오는 Mercor의 전문가 마켓플레이스에서 실제 전문가들이 설계한 질의와 성공적인 답변 기준을 바탕으로 구성되었습니다. Hugging Face에 공개된 질문들을 살펴보면 이 작업들의 복잡성을 확인할 수 있습니다. 

테크크런치 행사

Disrupt 2026 티켓: 단 한 번의 기회

지금 티켓을 구매하세요! 기간 한정 혜택으로 최대 680달러를 절약하고, 선착순 500명에게 제공되는 +1 패스 50% 할인 혜택을 받으세요. TechCrunch Disrupt는 Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face 등 최고의 리더들을 한자리에 모아 성장을 촉진하고 경쟁력을 강화하기 위한 250개 이상의 세션을 제공합니다. 수백 개의 혁신적인 스타트업과 교류하고, 거래와 통찰력, 영감을 이끌어내는 맞춤형 네트워킹에 참여하세요.

Disrupt 2026 티켓: 단 한 번의 기회

지금 티켓을 구매하세요! 기간 한정 혜택으로 최대 680달러를 절약하고, 선착순 500명에게 제공되는 +1 패스 50% 할인 혜택을 받으세요. TechCrunch Disrupt는 Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face 등 최고의 리더들을 한자리에 모아 성장을 촉진하고 경쟁력을 강화하는 250개 이상의 세션을 제공합니다. 수백 개의 혁신적인 스타트업과 교류하고, 거래, 통찰력, 영감을 이끌어내는 선별된 네트워킹에 참여하세요.

샌프란시스코 | 2026년 10월 13-15일 지금 등록하세요

"법률" 섹션의 한 예시 질문: 

EU 생산 중단 발생 후 첫 48분 동안 Northstar 엔지니어링 팀은 개인 데이터가 포함된 EU 생산 이벤트 로그를 묶어 한두 세트 미국 분석 업체로 내보냈습니다… Northstar 자체 정책에 따르면, 이러한 한두 차례의 로그 내보내기를 제49조 준수라고 합리적으로 간주할 수 있을까요?

정답은 '예'이지만, 이를 도출하려면 해당 기업의 내부 정책과 관련 EU 개인정보 보호 규정을 모두 상세히 분석해야 합니다.

이 같은 질문은 전문 지식을 갖춘 인간에게도 도전적일 수 있으나, 연구진은 실제 전문직 업무를 모의하는 것을 목표로 했습니다. 이러한 질의에 신뢰성 있게 답변할 수 있는 대규모 언어 모델(LLM)은 현직 변호사 다수를 대체할 잠재력을 지닙니다. 푸디는 테크크런치와의 인터뷰에서 "이는 오늘날 가장 중요한 경제적 주제라 할 수 있다"며 "이 벤치마크는 해당 전문가들이 수행하는 실제 업무를 정확히 반영한다"고 말했습니다.

OpenAI는 이전에 GDPval 벤치마크로 전문 기술을 평가하려 시도했지만, APEX-Agents 테스트는 의미 있게 다릅니다. GDPval이 다양한 분야의 광범위한 일반 지식을 평가하는 반면, APEX-Agents는 선택된 소수 고부가가치 직업 내에서 지속적 업무를 수행하는 시스템의 능력을 측정합니다. 이는 모델에게 더 어려운 과제이며 직업 자동화의 잠재력과 더 직접적으로 관련됩니다.

아직 투자 은행가로 대체할 준비가 된 모델은 없지만, 일부 모델은 다른 모델보다 훨씬 근접한 성과를 보였다. Gemini 3 Flash가 24%의 원샷 정확도로 선두를 달렸고, GPT-5.2가 23%로 그 뒤를 바짝 따랐다. Opus 4.5, Gemini 3 Pro, GPT-5는 모두 약 18%의 점수를 기록했다.

이러한 초기 결과는 기대에 미치지 못하지만, AI 분야는 어려운 벤치마크를 빠르게 극복해온 실적이 있습니다. APEX-Agents 테스트가 공개됨에 따라, 개선 가능성을 확신하는 AI 연구소들에게 공개적인 도전 과제가 제시되었습니다. 푸디는 향후 몇 달 안에 이러한 결과가 나올 것이라고 완전히 예상하고 있습니다. 

그는 테크크런치와의 인터뷰에서 "개선 속도가 놀라울 정도로 빠르다"며 "현재 기술은 4분의 1 확률로 정답을 맞히는 인턴 수준이지만, 작년만 해도 5~10% 성공률에 그쳤다. 이러한 연간 진전 속도는 매우 빠르게 상당한 영향을 창출할 수 있다"고 말했다.

관련 기사
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔 알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔 Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이
인도 기술 거대기업이 마이크로소프트 오피스의 AI 경쟁사에 3000만 달러 투자 인도 기술 거대기업이 마이크로소프트 오피스의 AI 경쟁사에 3000만 달러 투자 시리즈 창업가 바힌 투라크히아는 3,000만 달러의 자금을 자신의 자본으로 투자하며, 엔터프라이즈 AI 분야에 여전히 신규 진입자에게 기회가 남아 있다고 믿고 있다. 그의 최신 스타트업 ‘Neo’는 핵심 신념을 바탕으로 운영된다: 기존 직장용 소프트웨어는 채팅봇으로 단순히 패치할 수 없으며, 아키텍처의 완전한 재설계가 필요하다는 것이다.46세의 투라크히아는 야심 찬 엔터프라이즈 테크 벤처를 지원해 온 이력이 있다. 지난 20년간 그는 Dire
전 OpenAI 수석 과학자 일리아의 SSI가 첫 모델을 공개하다 전 OpenAI 수석 과학자 일리아의 SSI가 첫 모델을 공개하다 AI는 또 다른 주요 이정표를 달성했습니다. 오픈AI를 떠난 전 수석 과학자 일야 수트케버는 세이프 슈퍼인텔리전스 인크.(SSI)를 설립했으며, 이 회사는 최근 첫 번째 모델에 대한 세부 사항을 공개했습니다. 해외 소셜 미디어의 보도에 따르면, 이 팀은 안전한 슈퍼인텔리전스 추구를 위한 중요한 진전인 TTT(테스트 중 학습)를 활용한 컴팩트한 추론 엔진을 개발하고 있습니다.이 새로운 아키텍처는 모델이 '학습 방법을 학습'할 수 있도록 하는 데
관련 특별 주제 추천
챗봇 면접 연습을 위한 최고의 AI 대화 트레이너 도구
면접 연습을 위한 최고의 AI 대화 트레이너 도구

2026년 최신 최고의 평점 높은 AI 대화 트레이너 도구들이 XIX.AI에서 만나보세요! 면접 연습을 위한 이 엄선된 컬렉션은 강력한, 게임 체인저 도구들을 포함하고 있으며, 엄격한 실제 세계 테스트를 거쳐 정확한 피드백을 제공합니다. 무료 대 유료 비교와 상세한 순위표를 찾을 수 있어 자신감과 기술을 향상시킬 수 있는 꼭 시도해봐야 할 옵션을 선택하는 데 도움이 됩니다. 지금 탐색하여 면접 성공을 위한 완벽한 도구를 발견하세요!

12 도구
xix.ai
디자인과 예술 창의적인 실험을 위한 최고의 AI 스타일 변환 도구
창의적인 실험을 위한 최고의 AI 스타일 변환 도구

2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!

9 도구
xix.ai
만화 창작 시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구
시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구

2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!

10 도구
xix.ai
회의 도우미 최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요
최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요

2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

9 도구
xix.ai
데이터 분석 최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기
최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기

2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.

11 도구
xix.ai
디자인과 예술 아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라
아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라

2026년 최신 최고 인기 AI 창의적 아이디어 도구들은 XIX.AI가 선별한 것으로, 창작자들이 시각적 장벽을 돌파하고 즉각적으로 창의성을 높일 수 있도록 지원합니다. 이러한 강력한 혁신적 도구들은 실제 테스트 결과, 무료와 유료 버전의 상세 비교, 그리고 매주 업데이트되는 순위표를 제공합니다. 콘텐츠 제작을 가속화하고 AI 경쟁력을 발휘할 수 있는 완벽한 도구를 발견하세요. 지금 바로 탐색하세요!

14 도구
xix.ai
의견 (0)
0/500
OR