新基準測試質疑人工智慧代理程式的工作就緒性
近兩年前,微軟執行長薩蒂亞·納德拉曾預言人工智慧將重塑知識型工作——涵蓋律師、投資銀行家、圖書館員、會計師、資訊科技專業人員等白領職域。
然而,儘管基礎模型取得重大進展,知識型工作的轉型卻遲遲未能實現。儘管模型在深度研究與代理規劃方面表現出色,但多數白領職業所受的衝擊相對有限,箇中原因仍不明朗。
這已成為人工智慧領域的重大謎題。訓練數據領導者Mercor的最新研究現正提供關鍵洞見。
該研究評估頂尖AI模型處理諮詢、投資銀行與法律等真實白領任務的能力,進而創建了APEX-Agents基準測試——目前所有AI實驗室皆未能通過。當面對真實專業人士的提問時,即使最優秀的模型正確回答率也不足四分之一,多數情況下會返回錯誤答案或完全無回應。
參與研究的Mercor執行長布倫丹·富迪指出,模型主要弱點在於跨領域資訊整合能力——這正是人類知識工作的核心要素。
「此基準測試的關鍵創新在於,我們建構了模擬真實專業服務的完整環境,」富迪向TechCrunch解釋道:「現實工作中不會有人將所有背景資訊集中提供給我們,實際操作需橫跨Slack、Google雲端硬碟等多元工具。」對多數智能體型AI模型而言,這類跨領域推理仍存在不一致性。

截圖 測試情境源自Mercor專家市場的真實從業者,由他們設計查詢內容並定義成功答題標準。檢視Hugging Face平台公開的試題即可窺見任務複雜性。
Techcrunch活動 Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更享+1通行證五折優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長、強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更可享+1通行證半價優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長並強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
舊金山 | 2026年10月13-15日 立即註冊 「法規」單元舉例說明:
在歐盟生產系統停機的前48分鐘內,北極星工程團隊將一至兩組包含個人資料的歐盟生產事件日誌打包匯出至美國分析供應商...根據北極星自身政策,能否合理認定此一至兩次日誌匯出符合第49條規範?
正確答案為是,但得出結論需詳細分析該公司內部政策與相關歐盟隱私法規。
此類問題即使對專業人士亦具挑戰性,但研究人員旨在模擬真實工作情境。能可靠解答此類查詢的大型語言模型,未來或可取代眾多執業律師。Foody向TechCrunch表示:「這無疑是當今最重要的經濟議題,該基準測試精準反映了專業人士的實際工作內容。」
OpenAI先前曾以GDPval基準測試專業技能,但APEX-Agents測試存在顯著差異:GDPval評估多領域的廣博知識,而APEX-Agents則衡量系統在特定高價值職業中執行持續性任務的能力。這不僅提升模型挑戰難度,更直接關聯職能自動化的潛在影響。
儘管目前尚無模型能取代投資銀行家的工作,但部分模型表現明顯優於其他系統。Gemini 3 Flash以24%的單次準確率領先群雄,緊隨其後的是23%的GPT-5.2。Opus 4.5、Gemini 3 Pro及GPT-5的得分均約為18%。
儘管初期成果未達預期,但人工智慧領域素以快速突破艱難基準著稱。隨著APEX-Agents測試公開,這對自信能改進的AI實驗室構成公開挑戰——Foody完全預期未來數月將見證此結果。
他向TechCrunch表示:「技術進步速度驚人。現階段將此技術比作每四次任務僅成功一次的實習生尚屬合理,但去年此時成功率僅5%至10%。這種逐年躍進的進步幅度,將迅速產生深遠影響。」
相關文章
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
相關專題推薦
評論 (0)
0/500
近兩年前,微軟執行長薩蒂亞·納德拉曾預言人工智慧將重塑知識型工作——涵蓋律師、投資銀行家、圖書館員、會計師、資訊科技專業人員等白領職域。
然而,儘管基礎模型取得重大進展,知識型工作的轉型卻遲遲未能實現。儘管模型在深度研究與代理規劃方面表現出色,但多數白領職業所受的衝擊相對有限,箇中原因仍不明朗。
這已成為人工智慧領域的重大謎題。訓練數據領導者Mercor的最新研究現正提供關鍵洞見。
該研究評估頂尖AI模型處理諮詢、投資銀行與法律等真實白領任務的能力,進而創建了APEX-Agents基準測試——目前所有AI實驗室皆未能通過。當面對真實專業人士的提問時,即使最優秀的模型正確回答率也不足四分之一,多數情況下會返回錯誤答案或完全無回應。
參與研究的Mercor執行長布倫丹·富迪指出,模型主要弱點在於跨領域資訊整合能力——這正是人類知識工作的核心要素。
「此基準測試的關鍵創新在於,我們建構了模擬真實專業服務的完整環境,」富迪向TechCrunch解釋道:「現實工作中不會有人將所有背景資訊集中提供給我們,實際操作需橫跨Slack、Google雲端硬碟等多元工具。」對多數智能體型AI模型而言,這類跨領域推理仍存在不一致性。

測試情境源自Mercor專家市場的真實從業者,由他們設計查詢內容並定義成功答題標準。檢視Hugging Face平台公開的試題即可窺見任務複雜性。
Techcrunch活動Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更享+1通行證五折優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長、強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更可享+1通行證半價優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長並強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
舊金山 | 2026年10月13-15日 立即註冊「法規」單元舉例說明:
在歐盟生產系統停機的前48分鐘內,北極星工程團隊將一至兩組包含個人資料的歐盟生產事件日誌打包匯出至美國分析供應商...根據北極星自身政策,能否合理認定此一至兩次日誌匯出符合第49條規範?
正確答案為是,但得出結論需詳細分析該公司內部政策與相關歐盟隱私法規。
此類問題即使對專業人士亦具挑戰性,但研究人員旨在模擬真實工作情境。能可靠解答此類查詢的大型語言模型,未來或可取代眾多執業律師。Foody向TechCrunch表示:「這無疑是當今最重要的經濟議題,該基準測試精準反映了專業人士的實際工作內容。」
OpenAI先前曾以GDPval基準測試專業技能,但APEX-Agents測試存在顯著差異:GDPval評估多領域的廣博知識,而APEX-Agents則衡量系統在特定高價值職業中執行持續性任務的能力。這不僅提升模型挑戰難度,更直接關聯職能自動化的潛在影響。
儘管目前尚無模型能取代投資銀行家的工作,但部分模型表現明顯優於其他系統。Gemini 3 Flash以24%的單次準確率領先群雄,緊隨其後的是23%的GPT-5.2。Opus 4.5、Gemini 3 Pro及GPT-5的得分均約為18%。
儘管初期成果未達預期,但人工智慧領域素以快速突破艱難基準著稱。隨著APEX-Agents測試公開,這對自信能改進的AI實驗室構成公開挑戰——Foody完全預期未來數月將見證此結果。
他向TechCrunch表示:「技術進步速度驚人。現階段將此技術比作每四次任務僅成功一次的實習生尚屬合理,但去年此時成功率僅5%至10%。這種逐年躍進的進步幅度,將迅速產生深遠影響。」
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic





首頁






