選項
首頁
新聞
新的AGI測試證明了具有挑戰性,大多數AI模型

新的AGI測試證明了具有挑戰性,大多數AI模型

2025-04-10
227

Arc獎金基金會,由知名AI研究員François Chollet共同創辦,最近在一篇博客文章中公布了一個名為ARC-AGI-2的新基準測試。此測試旨在推動AI通用智能的界限,迄今為止,對大多數AI模型來說,這是一個難以破解的挑戰。

根據Arc獎金排行榜,即使是像OpenAI的o1-pro和DeepSeek的R1這樣的高級「推理」AI模型,也僅能獲得1%至1.3%的分數。與此同時,強大的非推理模型,如GPT-4.5、Claude 3.7 Sonnet和Gemini 2.0 Flash,也僅在1%左右徘徊。

ARC-AGI測試以類似謎題的問題挑戰AI系統,要求它們在不同顏色的方格網中識別視覺模式,並生成正確的「答案」網格。這些問題旨在測試AI適應全新、未見過的挑戰的能力。

為了建立人類基準,Arc獎金基金會讓超過400人參加了ARC-AGI-2測試。平均而言,這些「測試小組」的人類達到了60%的成功率,顯著超越了AI模型。

來自ARC-AGI-2的樣本問題。圖片來源:Arc Prize
François Chollet在X上表示,與前一代ARC-AGI-1相比,ARC-AGI-2是衡量AI模型真實智能的更精確指標。Arc獎金基金會的測試旨在評估AI是否能高效學習超出其訓練數據的新技能。

Chollet強調,ARC-AGI-2防止AI模型依賴「暴力計算」來解決問題,這是他承認的第一個測試中的缺陷。為了解決這一問題,ARC-AGI-2引入了效率指標,並要求模型即時解讀模式,而不是依賴記憶。

在博客文章中,Arc獎金基金會共同創辦人Greg Kamradt強調,智能不僅僅是解決問題或獲得高分。他寫道:「這些能力的獲取和部署效率是一個關鍵的定義性組成部分。」「核心問題不僅是『AI能否獲得解決任務的技能?』,還有『以何種效率或成本?』」

ARC-AGI-1在約五年內未被打破,直到2024年12月,OpenAI的高級推理模型o3超越了所有其他AI模型,並達到了人類的表現。然而,o3在ARC-AGI-1上的成功付出了顯著的代價。OpenAI的o3模型版本o3 (low),在ARC-AGI-1上獲得了令人印象深刻的75.7%分數,但在ARC-AGI-2上僅獲得4%,每項任務使用了價值200美元的計算能力。

前沿AI模型在ARC-AGI-1和ARC-AGI-2上的性能比較。圖片來源:Arc Prize
ARC-AGI-2的推出正值科技行業許多人呼籲新的、未飽和的基準來衡量AI進展之際。Hugging Face的共同創辦人Thomas Wolf最近對TechCrunch表示,AI行業缺乏足夠的測試來衡量人工通用智能的關鍵特徵,如創造力。

隨著新基準的推出,Arc獎金基金會宣布了2025年Arc獎金競賽,挑戰開發者在ARC-AGI-2測試中實現85%的準確率,同時每項任務僅花費0.42美元。

相關文章
RSI 成為新的 AGI,同樣難以明確定義 RSI 成為新的 AGI,同樣難以明確定義 「遞迴」一詞已成為人工智慧領域的最新熱門詞彙。 已有兩家截然不同的新創公司以此作為公司名稱,而許多其他公司現在也將「遞迴自我提升」(Recursive Self-Improvement, RSI)納入其開發計畫中。就像之前的「通用人工智慧」(AGI)一樣,RSI 已成為代表人工智慧重大突破的三字縮寫——即使其確切定義仍引發一些爭議。從本質上來說,RSI 描述的是一種能夠持續自我升級的人工智慧系統。
OpenAI 勾勒出以公共財富基金、機器人稅及每週四天工作制為核心的人工智慧經濟藍圖 OpenAI 勾勒出以公共財富基金、機器人稅及每週四天工作制為核心的人工智慧經濟藍圖 當各國政府正竭力應對超智能機器帶來的經濟衝擊之際,OpenAI 發布了一系列政策提案,闡述在「智能時代」中財富與工作可能如何重塑。這些構想將傳統的左翼機制——例如公共財富基金與擴大的社會安全網——與根本上資本主義、市場導向的經濟框架相融合。OpenAI 的提案本質上是一份願望清單,這份公開聲明有助於民選官員、投資者及公眾理解這家市值 8,520 億美元的公司,如何看待人工智慧在重塑勞動與經濟的過程
Databricks 共同創辦人榮獲 ACM 獎項後,宣稱通用人工智慧即將問世 Databricks 共同創辦人榮獲 ACM 獎項後,宣稱通用人工智慧即將問世 Databricks 共同創辦人暨技術長 Matei Zaharia 差點錯過那封通知他獲得 2026 年 ACM 計算獎的電子郵件。「這確實是個驚喜,」他向 TechCrunch 透露。2009年,扎哈里亞在加州大學柏克萊分校攻讀博士期間,在著名教授伊昂·斯托伊卡(Ion Stoica)的指導下所開發的技術,被整合進 Databricks。扎哈里亞設計了一種方法,能大幅加速處理那些緩慢且繁瑣的大
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (40)
0/500
KeithLopez
KeithLopez 2026-07-18 00:00:20

Finally a benchmark that shows how far AI still has to go! The ARC-AGI-2 is no joke, and it's humbling to see even the best models fail. 😮

DonaldSanchez
DonaldSanchez 2026-02-15 08:00:34

이 새로운 벤치마크, 진짜 어렵네요. 🤯 요새 AI가 다들 잘하는 줄 알았는데 ARC-AGI-2에서 고전 중이라는 소식에 좀 놀랐어요. François Chollet가 만든거라니... 어쩌면 지능의 본질에 더 가까운 테스트일지도? 정말 일반 지능을 측정할 수 있을까 궁금해집니다. 논문 나오면 좀 더 알아봐야겠어요.

MarkRoberts
MarkRoberts 2026-02-13 18:00:14

¿Un test que la mayoría de las IA no superan? Esto demuestra lo lejos que estamos de la AGI real. Me pregunto si estos benchmarks realmente miden la 'inteligencia' o solo la capacidad de resolver puzzles específicos. 🧩 Parece más un juego para investigadores que un avance práctico.

RonaldRoberts
RonaldRoberts 2025-11-02 08:30:36

Новый тест ARC-AGI-2 выглядит как серьёзный вызов для ИИ! 😅 Интересно, насколько близко мы подошли к настоящему общему интеллекту, если даже продвинутые модели справляются с трудом. Может, ключ в комбинации логики и творческого подхода?

WillieRoberts
WillieRoberts 2025-07-29 20:25:16

This ARC-AGI-2 test sounds brutal! Most AI models are getting crushed, which makes me wonder if we’re hyping AI too much. 🤔 Cool to see Chollet shaking things up though!

GeorgeMiller
GeorgeMiller 2025-04-14 16:35:00

Este test ARC-AGI-2 es realmente difícil. Lo probé con varios modelos de IA y todos se quedaron atascados. Es genial ver cómo desafía los límites, pero es frustrante cuando ni siquiera los modelos top pueden resolverlo. Quizás sea hora de un nuevo enfoque en el desarrollo de IA. ¡Sigan empujando los límites, pero no olviden celebrar las pequeñas victorias también!

OR