새로운 AGI 테스트는 도전적인 것으로 판명되고 대다수의 AI 모델
Arc Prize 재단은 유명한 AI 연구자 프랑수아 숄레(François Chollet)가 공동 설립한 기관으로, 최근 블로그 포스트에서 ARC-AGI-2라는 새로운 벤치마크를 공개했습니다. 이 테스트는 AI의 일반 지능의 한계를 확장하는 것을 목표로 하며, 현재까지 대부분의 AI 모델들에게는 풀기 어려운 과제로 입증되고 있습니다.
Arc Prize 리더보드에 따르면, OpenAI의 o1-pro와 DeepSeek의 R1과 같은 고급 "추론" AI 모델들조차 1%에서 1.3% 사이의 점수만을 기록하고 있습니다. 한편, GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash와 같은 강력한 비추론 모델들은 약 1% 정도의 점수를 유지하고 있습니다.
ARC-AGI 테스트는 AI 시스템이 다양한 색상의 사각형 격자에서 시각적 패턴을 식별하고 올바른 "답변" 격자를 생성하도록 요구하는 퍼즐과 같은 문제를 통해 도전합니다. 이러한 문제들은 AI가 새로운, 이전에 보지 못한 도전에 적응하는 능력을 테스트하도록 설계되었습니다.
인간의 기준선을 설정하기 위해 Arc Prize 재단은 400명 이상의 사람들에게 ARC-AGI-2 테스트를 치르게 했습니다. 평균적으로 이 "패널"들은 60%의 성공률을 달성하여 AI 모델들을 크게 앞질렀습니다.

ARC-AGI-2의 샘플 질문. 이미지 출처: Arc Prize 프랑수아 숄레(François Chollet)는 X에서 ARC-AGI-2가 이전 버전인 ARC-AGI-1에 비해 AI 모델의 진정한 지능을 더 정확히 측정한다고 주장했습니다. Arc Prize 재단의 테스트는 AI가 훈련 데이터 너머의 새로운 기술을 효율적으로 학습할 수 있는지를 평가하도록 설계되었습니다.숄레는 ARC-AGI-2가 AI 모델이 "무차별 대입" 컴퓨팅 파워에 의존하여 문제를 해결하는 것을 방지한다고 강조했으며, 이는 첫 번째 테스트에서 인정한 결함이었습니다. 이를 해결하기 위해 ARC-AGI-2는 효율성 지표를 도입하고 모델이 기억에 의존하기보다는 즉석에서 패턴을 해석하도록 요구합니다.
블로그 포스트에서 Arc Prize 재단의 공동 설립자 그렉 캠라트(Greg Kamradt)는 지능이 단순히 문제를 해결하거나 높은 점수를 얻는 것만이 아니라고 강조했습니다. 그는 "그 능력이 획득되고 배포되는 효율성이 중요한 정의적 구성 요소"라고 썼습니다. "핵심 질문은 단순히 'AI가 작업을 해결하기 위한 기술을 획득할 수 있는가?'가 아니라, '어떤 효율성이나 비용으로?'입니다."
ARC-AGI-1은 약 5년 동안 무패로 남아 있었으나, 2024년 12월 OpenAI의 고급 추론 모델인 o3가 다른 모든 AI 모델을 능가하고 인간의 성능을 따라잡았습니다. 그러나 o3의 ARC-AGI-1에서의 성공은 상당한 비용을 초래했습니다. ARC-AGI-1에서 75.7%라는 인상적인 점수를 기록한 OpenAI의 o3 모델, o3 (low)는 ARC-AGI-2에서는 태스크당 200달러의 컴퓨팅 파워를 사용하며 겨우 4%를 기록했습니다.

ARC-AGI-1과 ARC-AGI-2에서 프론티어 AI 모델 성능 비교. 이미지 출처: Arc Prize ARC-AGI-2의 도입은 기술 산업에서 많은 이들이 AI 발전을 측정하기 위해 새로운, 포화되지 않은 벤치마크를 요구하는 시점에 이루어졌습니다. Hugging Face의 공동 설립자 토마스 울프(Thomas Wolf)는 최근 TechCrunch에 AI 산업이 인공지능 일반의 핵심 특성, 예를 들어 창의성을 측정할 충분한 테스트가 부족하다고 말했습니다.새로운 벤치마크와 함께 Arc Prize 재단은 Arc Prize 2025 대회를 발표했으며, 개발자들에게 ARC-AGI-2 테스트에서 85% 정확도를 달성하면서 태스크당 0.42달러만을 사용하도록 도전했습니다.
관련 기사
RSI는 새로운 AGI가 되었으며, 정의하기 마찬가지로 애매모호하다
“재귀(recursion)”라는 용어는 인공지능 분야에서 최신 유행어로 자리 잡았다. 두 개의 서로 다른 스타트업이 이를 회사명으로 채택했으며, 수많은 다른 기업들도 이제 개발 계획에서 ‘재귀적 자기 개선(Recursive Self-Improvement, RSI)’을 언급하고 있다. 이전의 AGI와 마찬가지로, RSI는 정확한 정의에 대해 여전히 논란이 있
오픈AI, 공공 부유 기금, 로봇세, 주 4일 근무제를 통해 AI 경제 구상 제시
각국 정부가 초지능 기계가 초래할 경제적 영향을 관리하기 위해 고심하는 가운데, 오픈AI는 ‘지능 시대’에 부와 일자리가 어떻게 재편될 수 있을지 제시하는 일련의 정책 제안을 발표했다. 이 제안들은 공공 부유 기금이나 사회 안전망 확충과 같은 전통적인 진보적 방안들을 근본적으로 자본주의적이고 시장 주도적인 경제 체계와 결합하고 있다.오픈AI의 제안은 본질적
데이터브릭스 공동 창업자, ACM 상 수상 후 AGI 도래 주장
Databricks의 공동 창립자이자 CTO인 마테이 자하리아는 자신이 2026년 ACM 컴퓨팅 상을 수상했다는 소식을 알리는 이메일을 거의 놓칠 뻔했다. 그는 테크크런치와의 인터뷰에서 “정말 뜻밖이었다”고 말했다.2009년, 자하리아가 UC 버클리에서 저명한 이온 스토이카(Ion Stoica) 교수의 지도 아래 박사 과정 중 개발한 기술이 데이터브릭스에
관련 특별 주제 추천
의견 (40)
0/500
Finally a benchmark that shows how far AI still has to go! The ARC-AGI-2 is no joke, and it's humbling to see even the best models fail. 😮
이 새로운 벤치마크, 진짜 어렵네요. 🤯 요새 AI가 다들 잘하는 줄 알았는데 ARC-AGI-2에서 고전 중이라는 소식에 좀 놀랐어요. François Chollet가 만든거라니... 어쩌면 지능의 본질에 더 가까운 테스트일지도? 정말 일반 지능을 측정할 수 있을까 궁금해집니다. 논문 나오면 좀 더 알아봐야겠어요.
¿Un test que la mayoría de las IA no superan? Esto demuestra lo lejos que estamos de la AGI real. Me pregunto si estos benchmarks realmente miden la 'inteligencia' o solo la capacidad de resolver puzzles específicos. 🧩 Parece más un juego para investigadores que un avance práctico.
Новый тест ARC-AGI-2 выглядит как серьёзный вызов для ИИ! 😅 Интересно, насколько близко мы подошли к настоящему общему интеллекту, если даже продвинутые модели справляются с трудом. Может, ключ в комбинации логики и творческого подхода?
This ARC-AGI-2 test sounds brutal! Most AI models are getting crushed, which makes me wonder if we’re hyping AI too much. 🤔 Cool to see Chollet shaking things up though!
Este test ARC-AGI-2 es realmente difícil. Lo probé con varios modelos de IA y todos se quedaron atascados. Es genial ver cómo desafía los límites, pero es frustrante cuando ni siquiera los modelos top pueden resolverlo. Quizás sea hora de un nuevo enfoque en el desarrollo de IA. ¡Sigan empujando los límites, pero no olviden celebrar las pequeñas victorias también!
Arc Prize 재단은 유명한 AI 연구자 프랑수아 숄레(François Chollet)가 공동 설립한 기관으로, 최근 블로그 포스트에서 ARC-AGI-2라는 새로운 벤치마크를 공개했습니다. 이 테스트는 AI의 일반 지능의 한계를 확장하는 것을 목표로 하며, 현재까지 대부분의 AI 모델들에게는 풀기 어려운 과제로 입증되고 있습니다.
Arc Prize 리더보드에 따르면, OpenAI의 o1-pro와 DeepSeek의 R1과 같은 고급 "추론" AI 모델들조차 1%에서 1.3% 사이의 점수만을 기록하고 있습니다. 한편, GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash와 같은 강력한 비추론 모델들은 약 1% 정도의 점수를 유지하고 있습니다.
ARC-AGI 테스트는 AI 시스템이 다양한 색상의 사각형 격자에서 시각적 패턴을 식별하고 올바른 "답변" 격자를 생성하도록 요구하는 퍼즐과 같은 문제를 통해 도전합니다. 이러한 문제들은 AI가 새로운, 이전에 보지 못한 도전에 적응하는 능력을 테스트하도록 설계되었습니다.
인간의 기준선을 설정하기 위해 Arc Prize 재단은 400명 이상의 사람들에게 ARC-AGI-2 테스트를 치르게 했습니다. 평균적으로 이 "패널"들은 60%의 성공률을 달성하여 AI 모델들을 크게 앞질렀습니다.

숄레는 ARC-AGI-2가 AI 모델이 "무차별 대입" 컴퓨팅 파워에 의존하여 문제를 해결하는 것을 방지한다고 강조했으며, 이는 첫 번째 테스트에서 인정한 결함이었습니다. 이를 해결하기 위해 ARC-AGI-2는 효율성 지표를 도입하고 모델이 기억에 의존하기보다는 즉석에서 패턴을 해석하도록 요구합니다.
블로그 포스트에서 Arc Prize 재단의 공동 설립자 그렉 캠라트(Greg Kamradt)는 지능이 단순히 문제를 해결하거나 높은 점수를 얻는 것만이 아니라고 강조했습니다. 그는 "그 능력이 획득되고 배포되는 효율성이 중요한 정의적 구성 요소"라고 썼습니다. "핵심 질문은 단순히 'AI가 작업을 해결하기 위한 기술을 획득할 수 있는가?'가 아니라, '어떤 효율성이나 비용으로?'입니다."
ARC-AGI-1은 약 5년 동안 무패로 남아 있었으나, 2024년 12월 OpenAI의 고급 추론 모델인 o3가 다른 모든 AI 모델을 능가하고 인간의 성능을 따라잡았습니다. 그러나 o3의 ARC-AGI-1에서의 성공은 상당한 비용을 초래했습니다. ARC-AGI-1에서 75.7%라는 인상적인 점수를 기록한 OpenAI의 o3 모델, o3 (low)는 ARC-AGI-2에서는 태스크당 200달러의 컴퓨팅 파워를 사용하며 겨우 4%를 기록했습니다.

새로운 벤치마크와 함께 Arc Prize 재단은 Arc Prize 2025 대회를 발표했으며, 개발자들에게 ARC-AGI-2 테스트에서 85% 정확도를 달성하면서 태스크당 0.42달러만을 사용하도록 도전했습니다.
RSI는 새로운 AGI가 되었으며, 정의하기 마찬가지로 애매모호하다
“재귀(recursion)”라는 용어는 인공지능 분야에서 최신 유행어로 자리 잡았다. 두 개의 서로 다른 스타트업이 이를 회사명으로 채택했으며, 수많은 다른 기업들도 이제 개발 계획에서 ‘재귀적 자기 개선(Recursive Self-Improvement, RSI)’을 언급하고 있다. 이전의 AGI와 마찬가지로, RSI는 정확한 정의에 대해 여전히 논란이 있
오픈AI, 공공 부유 기금, 로봇세, 주 4일 근무제를 통해 AI 경제 구상 제시
각국 정부가 초지능 기계가 초래할 경제적 영향을 관리하기 위해 고심하는 가운데, 오픈AI는 ‘지능 시대’에 부와 일자리가 어떻게 재편될 수 있을지 제시하는 일련의 정책 제안을 발표했다. 이 제안들은 공공 부유 기금이나 사회 안전망 확충과 같은 전통적인 진보적 방안들을 근본적으로 자본주의적이고 시장 주도적인 경제 체계와 결합하고 있다.오픈AI의 제안은 본질적
데이터브릭스 공동 창업자, ACM 상 수상 후 AGI 도래 주장
Databricks의 공동 창립자이자 CTO인 마테이 자하리아는 자신이 2026년 ACM 컴퓨팅 상을 수상했다는 소식을 알리는 이메일을 거의 놓칠 뻔했다. 그는 테크크런치와의 인터뷰에서 “정말 뜻밖이었다”고 말했다.2009년, 자하리아가 UC 버클리에서 저명한 이온 스토이카(Ion Stoica) 교수의 지도 아래 박사 과정 중 개발한 기술이 데이터브릭스에
Finally a benchmark that shows how far AI still has to go! The ARC-AGI-2 is no joke, and it's humbling to see even the best models fail. 😮
이 새로운 벤치마크, 진짜 어렵네요. 🤯 요새 AI가 다들 잘하는 줄 알았는데 ARC-AGI-2에서 고전 중이라는 소식에 좀 놀랐어요. François Chollet가 만든거라니... 어쩌면 지능의 본질에 더 가까운 테스트일지도? 정말 일반 지능을 측정할 수 있을까 궁금해집니다. 논문 나오면 좀 더 알아봐야겠어요.
¿Un test que la mayoría de las IA no superan? Esto demuestra lo lejos que estamos de la AGI real. Me pregunto si estos benchmarks realmente miden la 'inteligencia' o solo la capacidad de resolver puzzles específicos. 🧩 Parece más un juego para investigadores que un avance práctico.
Новый тест ARC-AGI-2 выглядит как серьёзный вызов для ИИ! 😅 Интересно, насколько близко мы подошли к настоящему общему интеллекту, если даже продвинутые модели справляются с трудом. Может, ключ в комбинации логики и творческого подхода?
This ARC-AGI-2 test sounds brutal! Most AI models are getting crushed, which makes me wonder if we’re hyping AI too much. 🤔 Cool to see Chollet shaking things up though!
Este test ARC-AGI-2 es realmente difícil. Lo probé con varios modelos de IA y todos se quedaron atascados. Es genial ver cómo desafía los límites, pero es frustrante cuando ni siquiera los modelos top pueden resolverlo. Quizás sea hora de un nuevo enfoque en el desarrollo de IA. ¡Sigan empujando los límites, pero no olviden celebrar las pequeñas victorias también!





집






