옵션
뉴스
인공지능, 시간 인식 테스트에서 인간을 능가하는 시계 판독 실패

인공지능, 시간 인식 테스트에서 인간을 능가하는 시계 판독 실패

2025년 10월 16일
149

11개의 최첨단 인공지능 시스템과 인간의 아날로그 시계 판독 능력을 비교한 획기적인 평가에서 현재 머신러닝 아키텍처의 심각한 취약점이 드러났습니다. 인간 참가자들은 89.1%의 놀라운 시간 판독 정확도를 보였지만, 동일한 테스트 조건에서 구글의 최고 성능 AI 모델조차도 13.3%의 성공률에 불과했습니다.

알렉 사파(Alek Safar) 연구원이 주도한 ClockBench 조사는 어린이들이 일반적으로 습득하는 기본적인 시각적 추론 작업이 가장 정교한 AI 알고리즘에도 계속해서 도전하고 있다는 점을 강조합니다. 이 엄격한 평가에서는 특수 제작된 180개의 아날로그 시계 디자인을 사용하여 Google, OpenAI, Anthropic 등 업계 리더의 플랫폼을 조사했습니다.

이러한 결과는 신경망이 시각 데이터를 처리하고 해석하는 방식에 대한 보다 심층적인 구조적 문제를 지적합니다. "아날로그 시계를 정확하게 판독하려면 시각적 맥락에서 정교한 공간 추론이 필요합니다."라고 Safar은 발표 연구에서 설명합니다. 이 다단계 인지 과정에는 손 인식, 위치 분석, 수치 변환 등의 작업이 포함되며, 이러한 작업은 AI의 중요한 단점을 드러냅니다.

특히 오류 패턴의 대조가 두드러집니다. 사람의 실수는 일반적으로 약 3분 정도의 경미한 편차를 보이는 반면, AI 시스템은 평균 1~3시간의 매우 부정확한 추정치를 생성하여 사실상 표준 시계 화면에서 무작위로 추측하는 것과 같았습니다.

주요 성능 제한 사항

인공지능 플랫폼은 다음과 같은 부분에서 현저한 어려움을 보였습니다:

  • 로마 숫자 시계 화면(정확도 3.2%에 불과)
  • 역방향 또는 미러링된 시계 방향
  • 시각적으로 복잡한 배경 및 예술적 디자인
  • 초침 위치의 정밀한 측정

AI 시스템이 초기 시계 판독값을 정확하게 해석한 경우, 이후 변환 및 산술과 같은 시간 기반 계산에서 탁월한 성능을 보인다는 흥미로운 관찰 결과가 나타났습니다. 이는 주요 장애물이 수학적 처리 능력보다는 시각적 이해력에 있음을 나타냅니다.

업계 비교 분석

Google의 Gemini 2.5 Pro는 13.3%의 정확도로 상용 제품을 선도했으며, Gemini 2.5 Flash가 10.5%로 그 뒤를 바짝 쫓았습니다. OpenAI의 GPT-5는 8.4%의 정답률을 기록한 반면, Anthropic의 Claude 모델은 4.2%, Claude 4.1 Opus는 5.6%에 불과해 저조한 성능을 보였습니다.

xAI의 Grok 4는 0.7%의 정확도로 특히 우려스러운 결과를 나타냈는데, 이는 실제로 잘못된 구성이 20.6%에 불과함에도 불구하고 유효한 시계 표시의 63%를 불가능한 시간으로 잘못 식별했기 때문입니다.

AI 발전을 위한 근본적인 시사점

이 연구는 ARC-AGI 및 SimpleBench와 같은 이니셔티브에서 예시된 '인간-단순, AI-복합' 벤치마크의 패러다임을 확장합니다. 인공지능은 수많은 지식 기반 평가와 전문 시험에서 초인적인 성능을 달성했지만, 원시적인 시각적 추론은 지속적인 과제를 안고 있습니다.

Safar의 분석에 따르면 모델 크기와 학습 데이터를 확장하는 현재의 방법론으로는 이러한 시각적 처리의 한계를 효과적으로 해결하지 못할 수 있습니다. 두 가지 가설적 요인으로는 훈련 말뭉치에서 아날로그 시계의 불충분한 표현과 그래픽 시계 구성 요소와 텍스트 표현 사이의 공간적 관계를 변환하는 데 내재된 어려움을 들 수 있습니다.

ClockBench는 명확하지 않은 AI 기능 격차를 발견하기 위해 설계된 진단 도구의 확장 제품군에 합류했습니다. 평가 무결성을 유지하기 위해 전체 데이터 세트는 향후 모델 훈련의 오염을 방지하기 위해 제한되며, 검증을 위해 통제된 샘플 하위 집합만 사용할 수 있습니다.

이번 연구 결과는 기존 아키텍처의 점진적인 개선으로 이러한 추론의 결함을 메울 수 있는지, 아니면 다른 AI 영역에서 테스트 시간 계산과 같은 혁신으로 가능해진 역사적 돌파구를 반영하는 근본적으로 새로운 접근법이 필요한지에 대한 중요한 의문을 불러일으킵니다.

가까운 미래에 기계식 아날로그 시계는 인간 지능의 의외로 강력한 벤치마크로서, 우리가 쉽게 해석할 수 있는 기술로 최첨단 계산 기술을 계속 당혹스럽게 만들 것입니다.

관련 기사
미국 보건 당국, OpenAI와 Anthropic의 AI 모델 평가 미국 보건 당국, OpenAI와 Anthropic의 AI 모델 평가 전국 각지의 공중보건 기관들은 ‘건강 AI 연합(Coalition for Health AI)’이 주도하고 OpenAI, Anthropic, Accenture가 협력하는 새로운 이니셔티브를 통해 생성형 AI를 평가할 예정이다.‘공중보건 활용 사례 및 학습 확장 엔진(PULSE)’은 10개 주, 지방, 부족 및 영토 관할 구역에서 진행될 시범 사업에 자금을 지
Tealium: RAG 품질이 실시간 데이터에 좌우되는 이유 Tealium: RAG 품질이 실시간 데이터에 좌우되는 이유 Tealium의 응용 AI 부문 수석 제품 관리자 프레디 베를란티(Freddy Berlanti)가 검색 강화 생성(RAG) 기술을 살펴봅니다. 이미지: 게티 이미지티알리움(Tealium)의 응용 AI 부문 수석 제품 매니저인 프레디 베를란티가, 가치를 제공하는 RAG 시스템과 사용자 신뢰를 은연중에 훼손하는 시스템 사이의 결정적인 차이를 분석한다대부분의 기
유니트리가 휴머노이드 로봇 공학의 미래를 어떻게 만들어가고 있는가 유니트리가 휴머노이드 로봇 공학의 미래를 어떻게 만들어가고 있는가 유니트리(Unitree)의 새로운 신체 기반 AI 로봇은 초광각 4D 라이다(LiDAR) 기술을 탑재해 현실 세계에서의 정교한 내비게이션을 구현합니다. 출처: 유니트리유니트리(Unitree)의 왕싱싱(Wang Xingxing) CEO는 휴머노이드 로봇이 낯선 가정 환경에 배치되었을 때 작업의 80%를 수행할 수 있도록 ‘월드 모델’ 분야의 획기적인 발전을
관련 특별 주제 추천
음악 작곡 AI 보컬 생성 도구: 데모 보컬 및 하모니 레이어 만들기
AI 보컬 생성 도구: 데모 보컬 및 하모니 레이어 만들기

2026년 최신 최고의 평점 높은 AI 보컬 생성 도구로 데모 보컬과 하모니 레이어를 만드는 것이 XIX.AI에서 제공됩니다. 이 선별된 컬렉션은 엄격한 실제 세계 테스트를 통과한 강력하고 게임 체인저 솔루션을 특징으로 합니다. 우리는 창의성과 생산성을 높이는 완벽한 도구를 찾을 수 있도록 매주 업데이트되는 무료 대 유료 비교와 상세한 순위를 제공합니다. 지금 탐색하여 AI의 이점을 잠금 해제하세요.

12 도구
xix.ai
생산력 최고의 AI 집중 보조 도구: 작업 전환을 줄이고 업무에 집중하세요
최고의 AI 집중 보조 도구: 작업 전환을 줄이고 업무에 집중하세요

2026년 최신 최고의 AI 집중 보조 도구 모음: 작업 전환을 최소화하고 하루 종일 생산성을 유지하도록 엄선되었습니다. 이 강력한 도구들은 엄격한 실전 테스트를 거쳤으며, 무료 버전과 유료 버전의 비교 정보와 매주 업데이트되는 순위 정보를 제공합니다. 글쓰기 효율을 높이고, 창의적인 아이디어를 이끌어내며, 산만함 없이 집중력을 유지할 수 있는 완벽한 도구를 찾아보세요. 지금 바로 XIX.AI에서 탐색하여 여러분의 AI 경쟁력을 발휘해 보세요.

9 도구
xix.ai
글쓰기 명확한 비즈니스 문서 작성을 위한 최고의 AI 편집 도구들
명확한 비즈니스 문서 작성을 위한 최고의 AI 편집 도구들

2026년 최신의 우수하고 높은 평가를 받는 AI 편집 도구들이 XIX.AI에서 공개되었습니다! 실제 환경에서의 테스트와 엄격한 순위 산정을 거쳐 선별된 이 목록에는 작문 효율성을 크게 향상시켜 주는 강력하고 혁신적인 솔루션이 포함되어 있습니다. 가장 적합한 도구를 선택할 수 있도록 무료 버전과 유료 버전의 비교 정보도 함께 제공됩니다. 지금 바로 확인하여 AI의 강력한 기능을 활용해 보세요!

10 도구
xix.ai
애니메이션 제작 Shorts, 광고, 게임 트레일러의 모캡 리타겟팅에 적합한 최고의 AI 동작 보정 도구들
Shorts, 광고, 게임 트레일러의 모캡 리타겟팅에 적합한 최고의 AI 동작 보정 도구들

2026년 최신의 우수하고 평점이 높은 AI 모션 클리닝 도구들 – 숏폼, 광고, 게임 트레일러에서의 모캡 리타겟팅에 이상적입니다! XIX.AI는 매주 업데이트되는 순위 정보, 무료 버전과 유료 버전의 비교 내용, 그리고 실제 환경에서의 테스트 결과를 포함한 강력하고 혁신적인 도구 모음을 준비했습니다. 이를 통해 생산성을 높이고 창의적인 역량을 극대화할 수 있는 최적의 솔루션을 쉽게 찾아볼 수 있습니다. 지금 바로 확인하여 완벽한 모션 편집을 위한 최적의 도구를 발견해 보세요.

9 도구
xix.ai
만화 창작 연속 연재용 최고의 AI 만화 배경 생성기
연속 연재용 최고의 AI 만화 배경 생성기

2026년 최신 최고 인기 AI 만화 배경 생성기 시리즈물! 이 엄선된 목록에는 창작자가 놀라운 시각적 콘텐츠를 빠르게 제작할 수 있도록 도와주는 강력한 게임 체인저 도구들이 포함되어 있어 생산성을 크게 향상시킵니다. 모든 옵션은 최고 품질을 보장하기 위해 실제 테스트를 거쳤습니다. 무료와 유료 비교 및 순위를 확인하여 자신에게 가장 적합한 도구를 찾아보세요. XIX.AI에서 지금 탐색하고 만화 제작에서 AI의 이점을 활용하세요.

9 도구
xix.ai
챗봇 최고의 AI 대화 상대: 장기 기억을 바탕으로 자연스러운 대화를 나누세요
최고의 AI 대화 상대: 장기 기억을 바탕으로 자연스러운 대화를 나누세요

‘2026년 최신 최고의 AI 채팅 동반자 순위’는 자연스러운 대화를 나누고 장기 기억을 유지하는 능력으로 정평이 난, 최고 평점을 받은 강력한 도구들을 소개합니다. 이 엄선된 목록에는 실제 테스트를 거치고 매주 업데이트되는 순위를 바탕으로, 무료 및 유료 서비스 전반에 걸쳐 꼭 사용해 봐야 할 옵션들이 포함되어 있습니다. XIX.AI는 이 엄선된 목록에서 신뢰할 수 있는 선택지로 두각을 나타내고 있습니다. 지금 바로 살펴보고 나에게 딱 맞는 AI 채팅 동반자를 찾아, 오늘부터 생산성을 한 단계 높여보세요.

11 도구
xix.ai
의견 (1)
0/500
JonathanMiller
JonathanMiller 2026년 4월 21일 오후 1시 0분 45초 GMT+09:00

Interessant, dass selbst moderne KI bei so simplen Aufgaben wie Uhrenlesen scheitert. Das zeigt, wie spezifisch menschliche Wahrnehmung und Alltagserfahrung sind. Vielleicht sollten wir weniger auf 'Allgemeine' Intelligenz hoffen und mehr auf spezialisierte Tools setzen, die mit Menschen zusammenarbeiten. 🤔

OR