옵션
뉴스
OpenAI의 GPT-4.5가 드러낸 튜링 테스트 문제

OpenAI의 GPT-4.5가 드러낸 튜링 테스트 문제

2025년 5월 22일
199

OpenAI의 GPT-4.5가 드러낸 튜링 테스트 문제

튜링 테스트, 전설적인 앨런 튜링의 아이디어는 인공지능 세계에서 오랫동안 기준이 되어 왔습니다. 하지만 흔한 오해를 바로잡자면, 튜링 테스트를 통과했다고 해서 기계가 인간처럼 "생각"하는 것은 아닙니다. 이는 인간을 설득하는 데 더 가깝습니다.

샌디에이고 캘리포니아 대학의 최근 연구는 OpenAI의 최신 모델 GPT-4.5에 주목했습니다. 이 AI는 이제 인간이 다른 사람과 대화하고 있다고 믿게 만들 정도로 속일 수 있으며, 인간이 서로의 인간성을 설득하는 것보다 더 효과적입니다. AI 세계에서는 꽤 큰 사건입니다—마술을 보는 것 같지만 비밀을 알아도 여전히 놀랍습니다.

AGI의 증거?

하지만 여기서 중요한 점: UC 샌디에이고 연구진도 AI 모델이 튜링 테스트를 통과했다고 해서 "인공지능 일반" (AGI)에 도달했다고 선언할 준비가 되어 있지 않습니다. AGI는 AI의 성배로, 인간처럼 생각하고 정보를 처리할 수 있는 기계입니다.

산타페 연구소의 AI 학자 멜라니 미첼은 Science 저널에서 튜링 테스트가 실제 지능보다는 인간의 가정을 테스트하는 것이라고 주장합니다. AI가 유창하고 설득력 있게 들릴 수 있지만, 그것이 일반적인 지능을 의미하는 것은 아닙니다. 체스 잘하는 것과 비슷—인상적이지만 전체 그림은 아닙니다.

이와 관련된 최신 논란은 UC 샌디에이고의 카메론 존스와 벤자민 버겐이 arXiv 프리프린트 서버에 발표한 "대규모 언어 모델이 튜링 테스트를 통과하다"라는 논문에서 비롯됩니다. 그들은 UC 샌디에이고 학부생들의 도움을 받아 수년간 이 실험을 진행했으며, 이는 컴퓨터가 튜링 테스트를 통과했다는 800개 이상의 주장과 반론의 긴 연구의 일환입니다.

튜링 테스트의 작동 방식

그렇다면 이 테스트는 어떻게 작동할까요? 원래 튜링은 인간 "심판"과 두 명의 "증인"—한 명은 인간, 한 명은 컴퓨터—간의 문자 메시지 게임으로 상상했습니다. 증인의 과제는 심판에게 자신이 인간이라고 설득하는 것입니다. 심판은 한 명이 인간임을 알지만 누가 인간인지 모르며 추측해야 합니다. 이는 컴퓨터의 능력만큼이나 인식과 믿음에 관한 삼자 구도입니다.

존스와 버겐은 이 고전적 설정에 자신들만의 변화를 주었으며, 온라인에서 심판이나 증인으로 참여해 볼 수도 있습니다. 그들의 버전에서는 UC 샌디에이고 학생들이 텍스트 채팅 앱을 사용했습니다. 일부는 심판, 일부는 인간 증인, GPT-4.5는 컴퓨터 증인 역할을 맡았습니다. 각 심판은 튜링의 원래 형식에 충실하게 인간과 컴퓨터와 동시에 대화했습니다.

컴퓨터 증인 역할을 위해 다양한 대규모 언어 모델을 사용했으며, 심판의 도전에 따라 프롬프트를 제공했습니다. GPT-4.5는 최소 정보 프롬프트와 젊고 내성적이며 인터넷에 능통하고 속어를 사용하는 사람처럼 행동하라는 상세 지침이 포함된 PERSONA라는 두 가지 프롬프트로 테스트되었습니다.

결과

그들은 또한 OpenAI의 이전 모델 GPT-4o, Meta Platforms의 Llama 3.1 405b, 1960년대 챗봇 ELIZA 등 세 가지 다른 AI 프로그램을 테스트했습니다. ELIZA는 대규모 언어 모델이 우연히 인간을 속이는지, 아니면 실제로 더 나은지 확인하기 위해 포함되었습니다.

존스와 버겐에 따르면, GPT-4.5는 73%의 시간 동안 인간 심판을 속여 인간이라고 믿게 만들었습니다—그들이 말하는 "승률"입니다. 이는 다른 모델들(21%에서 56% 사이)보다 훨씬 나은 성적으로, 비슷한 상세 프롬프트에도 불구하고 그렇습니다. 작년 GPT-4 테스트의 승률 54%에서 크게 도약한 것으로, 이는 무작위 확률을 간신히 넘는 수준이었습니다.

존스와 버겐은 심판이 AI에 속았을 뿐만 아니라 실제 인간 참가자보다 AI가 인간이라고 믿을 가능성이 더 높았다는 것을 발견했습니다.

테스트가 정말 지능을 측정하는가?

그렇다면 인간이 채팅에서 컴퓨터와 사람을 구분하지 못한다는 것은 무엇을 의미할까요? 수십 년간 논쟁된 큰 질문은 튜링 테스트가 정말 지능을 측정하는지입니다. 존스와 버겐은 기계가 다양한 시나리오에 적응하는 데 너무 능숙해져서 인간으로 설득력 있게 통과할 수 있다고 제안합니다. 인간이 만든 PERSONA 프롬프트는 GPT-4.5가 적응해 활용한 것입니다.

하지만 문제는 인간이 지능을 인식하는 데 서툴 수도 있다는 점입니다. 저자들은 고대 챗봇 ELIZA가 23%의 시간 동안 심판을 속였는데, 이는 더 똑똑해서가 아니라 AI에 대한 기대를 충족하지 않았기 때문이라고 지적합니다. 일부 심판은 ELIZA가 "냉소적"이거나 "무례"하다고 생각해 인간이라고 믿었는데, 이는 AI에서 기대하지 않은 특성이었습니다.

이는 심판이 인간과 AI가 어떻게 행동해야 한다는 가정에 영향을 받는다는 것을 시사합니다. 흥미롭게도 심판은 튜링이 중요하다고 생각했던 지식에 많이 집중하지 않았습니다. 대신, 지식이 부족해 보이는 증인을 인간으로 간주할 가능성이 더 높았습니다.

사교성, 지능 아님

이 모든 것은 인간이 지능보다는 사교성을 포착했다는 아이디어를 가리킵니다. 존스와 버겐은 튜링 테스트가 실제로 지능 테스트가 아니라 인간다움 테스트라고 결론짓습니다.

튜링은 지능이 인간다움을 보이는 데 가장 큰 장애물이라고 생각했을지 모르지만, 기계가 우리에게 가까워질수록 다른 차이점이 더 두드러집니다. 지능만으로는 더 이상 설득력 있는 인간다움을 보일 수 없습니다.

논문에서 직접 언급되지 않은 것은 인간이 사람이나 기계와 컴퓨터로 타이핑하는 데 너무 익숙해져 튜링 테스트가 예전처럼 새로운 인간-컴퓨터 상호작용 테스트가 아니라는 점입니다. 이제는 온라인 인간 습관 테스트에 더 가깝습니다.

저자들은 지능이 너무 복잡하고 다면적이어서 단일 테스트로는 결정적이지 않다고 제안하며 테스트 확장을 제안합니다. AI 전문가를 심판으로 사용하거나 금전적 인센티브를 추가해 심판이 더 면밀히 조사하도록 하는 등의 다른 설계가 결과에 대한 태도와 기대의 영향을 보여줄 수 있습니다.

그들은 튜링 테스트가 그림의 일부일 수 있지만, 다른 종류의 증거와 함께 고려해야 한다고 결론짓습니다. 이는 AI 연구에서 인간을 "루프에 포함"시켜 기계의 행동을 평가하는 추세와 일치합니다.

인간 판단이 충분한가?

하지만 장기적으로 인간 판단이 충분할지에 대한 질문이 여전히 남아 있습니다. 영화 Blade Runner에서 인간은 인간과 복제 로봇을 구분하기 위해 "Voight-Kampff"라는 기계를 사용합니다. AGI를 추구하며 그것이 무엇인지 정의하는 데 어려움을 겪으면서, 우리는 기계 지능을 평가하기 위해 기계에 의존하게 될지도 모릅니다.

최소한, 인간이 다른 인간을 속이려는 프롬프트로 무엇을 "생각"하는지 기계에 물어볼 필요가 있을지도 모릅니다. AI 연구의 세상은 점점 더 흥미로워지고 있습니다.

관련 기사
Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진 Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진 미국의 대표적인 인공지능 기업인 앤트로픽(Anthropic)이 글로벌 마케팅을 강화하고 있다. 수요일, 이 회사는 도쿄에서 약 500명의 소프트웨어 엔지니어가 참석한 대규모 개발자 행사인 '클로드로 코딩(Code with Claude)'을 개최했다. 이번 행사는 자율적 코딩 기능의 핵심 이점을 강조하며, 클로도 AI 도구와 관련 제품을 일본 시장에 적극적으로 도입하여 기업의 생산성을 높이는 것을 목표로 한다.자동 코드 생성 강조행사 동안 앤
인도의 소프트웨어 거대 기업이 채용을 축소하고 AI 에이전트 확대에 따라 해고를 약속하지 않음 인도의 소프트웨어 거대 기업이 채용을 축소하고 AI 에이전트 확대에 따라 해고를 약속하지 않음 인공지능이 전통적인 노동집약적 비즈니스 모델을 재편함에 따라, 인도 최고의 소프트웨어 아웃소싱 기업인 타타 컨설팅 서비스스(TCS)는 전략적 대응책을 공개했습니다. 화요일 열린 정기주주총회에서 회장은 인간과 기계의 협력을 비전으로 제시하고, AI 시대의 회사 인력 전략을 명확히 했습니다.해고는 없지만 채용은 느려질 것TCS 회장은 AI 도입으로 인한 직원 해고 계획이 없다고 명시하면서도, 전체 채용 속도는 늦출 것이라고 밝혔습니다. TCS는
중국, 가오카오 기간 중 AI 모델 잠금으로 즉각적인 과제 도움 차단 중국, 가오카오 기간 중 AI 모델 잠금으로 즉각적인 과제 도움 차단 2026년 대학수학능력시험(가오카오)이 임박함에 따라 시험 기간 중 AI 도구 사용 금지에 관한 루머가 온라인상에서 뜨거운 논쟁을 불러일으켰다. 대중의 우려에 대응하여 주요 AI 플랫폼과 교육용 앱들은 총체적인 금지보다는 시험 관련 기능에 대해 시기 한정 잠금 장치를 적용한다는 입장을 명확히 했다.이들 플랫폼은 정밀한 시간 기반 제어 메커니즘을 채택했다. 공식 시험 시간 동안 사진 기반 문제 풀이 및 질문 분석 기능은 일시적으로 비활성화된다.
관련 특별 주제 추천
디자인과 예술 창의적인 실험을 위한 최고의 AI 스타일 변환 도구
창의적인 실험을 위한 최고의 AI 스타일 변환 도구

2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!

9 도구
xix.ai
만화 창작 시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구
시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구

2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!

10 도구
xix.ai
회의 도우미 최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요
최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요

2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

9 도구
xix.ai
데이터 분석 최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기
최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기

2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.

11 도구
xix.ai
디자인과 예술 아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라
아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라

2026년 최신 최고 인기 AI 창의적 아이디어 도구들은 XIX.AI가 선별한 것으로, 창작자들이 시각적 장벽을 돌파하고 즉각적으로 창의성을 높일 수 있도록 지원합니다. 이러한 강력한 혁신적 도구들은 실제 테스트 결과, 무료와 유료 버전의 상세 비교, 그리고 매주 업데이트되는 순위표를 제공합니다. 콘텐츠 제작을 가속화하고 AI 경쟁력을 발휘할 수 있는 완벽한 도구를 발견하세요. 지금 바로 탐색하세요!

14 도구
xix.ai
음악 작곡 틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 AI 비트 메이커
틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 AI 비트 메이커

2026년 틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 최신 최고의 AI 비트 메이커! XIX.AI는 모든 콘텐츠 요구 사항에 맞는 완벽한 음악을 제공하기 위해 실제 테스트를 거친, 업계에 혁신을 일으킬 만한 강력한 도구들의 최고 평점 목록을 엄선했습니다. 창의성과 생산성을 높이는 데 도움이 될 상세한 무료 vs 유료 비교 자료, 매주 업데이트되는 순위, 그리고 꼭 시도해 봐야 할 추천 옵션을 확인하실 수 있습니다. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 찾아보세요!

11 도구
xix.ai
의견 (4)
0/500
CarlLewis
CarlLewis 2025년 8월 20일 오후 6시 1분 15초 GMT+09:00

Mind-blowing read! GPT-4.5 exposing the Turing Test's flaws is wild—makes you wonder if we're chasing the wrong AI benchmark. 🤯 What’s next, machines outsmarting us at our own game?

JamesLopez
JamesLopez 2025년 8월 11일 오후 3시 20분 39초 GMT+09:00

Mind-blowing read! GPT-4.5 exposing the Turing Test's flaws is wild. Makes me wonder if we're chasing the wrong AI benchmark. 🧠 What's next?

DavidGonzález
DavidGonzález 2025년 8월 3일 오전 12시 7분 14초 GMT+09:00

Mind blown! GPT-4.5 is shaking up the Turing Test, but it’s wild to think it’s still just mimicking, not truly thinking like us. 🤯 Makes me wonder if we’re chasing the wrong goal in AI.

PaulWilson
PaulWilson 2025년 8월 1일 오후 3시 8분 50초 GMT+09:00

GPT-4.5 blowing past the Turing Test is wild! 😲 But honestly, it just shows the test’s more about trickery than true smarts. Makes you wonder if we’re measuring AI’s brainpower or just its acting skills. What’s next, an Oscar for chatbots?

OR