워싱턴 주립대 연구, 복잡한 과학적 판단에서 ChatGPT의 중대한 모순을 밝혀내다

워싱턴 주립대학교(WSU)의 최근 연구에 따르면, ChatGPT는 자신감 있게 답변하지만 복잡한 과학적 주장을 다루는 방식은 무작위 추측과 유사하다고 한다. 이 연구는 정확도가 제한적일 뿐만 아니라 동일한 질문에 대해 모순된 답변이 빈번하게 나온다는 점도 지적했다.
메수트 치체크 교수와 연구팀은 2021년 이후 발행된 경영학 학술지에서 719개의 연구 가설을 추출하여, 사실 확인을 위해 이 가설들을 모델에 반복적으로 입력했다.
ChatGPT의 표면적인 정확도는 약 80%로 보이지만, 무작위 추측을 고려하면 실제 성능은 50% 확률의 동전 던지기보다 약 60% 정도 더 나은 수준에 불과하다. 연구진은 이를 “낮은 D등급”으로 평가했다. 이 모델은 특히 거짓 진술을 식별하는 데서 저조한 성과를 보였으며, 거짓 명제 중 단 16.4%만 올바르게 판별했다.
연구진은 각 가설을 모델에 10회씩 입력한 결과, 모델이 일관된 입장을 유지하는 데 어려움을 겪는다는 사실을 발견했습니다:
답변 변동: 약 73%의 사례에서 모델은 10회 반복에 걸쳐 일관된 결론을 유지했습니다.
극단적인 모순: 일부 경우, 모델은 “참”과 “거짓” 답변을 번갈아 내놓았으며, 정확히 동일한 프롬프트를 사용했음에도 절반은 참이고 절반은 거짓인 극단적인 사례도 있었습니다.
이 연구는 사용자들이 AI의 유창하고 설득력 있는 언어에 쉽게 현혹되지만, 이것이 진정한 추론 능력을 의미하는 것은 아니라고 지적한다.
진정한 이해 부재: 이 모델은 세상과 자신이 말하는 내용을 진정으로 이해하는 인간과 달리, 기억과 패턴 매칭에 의존합니다.
제한적인 버전 발전: 테스트 결과, 업데이트된 ChatGPT-5 mini(2025년 테스트)는 이 특정 과제에서 이전 버전과 유사한 성능을 보였으며, 유의미한 개선점은 나타나지 않았다.
이러한 연구 결과를 바탕으로, 치체크(Cicek)는 경영진들이 복잡한 결정을 내릴 때 높은 수준의 회의적 태도를 유지할 것을 권고한다. 그들은 생성형 AI를 전문적인 판단을 대체할 수 있는 ‘권위’로 간주해서는 안 되며, 모든 출력 결과를 수동으로 검증해야 한다. 조직은 직원들이 AI 도구의 장점과 한계를 모두 이해할 수 있도록 교육을 강화하여, 맹목적인 신뢰로 인한 의사결정 편향을 방지해야 한다.
이 연구는 AI가 급속히 발전하고 있음에도 불구하고, 이 기술의 심층적인 논리적 추론 및 증거 평가 능력은 여전히 개선이 필요하다는 점을 다시 한번 상기시켜 줍니다.
관련 기사
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
비디오 및 오디오를 텍스트로 변환하는 최고의 AI 도구목차:서론Weet.io - 비디오를 텍스트로 변환YouTube 자막 및 녹취록Figo.com - 가장 빠른 비디오에서 텍스트로 변환Black Box - 비디오에서 텍스트로 변환의 스크린샷YouTube 쇼트 녹취록비디오에서 텍스트로 변환의 ### 장단점결론자주 묻는 질문추가 자료기사: 최고의 10가지 도구로 비디오를 텍스트로 변환하는 방법서론오늘날의 디지털 환경에서 비디오를 텍스트로 변환하는
광저우의 샤오펜 휴머노이드 로봇 공장이 시범 생산에 돌입, 2026년 대량 생산 목표
샤오펑의 휴머노이드 로봇이 광저우 공장에서 소규모 시범 생산에 들어갔다. 대량 생산 라인은 현재 최종 통합을 진행 중이며, 이는 본격적인 제조 시작을 알리는 카운트다운의 시작을 의미한다.이전에는 샤오펑 그룹의 의장 겸 최고경영자(CEO)인 허샤오펑이 로봇 사업부의 'CEO' 역할을 맡아 상업화를 감독하고 가속화했다. 로봇 사업에 대한 내부 동원 계획에 따르면, 회사는 2026년까지 휴머노이드 로봇의 대량 생산을 달성하는 것을 목표로 한다. 20
머스크, AI 거대 기업들에 상호 모델 테스트 및 경쟁사 비판 수용 촉구
9월 15일 올인(All-In) 정상회의에서 세계 최대 부자 일론 머스크는 영상으로 원격 참여했습니다. 그는 인공지능(AI)을 언급하며, 주요 AI 기업들이 모델을 공개하기 전에 서로의 모델을 교차 검증할 것을 촉구하며, 이러한 글로벌 프레임워크를 지체 없이 구축해야 한다고 강조했습니다.머스크는 산업계의 자율 규제와 AI 안전 프로토콜에 대한 합의를 촉진하기 위해서는 ‘테스트 허니(Test Harness)’ 방식이 필요하다고 주장했습니다. 그
관련 특별 주제 추천
의견 (1)
0/500

워싱턴 주립대학교(WSU)의 최근 연구에 따르면, ChatGPT는 자신감 있게 답변하지만 복잡한 과학적 주장을 다루는 방식은 무작위 추측과 유사하다고 한다. 이 연구는 정확도가 제한적일 뿐만 아니라 동일한 질문에 대해 모순된 답변이 빈번하게 나온다는 점도 지적했다.
메수트 치체크 교수와 연구팀은 2021년 이후 발행된 경영학 학술지에서 719개의 연구 가설을 추출하여, 사실 확인을 위해 이 가설들을 모델에 반복적으로 입력했다.
ChatGPT의 표면적인 정확도는 약 80%로 보이지만, 무작위 추측을 고려하면 실제 성능은 50% 확률의 동전 던지기보다 약 60% 정도 더 나은 수준에 불과하다. 연구진은 이를 “낮은 D등급”으로 평가했다. 이 모델은 특히 거짓 진술을 식별하는 데서 저조한 성과를 보였으며, 거짓 명제 중 단 16.4%만 올바르게 판별했다.
연구진은 각 가설을 모델에 10회씩 입력한 결과, 모델이 일관된 입장을 유지하는 데 어려움을 겪는다는 사실을 발견했습니다:
답변 변동: 약 73%의 사례에서 모델은 10회 반복에 걸쳐 일관된 결론을 유지했습니다.
극단적인 모순: 일부 경우, 모델은 “참”과 “거짓” 답변을 번갈아 내놓았으며, 정확히 동일한 프롬프트를 사용했음에도 절반은 참이고 절반은 거짓인 극단적인 사례도 있었습니다.
이 연구는 사용자들이 AI의 유창하고 설득력 있는 언어에 쉽게 현혹되지만, 이것이 진정한 추론 능력을 의미하는 것은 아니라고 지적한다.
진정한 이해 부재: 이 모델은 세상과 자신이 말하는 내용을 진정으로 이해하는 인간과 달리, 기억과 패턴 매칭에 의존합니다.
제한적인 버전 발전: 테스트 결과, 업데이트된 ChatGPT-5 mini(2025년 테스트)는 이 특정 과제에서 이전 버전과 유사한 성능을 보였으며, 유의미한 개선점은 나타나지 않았다.
이러한 연구 결과를 바탕으로, 치체크(Cicek)는 경영진들이 복잡한 결정을 내릴 때 높은 수준의 회의적 태도를 유지할 것을 권고한다. 그들은 생성형 AI를 전문적인 판단을 대체할 수 있는 ‘권위’로 간주해서는 안 되며, 모든 출력 결과를 수동으로 검증해야 한다. 조직은 직원들이 AI 도구의 장점과 한계를 모두 이해할 수 있도록 교육을 강화하여, 맹목적인 신뢰로 인한 의사결정 편향을 방지해야 한다.
이 연구는 AI가 급속히 발전하고 있음에도 불구하고, 이 기술의 심층적인 논리적 추론 및 증거 평가 능력은 여전히 개선이 필요하다는 점을 다시 한번 상기시켜 줍니다.
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
비디오 및 오디오를 텍스트로 변환하는 최고의 AI 도구목차:서론Weet.io - 비디오를 텍스트로 변환YouTube 자막 및 녹취록Figo.com - 가장 빠른 비디오에서 텍스트로 변환Black Box - 비디오에서 텍스트로 변환의 스크린샷YouTube 쇼트 녹취록비디오에서 텍스트로 변환의 ### 장단점결론자주 묻는 질문추가 자료기사: 최고의 10가지 도구로 비디오를 텍스트로 변환하는 방법서론오늘날의 디지털 환경에서 비디오를 텍스트로 변환하는
광저우의 샤오펜 휴머노이드 로봇 공장이 시범 생산에 돌입, 2026년 대량 생산 목표
샤오펑의 휴머노이드 로봇이 광저우 공장에서 소규모 시범 생산에 들어갔다. 대량 생산 라인은 현재 최종 통합을 진행 중이며, 이는 본격적인 제조 시작을 알리는 카운트다운의 시작을 의미한다.이전에는 샤오펑 그룹의 의장 겸 최고경영자(CEO)인 허샤오펑이 로봇 사업부의 'CEO' 역할을 맡아 상업화를 감독하고 가속화했다. 로봇 사업에 대한 내부 동원 계획에 따르면, 회사는 2026년까지 휴머노이드 로봇의 대량 생산을 달성하는 것을 목표로 한다. 20
머스크, AI 거대 기업들에 상호 모델 테스트 및 경쟁사 비판 수용 촉구
9월 15일 올인(All-In) 정상회의에서 세계 최대 부자 일론 머스크는 영상으로 원격 참여했습니다. 그는 인공지능(AI)을 언급하며, 주요 AI 기업들이 모델을 공개하기 전에 서로의 모델을 교차 검증할 것을 촉구하며, 이러한 글로벌 프레임워크를 지체 없이 구축해야 한다고 강조했습니다.머스크는 산업계의 자율 규제와 AI 안전 프로토콜에 대한 합의를 촉진하기 위해서는 ‘테스트 허니(Test Harness)’ 방식이 필요하다고 주장했습니다. 그





집






