Дом
Исследование Университета штата Вашингтон выявило серьезные противоречия в выводах ChatGPT при оценке сложных научных вопросов

Недавнее исследование Университета штата Вашингтон (WSU) показывает, что, хотя ChatGPT отвечает уверенно, его обработка сложных научных утверждений напоминает случайные догадки. Исследование выявляет не только ограниченную точность, но и частые противоречивые ответы на один и тот же вопрос.
Профессор Месут Чичек и его команда извлекли 719 научных гипотез из бизнес-журналов, опубликованных с 2021 года, и неоднократно подвергали их проверке на достоверность с помощью модели.
Хотя внешняя точность ChatGPT составляет около 80 %, с учётом случайных угадываний её фактическая эффективность лишь на 60 % превосходит вероятность 50 % при подбрасывании монеты. Исследователи оценили этот результат как «низкую оценку D». Модель показала особенно плохие результаты при выявлении ложных утверждений, правильно распознав лишь 16,4 % ложных суждений.
Исследователи вводили каждую гипотезу в модель по десять раз и обнаружили, что ей с трудом удавалось сохранять последовательность позиций:
Колебания ответов: примерно в 73 % случаев модель сохраняла последовательные выводы на протяжении десяти повторений.
Крайние противоречия: в некоторых случаях модель чередовала ответы «истина» и «ложь», причем в крайних случаях половина ответов была «истина», а половина — «ложь», несмотря на использование абсолютно одинакового запроса.
В исследовании отмечается, что пользователи легко вводятся в заблуждение плавной и убедительной речью ИИ, но это не свидетельствует о подлинной способности к рассуждению.
Отсутствие истинного понимания: модель полагается на память и сопоставление шаблонов, в отличие от людей, которые действительно понимают мир и то, о чём говорят.
Ограниченный прогресс версий: тестирование показало, что обновленная версия ChatGPT‑5 mini (протестированная в 2025 году) продемонстрировала результаты, аналогичные более ранним версиям при решении этой конкретной задачи, без каких-либо значительных улучшений.
Основываясь на этих выводах, Чичек советует руководителям компаний сохранять высокую степень скептицизма при принятии сложных решений. Им не следует рассматривать генеративный ИИ как «авторитет», способный заменить профессиональное суждение, и необходимо вручную проверять все результаты. Организации должны усовершенствовать обучение, чтобы помочь сотрудникам понять как сильные стороны, так и ограничения инструментов ИИ, предотвращая предвзятость в принятии решений из-за слепого доверия.
Данное исследование служит ещё одним напоминанием о том, что, несмотря на стремительное развитие ИИ, способности этой технологии к глубокому логическому мышлению и оценке доказательств по-прежнему требуют совершенствования.
Связанная статья
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Топ ИИ-инструментов для преобразования видео и аудио в текстСодержание:ВведениеWeet.io - Преобразование видео в текстСубтитры и транскрипция YouTubeFigo.com - Самое быстрое преобразование видео в текстBlack Box - Скриншоты преобразования видео в текс
Завод по производству человекоподобных роботов Xiaopeng в Гуанчжоу начал пробное производство, планируя массовый выпуск к 2026 году
Человекоподобный робот компании Xiaopeng поступил в мелкосерийное производство на заводе в Гуанчжоу. Линия массового производства в настоящее время проходит финальную интеграцию, что сигнализирует о начале обратного отсчета перед запуском полномасшта
Маск призывает гигантов ИИ перекрестно тестировать модели и приглашать критику от конкурентов
Во время саммита All-In 15 сентября Илон Маск, богатейший человек в мире, присоединился к мероприятию удаленно по видеосвязи. Касаясь темы искусственного интеллекта, он призвал ведущие компании в области ИИ перекрестно тестировать друг друга перед вы
Рекомендации по связанным специальным темам
Комментарии (1)

Недавнее исследование Университета штата Вашингтон (WSU) показывает, что, хотя ChatGPT отвечает уверенно, его обработка сложных научных утверждений напоминает случайные догадки. Исследование выявляет не только ограниченную точность, но и частые противоречивые ответы на один и тот же вопрос.
Профессор Месут Чичек и его команда извлекли 719 научных гипотез из бизнес-журналов, опубликованных с 2021 года, и неоднократно подвергали их проверке на достоверность с помощью модели.
Хотя внешняя точность ChatGPT составляет около 80 %, с учётом случайных угадываний её фактическая эффективность лишь на 60 % превосходит вероятность 50 % при подбрасывании монеты. Исследователи оценили этот результат как «низкую оценку D». Модель показала особенно плохие результаты при выявлении ложных утверждений, правильно распознав лишь 16,4 % ложных суждений.
Исследователи вводили каждую гипотезу в модель по десять раз и обнаружили, что ей с трудом удавалось сохранять последовательность позиций:
Колебания ответов: примерно в 73 % случаев модель сохраняла последовательные выводы на протяжении десяти повторений.
Крайние противоречия: в некоторых случаях модель чередовала ответы «истина» и «ложь», причем в крайних случаях половина ответов была «истина», а половина — «ложь», несмотря на использование абсолютно одинакового запроса.
В исследовании отмечается, что пользователи легко вводятся в заблуждение плавной и убедительной речью ИИ, но это не свидетельствует о подлинной способности к рассуждению.
Отсутствие истинного понимания: модель полагается на память и сопоставление шаблонов, в отличие от людей, которые действительно понимают мир и то, о чём говорят.
Ограниченный прогресс версий: тестирование показало, что обновленная версия ChatGPT‑5 mini (протестированная в 2025 году) продемонстрировала результаты, аналогичные более ранним версиям при решении этой конкретной задачи, без каких-либо значительных улучшений.
Основываясь на этих выводах, Чичек советует руководителям компаний сохранять высокую степень скептицизма при принятии сложных решений. Им не следует рассматривать генеративный ИИ как «авторитет», способный заменить профессиональное суждение, и необходимо вручную проверять все результаты. Организации должны усовершенствовать обучение, чтобы помочь сотрудникам понять как сильные стороны, так и ограничения инструментов ИИ, предотвращая предвзятость в принятии решений из-за слепого доверия.
Данное исследование служит ещё одним напоминанием о том, что, несмотря на стремительное развитие ИИ, способности этой технологии к глубокому логическому мышлению и оценке доказательств по-прежнему требуют совершенствования.
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Топ ИИ-инструментов для преобразования видео и аудио в текстСодержание:ВведениеWeet.io - Преобразование видео в текстСубтитры и транскрипция YouTubeFigo.com - Самое быстрое преобразование видео в текстBlack Box - Скриншоты преобразования видео в текс
Завод по производству человекоподобных роботов Xiaopeng в Гуанчжоу начал пробное производство, планируя массовый выпуск к 2026 году
Человекоподобный робот компании Xiaopeng поступил в мелкосерийное производство на заводе в Гуанчжоу. Линия массового производства в настоящее время проходит финальную интеграцию, что сигнализирует о начале обратного отсчета перед запуском полномасшта
Маск призывает гигантов ИИ перекрестно тестировать модели и приглашать критику от конкурентов
Во время саммита All-In 15 сентября Илон Маск, богатейший человек в мире, присоединился к мероприятию удаленно по видеосвязи. Касаясь темы искусственного интеллекта, он призвал ведущие компании в области ИИ перекрестно тестировать друг друга перед вы











