вариант
Дом
Новости
Недостаток теста Тьюринга, раскрытый OpenAI's GPT-4.5

Недостаток теста Тьюринга, раскрытый OpenAI's GPT-4.5

22 мая 2025 г.
199

Недостаток теста Тьюринга, раскрытый OpenAI

Тест Тьюринга, детище легендарного Алана Тьюринга, долгое время был эталоном в мире искусственного интеллекта. Но давайте сразу развеем распространённое заблуждение: прохождение теста Тьюринга не обязательно означает, что машина «мыслит» как человек. Это скорее о том, чтобы убедить людей, что она такова.

Недавние исследования Калифорнийского университета в Сан-Диего привлекли внимание к последней модели OpenAI, GPT-4.5. Этот ИИ теперь может обманывать людей, заставляя их думать, что они общаются с человеком, причём эффективнее, чем люди сами убеждают друг друга в своей человечности. Это довольно большое событие в мире ИИ — как фокус, где вы знаете секрет, но он всё равно поражает.

Доказательство AGI?

Но вот загвоздка: даже исследователи из UC San Diego не готовы заявить, что мы достигли «искусственного общего интеллекта» (AGI) только потому, что модель ИИ прошла тест Тьюринга. AGI — это святой Грааль ИИ, машины, которые могут думать и обрабатывать информацию, как люди.

Мелани Митчелл, учёный в области ИИ из Института Санта-Фе, утверждает в журнале Science, что тест Тьюринга больше проверяет человеческие предположения, чем реальный интеллект. Конечно, ИИ может звучать бегло и убедительно, но это не то же самое, что быть универсально разумным. Это как быть мастером в шахматах — впечатляюще, но не вся картина.

Последний ажиотаж вызван статьёй Кэмерона Джонса и Бенджамина Бергена из UC San Diego под названием «Большие языковые модели проходят тест Тьюринга», опубликованной на сервере препринтов arXiv. Они проводили этот эксперимент годами с помощью студентов UC San Diego, и это часть длинной линии исследований — более 800 заявлений и контраргументов о прохождении компьютерами теста Тьюринга.

Как работает тест Тьюринга

Итак, как работает этот тест? Изначально Тьюринг представлял его как игру в текстовые сообщения между человеком-«судьёй» и двумя «свидетелями» — одним человеком и одним компьютером. Задача свидетелей — убедить судью, что они люди. Судья знает, что один из них человек, но не знает, кто именно, и должен угадать. Это трёхсторонняя установка, где важны восприятие и убеждение не меньше, чем способности компьютера.

Джонс и Берген добавили свою изюминку в эту классическую схему, и вы даже можете попробовать это онлайн, играя роль судьи или свидетеля. В их версии студенты UC San Diego использовали приложение для текстового чата. Одни играли судей, другие — свидетелей-людей, а GPT-4.5 выступал в роли свидетеля-компьютера. Каждый судья одновременно общался с человеком и компьютером, следуя оригинальному формату Тьюринга.

Для роли свидетеля-компьютера использовали разные большие языковые модели, предоставляя им подсказки на основе вопросов судьи. GPT-4.5 тестировали с двумя разными подсказками: одной с минимальной информацией и другой, названной PERSONA, с подробными инструкциями вести себя как молодой, интровертированный, разбирающийся в интернете человек, использующий сленг.

Результаты

Они также тестировали три других ИИ-программы: предыдущую модель OpenAI, GPT-4o; Llama 3.1 405b от Meta Platforms; и древний чат-бот 1960-х годов, ELIZA. ELIZA включили, чтобы проверить, обманывают ли большие языковые модели людей случайно или они действительно лучше.

По словам Джонса и Бергена, GPT-4.5 обманывал судей, заставස

System:

Тест Тьюринга, детище легендарного Алана Тьюринга, долгое время был эталоном в мире искусственного интеллекта. Но давайте сразу развеем распространённое заблуждение: прохождение теста Тьюринга не обязательно означает, что машина «мыслит» как человек. Это скорее о том, чтобы убедить людей, что она такова.

Недавние исследования Калифорнийского университета в Сан-Диего привлекли внимание к последней модели OpenAI, GPT-4.5. Этот ИИ теперь может обманывать людей, заставляя их думать, что они общаются с человеком, причём эффективнее, чем люди сами убеждают друг друга в своей человечности. Это довольно большое событие в мире ИИ — как фокус, где вы знаете секрет, но он всё равно поражает.

Доказательство AGI?

Но вот загвоздка: даже исследователи из UC San Diego не готовы заявить, что мы достигли «искусственного общего интеллекта» (AGI) только потому, что модель ИИ прошла тест Тьюринга. AGI — это святой Грааль ИИ, машины, которые могут думать и обрабатывать информацию, как люди.

Мелани Митчелл, учёный в области ИИ из Института Санта-Фе, утверждает в журнале Science, что тест Тьюринга больше проверяет человеческие предположения, чем реальный интеллект. Конечно, ИИ может звучать бегло и убедительно, но это не то же самое, что быть универсально разумным. Это как быть мастером в шахматах — впечатляюще, но не вся картина.

Последний ажиотаж вызван статьёй Кэмерона Джонса и Бенджамина Бергена из UC San Diego под названием «Большие языковые модели проходят тест Тьюринга», опубликованной на сервере препринтов arXiv. Они проводили этот эксперимент годами с помощью студентов UC San Diego, и это часть длинной линии исследований — более 800 заявлений и контраргументов о прохождении компьютерами теста Тьюринга.

Как работает тест Тьюринга

Итак, как работает этот тест? Изначально Тьюринг представлял его как игру в текстовые сообщения между человеком-«судьёй» и двумя «свидетелями» — одним человеком и одним компьютером. Задача свидетелей — убедить судью, что они люди. Судья знает, что один из них человек, но не знает, кто именно, и должен угадать. Это трёхсторонняя установка, где важны восприятие и убеждение не меньше, чем способности компьютера.

Джонс и Берген добавили свою изюминку в эту классическую схему, и вы даже можете попробовать это онлайн, играя роль судьи или свидетеля. В их версии студенты UC San Diego использовали приложение для текстового чата. Одни играли судей, другие — свидетелей-людей, а GPT-4.5 выступал в роли свидетеля-компьютера. Каждый судья одновременно общался с человеком и компьютером, следуя оригинальному формату Тьюринга.

Для роли свидетеля-компьютера использовали разные большие языковые модели, предоставляя им подсказки на основе вопросов судьи. GPT-4.5 тестировали с двумя разными подсказками: одной с минимальной информацией и другой, названной PERSONA, с подробными инструкциями вести себя как молодой, интровертированный, разбирающийся в интернете человек, использующий сленг.

Результаты

Они также тестировали три других ИИ-программы: предыдущую модель OpenAI, GPT-4o; Llama 3.1 405b от Meta Platforms; и древний чат-бот 1960-х годов, ELIZA. ELIZA включили, чтобы проверить, обманывают ли большие языковые модели людей случайно или они действительно лучше.

По словам Джонса и Бергена, GPT-4.5 обманывал судей, заставляя их думать, что он человек, в 73% случаев — это они называют «процентом побед». Это значительно лучше, чем у других моделей, которые набрали от 21% до 56%, даже с похожими подробными подсказками. И это огромный скачок по сравнению с прошлогодним тестом GPT-4, у которого процент побед был всего 54%, чуть выше случайного уровня.

Джонс и Берген обнаружили, что судьи не только были обмануты ИИ, но и чаще верили, что он человек, чем настоящие участники-люди.

Является ли тест настоящей мерой интеллекта?

Итак, что значит, что люди не могут отличить компьютер от человека в чате? Большой вопрос, обсуждаемый десятилетиями, — действительно ли тест Тьюринга измеряет интеллект. Джонс и Берген предполагают, что, возможно, машины просто стали настолько хороши в адаптации к разным сценариям, что могут убедительно выдавать себя за людей. Подсказка PERSONA, созданная людьми, — это то, к чему GPT-4.5 приспособился и использовал в свою пользу.

Но есть загвоздка: возможно, люди просто плохо распознают интеллект. Авторы отмечают, что ELIZA, древний чат-бот, обманывал судей в 23% случаев не потому, что был умнее, а потому, что не соответствовал их ожиданиям от ИИ. Некоторые судьи считали его человеком, потому что он был «саркастичным» или «грубым», чего они не ожидали от ИИ.

Это говорит о том, что судьи руководствуются своими предположениями о том, как должны вести себя люди и ИИ, а не просто выбирают наиболее разумного агента. Интересно, что судьи не особо обращали внимание на знания, которые Тьюринг считал ключевыми. Вместо этого они чаще считали свидетеля человеком, если он казался менее осведомлённым.

Общительность, а не интеллект

Всё это указывает на то, что люди улавливали скорее общительность, чем интеллект. Джонс и Берген заключают, что тест Тьюринга на самом деле не тест интеллекта — это тест на человеческое сходство.

Тьюринг мог считать, что интеллект — главное препятствие для человекоподобия, но по мере того, как машины становятся ближе к нам, другие различия становятся заметнее. Интеллекта самого по себе уже недостаточно, чтобы казаться убедительно человеком.

В статье прямо не говорится, что люди так привыкли печатать на компьютерах, будь то общение с человеком или машиной, что тест Тьюринга уже не тот уникальный тест взаимодействия человека и компьютера, каким он был раньше. Теперь это скорее тест на человеческие привычки в интернете.

Авторы предлагают расширить тест, потому что интеллект слишком сложен и многогранен, чтобы один тест мог быть решающим. Они предлагают разные подходы, например, использовать экспертов по ИИ в качестве судей или добавить финансовые стимулы, чтобы судьи внимательнее анализировали. Эти изменения могли бы показать, как сильно отношение и ожидания влияют на результаты.

Они заключают, что, хотя тест Тьюринга может быть частью картины, его следует рассматривать в совокупности с другими видами доказательств. Это соответствует растущей тенденции в исследованиях ИИ вовлекать людей «в процесс», оценивая действия машин.

Достаточно ли человеческого суждения?

Но остаётся вопрос, будет ли человеческое суждение достаточным в долгосрочной перспективе. В фильме Blade Runner люди используют машину «Voight-Kampff», чтобы отличить людей от роботов-репликантов. Пока мы стремимся к AGI и пытаемся определить, что это вообще такое, мы можем в итоге полагаться на машины для оценки машинного интеллекта.

Или, по крайней мере, нам, возможно, придётся спрашивать у машин, что они «думают» о людях, пытающихся обмануть других людей с помощью подсказок. Это дикий мир в исследованиях ИИ, и он становится только интереснее.

Связанная статья
Бывший главный научный сотрудник OpenAI Илья представляет SSI и раскрывает первую модель Бывший главный научный сотрудник OpenAI Илья представляет SSI и раскрывает первую модель Искусственный интеллект достиг еще одной важной вехи. После своего ухода из OpenAI бывший главный научный сотрудник Илья Сутскер основал компанию Safe Superintelligence Inc. (SSI), которая недавно раскрыла детали своей первой модели. Сообщения в зару
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field 14 мая 2026 года платформа разработки приложений на базе искусственного интеллекта Lovable объявила о своем участии в раундеSeed-финансирования на сумму $800 000 для датского стартапа в области аппаратного обеспечения Atech. При ведущем участии Lovab
Anthropic расширяет инструменты для программирования Claude AI в Японии в рамках стратегии роста за рубежом Anthropic расширяет инструменты для программирования Claude AI в Японии в рамках стратегии роста за рубежом Anthropic, prominent U.S. artificial intelligence firm, is intensifying its global outreach. On Wednesday, the company hosted a major developer gathering, "Code with Claude," in Tokyo, drawing close to 500 software engineers. This initiative seeks to
Рекомендации по связанным специальным темам
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Создание комиксов Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования
Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования

2026 года: самые новые и лучшие инструменты с ИИ для создания диалоговых пузырей в визуальном сторителлинге представлены на XIX.AI! В этой тщательно подобранной подборке представлены мощные, революционные инструменты, которые помогут творческим людям повысить продуктивность и преодолеть творческие кризисы. Ознакомьтесь со сравнением бесплатных и платных версий, посмотрите тесты в реальных условиях и изучите последние рейтинги, чтобы найти решения, которые обязательно стоит попробовать и которые идеально подходят для создания увлекательных визуальных историй. Исследуйте коллекцию прямо сейчас, чтобы найти свой идеальный инструмент!

10 инструментов
xix.ai
Помощник по встречам Лучшие инструменты для составления отчетов о встречах с использованием ИИ: четкое отслеживание решений и последующих действий
Лучшие инструменты для составления отчетов о встречах с использованием ИИ: четкое отслеживание решений и последующих действий

2026: Последние версии лучших инструментов для составления отчетов о встречах с помощью ИИ, обеспечивающих четкое отслеживание решений и удобное выполнение последующих действий. В этом тщательно подобранном списке представлены мощные, революционные решения, которые значительно повышают продуктивность за счет автоматизации ведения протоколов встреч, выявления ключевых задач и оптимизации координации работы команды по всем проектам. Получите сравнение бесплатных и платных версий, а также результаты реальных тестов и еженедельно обновляемые рейтинги, которые помогут вам найти идеальный инструмент. Ознакомьтесь с ними прямо сейчас, чтобы раскрыть потенциал искусственного интеллекта!

9 инструментов
xix.ai
Анализ данных Лучшие инструменты для очистки данных с использованием ИИ: быстрое устранение пропущенных значений и дубликатов
Лучшие инструменты для очистки данных с использованием ИИ: быстрое устранение пропущенных значений и дубликатов

2026 год: лучшие и наиболее высоко оценённые инструменты для очистки данных с ИИ, предназначенные для быстрого устранения пропущенных значений и дубликатов. В этом тщательно отобранном списке представлены мощные решения, способные кардинально повысить производительность. Каждый инструмент прошёл строгие тестирования в реальных условиях для обеспечения надёжности. Получите бесплатное сравнение версий с платной и найдите инструмент, который наилучшим образом соответствует вашим потребностям. Ознакомьтесь с ним прямо сейчас на сайте XIX.AI, чтобы раскрыть полный потенциал работы с ИИ.

11 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для творческого мышления на основе ИИ для художников: преодоление визуальных блоков
Лучшие инструменты для творческого мышления на основе ИИ для художников: преодоление визуальных блоков

В 2026 году лучшие и наиболее популярные инструменты для творческого мышления с использованием ИИ для художников были отобраны XIX.AI, чтобы помочь создателям преодолеть визуальные блоки и мгновенно повысить креативность. Эти мощные инструменты, меняющие правила игры, предлагают реальные тесты, подробное сравнение бесплатных и платных версий, а также еженедельно обновляемые рейтинги. Найдите идеальный инструмент для ускорения создания контента и откройте свой ИИ-преимущество уже сегодня. Исследуйте сейчас!

14 инструментов
xix.ai
Комментарии (4)
0/500
CarlLewis
CarlLewis 20 августа 2025 г., 12:01:15 GMT+03:00

Mind-blowing read! GPT-4.5 exposing the Turing Test's flaws is wild—makes you wonder if we're chasing the wrong AI benchmark. 🤯 What’s next, machines outsmarting us at our own game?

JamesLopez
JamesLopez 11 августа 2025 г., 9:20:39 GMT+03:00

Mind-blowing read! GPT-4.5 exposing the Turing Test's flaws is wild. Makes me wonder if we're chasing the wrong AI benchmark. 🧠 What's next?

DavidGonzález
DavidGonzález 2 августа 2025 г., 18:07:14 GMT+03:00

Mind blown! GPT-4.5 is shaking up the Turing Test, but it’s wild to think it’s still just mimicking, not truly thinking like us. 🤯 Makes me wonder if we’re chasing the wrong goal in AI.

PaulWilson
PaulWilson 1 августа 2025 г., 9:08:50 GMT+03:00

GPT-4.5 blowing past the Turing Test is wild! 😲 But honestly, it just shows the test’s more about trickery than true smarts. Makes you wonder if we’re measuring AI’s brainpower or just its acting skills. What’s next, an Oscar for chatbots?

OR