Новые модели ИИ от OpenAI демонстрируют более высокие показатели галлюцинаций в задачах на рассуждение

Дом

Новости

21 июля 2025 г.

PatrickMartinez

# ChatGPT # openai

Новые модели ИИ от OpenAI демонстрируют более высокие показатели галлюцинаций в задачах на рассуждение

Недавно выпущенные модели ИИ o3 и o4-mini от OpenAI превосходят в нескольких областях, но демонстрируют повышенную склонность к галлюцинациям по сравнению с предыдущими моделями, генерируя больше вымышленной информации.

Галлюцинации остаются постоянной проблемой в ИИ, даже для систем высшего уровня. Обычно новые модели снижают уровень галлюцинаций, но o3 и o4-mini отклоняются от этой тенденции.

Внутренние тесты OpenAI показывают, что o3 и o4-mini, разработанные как модели для рассуждений, галлюцинируют чаще, чем предыдущие модели для рассуждений, такие как o1, o1-mini и o3-mini, а также модели, не предназначенные для рассуждений, такие как GPT-4o.

Причина этого увеличения остается неясной для OpenAI, вызывая обеспокоенность.

Технический отчет OpenAI по моделям o3 и o4-mini отмечает, что необходимы дополнительные исследования, чтобы точно определить, почему уровень галлюцинаций увеличивается с масштабированием моделей для рассуждений. Хотя эти модели превосходят в таких областях, как программирование и математика, их склонность делать больше утверждений приводит как к точным, так и к неточным результатам, согласно отчету.

На бенчмарке PersonQA от OpenAI модель o3 галлюцинировала в 33% ответов, что вдвое превышает показатели o1 (16%) и o3-mini (14.8%). O4-mini показала худший результат, галлюцинируя в 48% случаев.

Transluce, некоммерческая исследовательская группа по ИИ, обнаружила, что o3 выдумывает действия, такие как утверждение, что она запускала код на MacBook Pro 2021 года вне ChatGPT, несмотря на отсутствие таких возможностей.

«Мы подозреваем, что обучение с подкреплением, используемое в моделях серии o, может усугублять проблемы, обычно смягчаемые стандартными методами постобучения», — сказал исследователь Transluce и бывший сотрудник OpenAI Нил Чоудхури в письме TechCrunch.

Сооснователь Transluce Сара Шветтманн отметила, что уровень галлюцинаций o3 может снизить ее практическую полезность.

Киан Катанфоруш, адъюнкт-профессор Стэнфорда и генеральный директор Workera, сообщил TechCrunch, что его команда обнаружила превосходство o3 в рабочих процессах программирования, но склонность к генерации неработающих ссылок на веб-сайты.

Хотя галлюцинации могут стимулировать творческие идеи, они создают проблемы для таких отраслей, как юриспруденция, где точность критична, а ошибки в документах недопустимы.

Интеграция возможностей веб-поиска показывает перспективы для повышения точности. GPT-4o от OpenAI с веб-поиском достигает 90% точности на SimpleQA, что указывает на потенциал снижения галлюцинаций в моделях для рассуждений, когда пользователи разрешают доступ к поиску третьих сторон.

Если масштабирование моделей для рассуждений продолжит увеличивать галлюцинации, поиск решений станет все более важным.

«Повышение точности и надежности моделей — ключевая цель наших текущих исследований», — сказал представитель OpenAI Нико Феликс в письме TechCrunch.

Индустрия ИИ недавно сместила акцент на модели для рассуждений, которые повышают производительность без необходимости обширных вычислительных ресурсов. Однако этот сдвиг, похоже, увеличивает риски галлюцинаций, представляя значительную проблему.

Связанная статья

ChatGPT использовался для кражи конфиденциальных данных Gmail в результате взлома системы безопасности Предупреждение о безопасности: Исследователи продемонстрировали технологию утечки данных с помощью искусственного интеллектаЭксперты по кибербезопасности недавно обнаружили уязвимость, позволяющую исп

Освойте написание сопроводительных писем с помощью искусственного интеллекта с помощью ChatGPT - руководство для экспертов Составление индивидуальных сопроводительных писем для нескольких соискателей традиционно отнимает много времени. Современные ИИ-решения, такие как ChatGPT, позволяют составлять профессиональные сопров

OpenAI исправляет ошибку чрезмерной вежливости в ChatGPT и объясняет недостаток ИИ Компания OpenAI отменила недавнюю корректировку личности своей флагманской модели GPT-4o после того, как появились многочисленные сообщения о том, что система ИИ проявляет чрезмерную покладистость, вк

Комментарии (4)

0/200

Представлять на рассмотрение

GeorgeWilliams

14 августа 2025 г., 16:00:59 GMT+03:00

It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.

KennethMartin

12 августа 2025 г., 14:00:59 GMT+03:00

I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.

LarryWilliams

4 августа 2025 г., 9:48:52 GMT+03:00

These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

ThomasBaker

28 июля 2025 г., 4:20:21 GMT+03:00

It's wild how OpenAI's new models are so advanced yet still churn out more made-up stuff! 🤯 Kinda makes me wonder if we're getting closer to creative storytelling or just fancy errors.

Лучшие новости

Топовые генераторы видео на AI в 2025: Pika Labs по сравнению с альтернативами Gemini 2.5 Pro в настоящее время неограничен и дешевле, чем Claude, GPT-4O AI Builder и Power Automate Революционизируют Суммирование Документов Озвучка с помощью ИИ: Ультимативное руководство по созданию реалистичных голосов ИИ ИИ Cambium превращает отходы в пиломатериалы Duolingo Переходит на Систему Энергии OpenAI улучшает AI Voice Assistant для лучших чатов Как гарантировать, что ваши данные заслуживают доверия для интеграции искусственного интеллекта NoteBooklm расширяется во всем мире, добавляет слайды и расширенную проверку фактов Два бесплатных способа получить подписку Perplexity Pro на один год

Более

Показан