вариант
Дом
Новости
Новые модели ИИ от OpenAI демонстрируют более высокие показатели галлюцинаций в задачах на рассуждение

Новые модели ИИ от OpenAI демонстрируют более высокие показатели галлюцинаций в задачах на рассуждение

21 июля 2025 г.
60

Новые модели ИИ от OpenAI демонстрируют более высокие показатели галлюцинаций в задачах на рассуждение

Недавно выпущенные модели ИИ o3 и o4-mini от OpenAI превосходят в нескольких областях, но демонстрируют повышенную склонность к галлюцинациям по сравнению с предыдущими моделями, генерируя больше вымышленной информации.

Галлюцинации остаются постоянной проблемой в ИИ, даже для систем высшего уровня. Обычно новые модели снижают уровень галлюцинаций, но o3 и o4-mini отклоняются от этой тенденции.

Внутренние тесты OpenAI показывают, что o3 и o4-mini, разработанные как модели для рассуждений, галлюцинируют чаще, чем предыдущие модели для рассуждений, такие как o1, o1-mini и o3-mini, а также модели, не предназначенные для рассуждений, такие как GPT-4o.

Причина этого увеличения остается неясной для OpenAI, вызывая обеспокоенность.

Технический отчет OpenAI по моделям o3 и o4-mini отмечает, что необходимы дополнительные исследования, чтобы точно определить, почему уровень галлюцинаций увеличивается с масштабированием моделей для рассуждений. Хотя эти модели превосходят в таких областях, как программирование и математика, их склонность делать больше утверждений приводит как к точным, так и к неточным результатам, согласно отчету.

На бенчмарке PersonQA от OpenAI модель o3 галлюцинировала в 33% ответов, что вдвое превышает показатели o1 (16%) и o3-mini (14.8%). O4-mini показала худший результат, галлюцинируя в 48% случаев.

Transluce, некоммерческая исследовательская группа по ИИ, обнаружила, что o3 выдумывает действия, такие как утверждение, что она запускала код на MacBook Pro 2021 года вне ChatGPT, несмотря на отсутствие таких возможностей.

«Мы подозреваем, что обучение с подкреплением, используемое в моделях серии o, может усугублять проблемы, обычно смягчаемые стандартными методами постобучения», — сказал исследователь Transluce и бывший сотрудник OpenAI Нил Чоудхури в письме TechCrunch.

Сооснователь Transluce Сара Шветтманн отметила, что уровень галлюцинаций o3 может снизить ее практическую полезность.

Киан Катанфоруш, адъюнкт-профессор Стэнфорда и генеральный директор Workera, сообщил TechCrunch, что его команда обнаружила превосходство o3 в рабочих процессах программирования, но склонность к генерации неработающих ссылок на веб-сайты.

Хотя галлюцинации могут стимулировать творческие идеи, они создают проблемы для таких отраслей, как юриспруденция, где точность критична, а ошибки в документах недопустимы.

Интеграция возможностей веб-поиска показывает перспективы для повышения точности. GPT-4o от OpenAI с веб-поиском достигает 90% точности на SimpleQA, что указывает на потенциал снижения галлюцинаций в моделях для рассуждений, когда пользователи разрешают доступ к поиску третьих сторон.

Если масштабирование моделей для рассуждений продолжит увеличивать галлюцинации, поиск решений станет все более важным.

«Повышение точности и надежности моделей — ключевая цель наших текущих исследований», — сказал представитель OpenAI Нико Феликс в письме TechCrunch.

Индустрия ИИ недавно сместила акцент на модели для рассуждений, которые повышают производительность без необходимости обширных вычислительных ресурсов. Однако этот сдвиг, похоже, увеличивает риски галлюцинаций, представляя значительную проблему.

Связанная статья
OpenAI представляет две продвинутые модели ИИ с открытым весом OpenAI представляет две продвинутые модели ИИ с открытым весом OpenAI во вторник объявила о выпуске двух моделей ИИ с открытым весом, обладающих возможностями, сравнимыми с серией o. Обе модели доступны для бесплатной загрузки на Hugging Face, причем OpenAI назыв
ByteDance представляет модель ИИ Seed-Thinking-v1.5 для усиления способностей к рассуждению ByteDance представляет модель ИИ Seed-Thinking-v1.5 для усиления способностей к рассуждению Гонка за продвинутыми ИИ с функцией рассуждения началась с модели o1 от OpenAI в сентябре 2024 года, набрав обороты с запуском R1 от DeepSeek в январе 2025 года.Крупные разработчики ИИ соревнуются в с
Инвестиция Oracle в $40 млрд на чипы Nvidia для AI-датцентра в Техасе Инвестиция Oracle в $40 млрд на чипы Nvidia для AI-датцентра в Техасе Oracle планирует инвестировать около $40 млрд в чипы Nvidia для нового крупного дата-центра в Техасе, разработанного OpenAI, как сообщает Financial Times. Эта сделка, одна из крупнейших по закупке чип
GeorgeWilliams
GeorgeWilliams 14 августа 2025 г., 16:00:59 GMT+03:00

It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.

KennethMartin
KennethMartin 12 августа 2025 г., 14:00:59 GMT+03:00

I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.

LarryWilliams
LarryWilliams 4 августа 2025 г., 9:48:52 GMT+03:00

These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

ThomasBaker
ThomasBaker 28 июля 2025 г., 4:20:21 GMT+03:00

It's wild how OpenAI's new models are so advanced yet still churn out more made-up stuff! 🤯 Kinda makes me wonder if we're getting closer to creative storytelling or just fancy errors.

Вернуться к вершине
OR