Дом
Новые модели ИИ от OpenAI демонстрируют более высокие показатели галлюцинаций в задачах на рассуждение

Недавно выпущенные модели ИИ o3 и o4-mini от OpenAI превосходят в нескольких областях, но демонстрируют повышенную склонность к галлюцинациям по сравнению с предыдущими моделями, генерируя больше вымышленной информации.
Галлюцинации остаются постоянной проблемой в ИИ, даже для систем высшего уровня. Обычно новые модели снижают уровень галлюцинаций, но o3 и o4-mini отклоняются от этой тенденции.
Внутренние тесты OpenAI показывают, что o3 и o4-mini, разработанные как модели для рассуждений, галлюцинируют чаще, чем предыдущие модели для рассуждений, такие как o1, o1-mini и o3-mini, а также модели, не предназначенные для рассуждений, такие как GPT-4o.
Причина этого увеличения остается неясной для OpenAI, вызывая обеспокоенность.
Технический отчет OpenAI по моделям o3 и o4-mini отмечает, что необходимы дополнительные исследования, чтобы точно определить, почему уровень галлюцинаций увеличивается с масштабированием моделей для рассуждений. Хотя эти модели превосходят в таких областях, как программирование и математика, их склонность делать больше утверждений приводит как к точным, так и к неточным результатам, согласно отчету.
На бенчмарке PersonQA от OpenAI модель o3 галлюцинировала в 33% ответов, что вдвое превышает показатели o1 (16%) и o3-mini (14.8%). O4-mini показала худший результат, галлюцинируя в 48% случаев.
Transluce, некоммерческая исследовательская группа по ИИ, обнаружила, что o3 выдумывает действия, такие как утверждение, что она запускала код на MacBook Pro 2021 года вне ChatGPT, несмотря на отсутствие таких возможностей.
«Мы подозреваем, что обучение с подкреплением, используемое в моделях серии o, может усугублять проблемы, обычно смягчаемые стандартными методами постобучения», — сказал исследователь Transluce и бывший сотрудник OpenAI Нил Чоудхури в письме TechCrunch.
Сооснователь Transluce Сара Шветтманн отметила, что уровень галлюцинаций o3 может снизить ее практическую полезность.
Киан Катанфоруш, адъюнкт-профессор Стэнфорда и генеральный директор Workera, сообщил TechCrunch, что его команда обнаружила превосходство o3 в рабочих процессах программирования, но склонность к генерации неработающих ссылок на веб-сайты.
Хотя галлюцинации могут стимулировать творческие идеи, они создают проблемы для таких отраслей, как юриспруденция, где точность критична, а ошибки в документах недопустимы.
Интеграция возможностей веб-поиска показывает перспективы для повышения точности. GPT-4o от OpenAI с веб-поиском достигает 90% точности на SimpleQA, что указывает на потенциал снижения галлюцинаций в моделях для рассуждений, когда пользователи разрешают доступ к поиску третьих сторон.
Если масштабирование моделей для рассуждений продолжит увеличивать галлюцинации, поиск решений станет все более важным.
«Повышение точности и надежности моделей — ключевая цель наших текущих исследований», — сказал представитель OpenAI Нико Феликс в письме TechCrunch.
Индустрия ИИ недавно сместила акцент на модели для рассуждений, которые повышают производительность без необходимости обширных вычислительных ресурсов. Однако этот сдвиг, похоже, увеличивает риски галлюцинаций, представляя значительную проблему.
Связанная статья
OpenAI описывает экономику искусственного интеллекта с участием государственных инвестиционных фондов, налогами на роботов и четырехдневной рабочей неделей
В то время как правительства пытаются справиться с экономическими последствиями появления сверхинтеллектуальных машин, компания OpenAI опубликовала ряд предложений по формированию политики, в которых
Грег Брокман рассказывает, как Илон Маск покинул OpenAI
В конце августа 2017 года ключевые фигуры OpenAI — на тот момент небольшой некоммерческой исследовательской лаборатории — собрались, чтобы обсудить, как создать коммерческую структуру для продвижения
Пентагон заключил соглашения с Nvidia, Microsoft и AWS о внедрении технологий искусственного интеллекта в секретные сети.
После предыдущих соглашений с Google, SpaceX и OpenAI, Министерство обороны США в пятницу объявило о подписании договоров с Nvidia, Microsoft, Amazon Web Services и Reflection AI о использовании их технологий и моделей искусственного интеллекта в сек
Рекомендации по связанным специальным темам
Комментарии (4)
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

Недавно выпущенные модели ИИ o3 и o4-mini от OpenAI превосходят в нескольких областях, но демонстрируют повышенную склонность к галлюцинациям по сравнению с предыдущими моделями, генерируя больше вымышленной информации.
Галлюцинации остаются постоянной проблемой в ИИ, даже для систем высшего уровня. Обычно новые модели снижают уровень галлюцинаций, но o3 и o4-mini отклоняются от этой тенденции.
Внутренние тесты OpenAI показывают, что o3 и o4-mini, разработанные как модели для рассуждений, галлюцинируют чаще, чем предыдущие модели для рассуждений, такие как o1, o1-mini и o3-mini, а также модели, не предназначенные для рассуждений, такие как GPT-4o.
Причина этого увеличения остается неясной для OpenAI, вызывая обеспокоенность.
Технический отчет OpenAI по моделям o3 и o4-mini отмечает, что необходимы дополнительные исследования, чтобы точно определить, почему уровень галлюцинаций увеличивается с масштабированием моделей для рассуждений. Хотя эти модели превосходят в таких областях, как программирование и математика, их склонность делать больше утверждений приводит как к точным, так и к неточным результатам, согласно отчету.
На бенчмарке PersonQA от OpenAI модель o3 галлюцинировала в 33% ответов, что вдвое превышает показатели o1 (16%) и o3-mini (14.8%). O4-mini показала худший результат, галлюцинируя в 48% случаев.
Transluce, некоммерческая исследовательская группа по ИИ, обнаружила, что o3 выдумывает действия, такие как утверждение, что она запускала код на MacBook Pro 2021 года вне ChatGPT, несмотря на отсутствие таких возможностей.
«Мы подозреваем, что обучение с подкреплением, используемое в моделях серии o, может усугублять проблемы, обычно смягчаемые стандартными методами постобучения», — сказал исследователь Transluce и бывший сотрудник OpenAI Нил Чоудхури в письме TechCrunch.
Сооснователь Transluce Сара Шветтманн отметила, что уровень галлюцинаций o3 может снизить ее практическую полезность.
Киан Катанфоруш, адъюнкт-профессор Стэнфорда и генеральный директор Workera, сообщил TechCrunch, что его команда обнаружила превосходство o3 в рабочих процессах программирования, но склонность к генерации неработающих ссылок на веб-сайты.
Хотя галлюцинации могут стимулировать творческие идеи, они создают проблемы для таких отраслей, как юриспруденция, где точность критична, а ошибки в документах недопустимы.
Интеграция возможностей веб-поиска показывает перспективы для повышения точности. GPT-4o от OpenAI с веб-поиском достигает 90% точности на SimpleQA, что указывает на потенциал снижения галлюцинаций в моделях для рассуждений, когда пользователи разрешают доступ к поиску третьих сторон.
Если масштабирование моделей для рассуждений продолжит увеличивать галлюцинации, поиск решений станет все более важным.
«Повышение точности и надежности моделей — ключевая цель наших текущих исследований», — сказал представитель OpenAI Нико Феликс в письме TechCrunch.
Индустрия ИИ недавно сместила акцент на модели для рассуждений, которые повышают производительность без необходимости обширных вычислительных ресурсов. Однако этот сдвиг, похоже, увеличивает риски галлюцинаций, представляя значительную проблему.
OpenAI описывает экономику искусственного интеллекта с участием государственных инвестиционных фондов, налогами на роботов и четырехдневной рабочей неделей
В то время как правительства пытаются справиться с экономическими последствиями появления сверхинтеллектуальных машин, компания OpenAI опубликовала ряд предложений по формированию политики, в которых
Грег Брокман рассказывает, как Илон Маск покинул OpenAI
В конце августа 2017 года ключевые фигуры OpenAI — на тот момент небольшой некоммерческой исследовательской лаборатории — собрались, чтобы обсудить, как создать коммерческую структуру для продвижения
Пентагон заключил соглашения с Nvidia, Microsoft и AWS о внедрении технологий искусственного интеллекта в секретные сети.
После предыдущих соглашений с Google, SpaceX и OpenAI, Министерство обороны США в пятницу объявило о подписании договоров с Nvidia, Microsoft, Amazon Web Services и Reflection AI о использовании их технологий и моделей искусственного интеллекта в сек
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.











