вариант
Дом
Новости
Модель AI o3 от OpenAI показала более низкие результаты в тестировании, чем ожидалось изначально

Модель AI o3 от OpenAI показала более низкие результаты в тестировании, чем ожидалось изначально

7 июня 2025 г.
159

Модель AI o3 от OpenAI показала более низкие результаты в тестировании, чем ожидалось изначально

Почему расхождения в бенчмарках имеют значение для ИИ

Когда речь идет об искусственном интеллекте, цифры часто рассказывают историю, и иногда эти цифры не совсем сходятся. Возьмем, к примеру, модель o3 от OpenAI. Первоначальные заявления были просто ошеломляющими: по сообщениям, o3 могла справиться с более чем 25 % печально известных сложных задач FrontierMath. Для сравнения, конкуренция была на уровне однозначных чисел. Но, переходя к недавним событиям, Epoch AI - уважаемый исследовательский институт - внесла ясность в эту историю. Согласно их выводам, реальная производительность o3 приближается к 10 %. Неплохо, но, конечно, не та цифра, о которой OpenAI изначально заявляла в заголовках.

Что же происходит на самом деле?

Давайте разберемся. Первоначальный результат OpenAI, скорее всего, был получен в оптимальных условиях - условиях, которые, возможно, не совсем воспроизводимы в реальном мире. Epoch отметила, что их тестовая среда может несколько отличаться от среды OpenAI, и даже версия FrontierMath, которую они использовали, была более новой. Это не значит, что OpenAI прямо ввела кого-то в заблуждение: их первоначальные заявления совпадают с внутренними тестами, но расхождение подчеркивает более широкую проблему. Бенчмарки не всегда сравнивают яблоки с яблоками. И давайте посмотрим правде в глаза: у компаний есть стимул выставлять себя в лучшем свете.

Роль прозрачности

Эта ситуация поднимает важный вопрос: Насколько прозрачными должны быть компании, занимающиеся разработкой ИИ, когда они делятся результатами? Хотя OpenAI не лгала, ее сообщения породили ожидания, которые не были полностью оправданы. Это хрупкий баланс. Компании хотят продемонстрировать свои достижения, но они также должны быть честными в том, что эти цифры на самом деле означают. По мере того как ИИ будет все больше интегрироваться в повседневную жизнь, потребители и исследователи будут требовать более четких ответов.

Другие противоречия в отрасли

Сбои в бенчмаркинге не являются уникальным явлением для OpenAI. Другие игроки в сфере ИИ сталкивались с подобными проблемами. В январе компания Epoch оказалась в горячей воде после того, как приняла нераскрытое финансирование от OpenAI незадолго до анонса o3. В то же время xAI Элона Маска подверглась нападкам за то, что якобы подправила свои эталонные графики, чтобы Grok 3 выглядел лучше, чем на самом деле. Даже Meta, один из технологических гигантов, недавно признался, что продвигал оценки, основанные на модели, которая не была общедоступна. Очевидно, что гонка за лидерство в заголовках газет разгорается, и не все играют честно.

Взгляд в будущее

Хотя эти противоречия могут показаться удручающими, на самом деле они являются признаком прогресса. По мере того как развивается ландшафт ИИ, растет и дискуссия о подотчетности. Потребители и исследователи добиваются большей прозрачности, и это хорошо. Это заставляет компании более вдумчиво относиться к тому, как они представляют свои достижения, и гарантирует, что пользователи не погрязнут в нереалистичной шумихе. В конце концов, цель должна заключаться не в том, чтобы играть с цифрами, а в том, чтобы создавать модели, которые действительно способствуют прогрессу в этой области.

Связанная статья
OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться После серии судебных исков, связанных с отсутствием протоколов безопасности в чат-ботах на базе ИИ — что стало одной из причин самоубийств подростков и других кризисов, связанных с психическим здоровь
Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей Последние исследования показывают, что лишь немногие ведущие лаборатории, занимающиеся ИИ, опубликовали или продемонстрировали планы реагирования на попытки выхода системы из-под контроля. План сдержи
Tiffany Luck из NEA: Компании по-прежнему борются с вопросами окупаемости инвестиций в ИИ Tiffany Luck из NEA: Компании по-прежнему борются с вопросами окупаемости инвестиций в ИИ Загрузка плеера…Ранее в этом году «токеномаксимизация» доминировала в Кремниевой долине, когда генеральные директора призывали сотрудников максимально использовать возможности искусственного интеллекта. Однако этот энтузиазм быстро столкнулся с реал
Рекомендации по связанным специальным темам
Анализ данных ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.
ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.

2026 год: лучшие AI-ассистенты для SQL, занявшие верхние строчки рейтингов! XIX.AI собрал мощный набор инструментов, регулярно обновляемый на основе реальных тестов. Эти неотъемлемые инструменты помогают создавать точные дашборды с данными о доходах, анализировать каналы продаж и оперативно отслеживать показатели продуктов, значительно повышая производительность. Ознакомьтесь сейчас, чтобы найти идеальный инструмент для принятия решений на основе данных! 238 символов

9 инструментов
xix.ai
Музыкальная композиция Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен
Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен

2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!

8 инструментов
xix.ai
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Создание комиксов Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования
Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования

2026 года: самые новые и лучшие инструменты с ИИ для создания диалоговых пузырей в визуальном сторителлинге представлены на XIX.AI! В этой тщательно подобранной подборке представлены мощные, революционные инструменты, которые помогут творческим людям повысить продуктивность и преодолеть творческие кризисы. Ознакомьтесь со сравнением бесплатных и платных версий, посмотрите тесты в реальных условиях и изучите последние рейтинги, чтобы найти решения, которые обязательно стоит попробовать и которые идеально подходят для создания увлекательных визуальных историй. Исследуйте коллекцию прямо сейчас, чтобы найти свой идеальный инструмент!

10 инструментов
xix.ai
Помощник по встречам Лучшие инструменты для составления отчетов о встречах с использованием ИИ: четкое отслеживание решений и последующих действий
Лучшие инструменты для составления отчетов о встречах с использованием ИИ: четкое отслеживание решений и последующих действий

2026: Последние версии лучших инструментов для составления отчетов о встречах с помощью ИИ, обеспечивающих четкое отслеживание решений и удобное выполнение последующих действий. В этом тщательно подобранном списке представлены мощные, революционные решения, которые значительно повышают продуктивность за счет автоматизации ведения протоколов встреч, выявления ключевых задач и оптимизации координации работы команды по всем проектам. Получите сравнение бесплатных и платных версий, а также результаты реальных тестов и еженедельно обновляемые рейтинги, которые помогут вам найти идеальный инструмент. Ознакомьтесь с ними прямо сейчас, чтобы раскрыть потенциал искусственного интеллекта!

9 инструментов
xix.ai
Комментарии (7)
0/500
LarryMitchell
LarryMitchell 4 августа 2026 г., 1:00:20 GMT+03:00

Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark

JackPerez
JackPerez 3 февраля 2026 г., 1:00:45 GMT+03:00

Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔

BruceRoberts
BruceRoberts 16 декабря 2025 г., 13:30:42 GMT+03:00

Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔

FrankSmith
FrankSmith 10 сентября 2025 г., 9:30:33 GMT+03:00

오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.

LiamWalker
LiamWalker 12 августа 2025 г., 9:50:10 GMT+03:00

I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎

FrankLewis
FrankLewis 7 августа 2025 г., 5:41:14 GMT+03:00

The o3 model's benchmark slip-up is a bit of a letdown. 😕 I was hyped for OpenAI's big claims, but now I’m wondering if they’re overselling. Numbers don’t lie, but they can sure be misleading!

OR