вариант
Дом
Новости
Модели AI «рассуждения» всплывают, что повышает затраты на сравнение

Модели AI «рассуждения» всплывают, что повышает затраты на сравнение

22 апреля 2025 г.
206

Модели AI «рассуждения» всплывают, что повышает затраты на сравнение

Растущие затраты на тестирование моделей искусственного интеллекта с функцией рассуждения

Лаборатории ИИ, такие как OpenAI, активно рекламируют свои продвинутые модели ИИ с функцией "рассуждения", которые разработаны для пошагового решения сложных задач. Эти модели, особенно эффективные в таких областях, как физика, действительно впечатляют. Однако их тестирование обходится дорого, что затрудняет независимую проверку их возможностей.

Согласно данным Artificial Analysis, сторонней компании по тестированию ИИ, стоимость оценки модели рассуждения o1 от OpenAI на семи популярных тестах ИИ составляет ошеломляющие $2,767.05. Эти тесты включают MMLU-Pro, GPQA Diamond, Humanity’s Last Exam, LiveCodeBench, SciCode, AIME 2024 и MATH-500. Для сравнения, тестирование "гибридной" модели рассуждения Claude 3.7 Sonnet от Anthropic на тех же тестах обошлось в $1,485.35, а модель o3-mini-high от OpenAI была значительно дешевле — $344.59.

Не все модели рассуждения одинаково дороги в тестировании. Например, Artificial Analysis потратила всего $141.22 на оценку модели o1-mini от OpenAI. Однако в среднем затраты на тестирование таких моделей высоки. Artificial Analysis потратила около $5,200 на оценку примерно дюжины моделей рассуждения, что почти вдвое больше, чем $2,400, потраченные на анализ более 80 моделей без функции рассуждения.

Для сравнения, модель без функции рассуждения GPT-4o от OpenAI, выпущенная в мае 2024 года, обошлась Artificial Analysis в $108.85 для оценки, в то время как Claude 3.6 Sonnet, предшественник Claude 3.7 Sonnet без функции рассуждения, стоила $81.41.

Джордж Кэмерон, сооснователь Artificial Analysis, поделился с TechCrunch, что организация готова увеличить бюджет на тестирование, поскольку всё больше лабораторий ИИ продолжают разрабатывать модели рассуждения. "В Artificial Analysis мы проводим сотни оценок ежемесячно и выделяем значительный бюджет на эти цели," — заявил Кэмерон. "Мы планируем увеличить эти расходы, поскольку модели выпускаются всё чаще."

Artificial Analysis не единственная, кто сталкивается с растущими затратами. Росс Тейлор, генеральный директор стартапа в области ИИ General Reasoning, недавно потратил $580 на оценку Claude 3.7 Sonnet на примерно 3,700 уникальных запросах. Тейлор оценивает, что один прогон теста MMLU Pro, предназначенного для проверки понимания языка, обойдётся более чем в $1,800.

Тейлор выразил растущую озабоченность в недавнем посте на X, заявив: "Мы движемся к миру, где лаборатория сообщает о достижении x% на тесте, на который они потратили y вычислительных ресурсов, но ресурсы для академиков значительно меньше y. Никто не сможет воспроизвести эти результаты."

Почему тестирование моделей рассуждения так дорого?

Основная причина высоких затрат на тестирование моделей рассуждения — их склонность генерировать большое количество токенов. Токены — это единицы необработанного текста; например, слово "фантастический" может быть разбито на "фан", "тас" и "тик". По данным Artificial Analysis, модель o1 от OpenAI сгенерировала более 44 миллионов токенов во время тестов, что примерно в восемь раз больше, чем количество токенов, сгенерированных моделью без функции рассуждения GPT-4o.

Большинство компаний ИИ взимают плату за использование моделей на основе количества токенов, что быстро увеличивает затраты. Кроме того, современные тесты разработаны так, чтобы вызывать большое количество токенов, включая вопросы, которые требуют выполнения сложных, многоэтапных задач. Жан-Станислас Денен, старший исследователь Epoch AI, объяснил TechCrunch: "Сегодняшние тесты более сложные, хотя общее количество вопросов в тестах уменьшилось. Они часто пытаются оценить способность моделей выполнять реальные задачи, такие как написание и выполнение кода, просмотр интернета и использование компьютеров."

Денен также отметил, что стоимость одного токена для самых дорогих моделей растёт. Например, когда модель Claude 3 Opus от Anthropic была выпущена в мае 2024 года, она стоила $75 за миллион выходных токенов. В то же время модели GPT-4.5 и o1-pro от OpenAI, выпущенные ранее в том же году, стоили $150 и $600 за миллион выходных токенов соответственно.

Несмотря на рост стоимости за токен, Денен отметил: "Поскольку модели со временем становятся лучше, всё ещё верно, что затраты на достижение определённого уровня производительности значительно снизились. Но если вы хотите оценить лучшие крупные модели в любой момент времени, вы всё равно платите больше."

Целостность тестирования

Многие лаборатории ИИ, включая OpenAI, предлагают бесплатный или субсидируемый доступ к своим моделям для целей тестирования. Однако эта практика вызывает вопросы о целостности процесса оценки. Даже без доказательств манипуляций, само предположение о вовлечённости лаборатории ИИ может поставить под сомнение объективность результатов.

Росс Тейлор выразил эту озабоченность на X, задав вопрос: "С научной точки зрения, если вы публикуете результат, который никто не может воспроизвести с той же моделью, является ли это вообще наукой? (Было ли это когда-либо наукой, лол)"

Высокие затраты и потенциальные предвзятости в тестировании ИИ подчёркивают проблемы, с которыми сталкивается эта область, стремящаяся разрабатывать и проверять всё более сложные модели.

Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи. Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи. В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
чат-бот Лучшие приложения для ролевых чатов с ИИ для практики языка, подготовки к собеседованиям и ежедневной разговорной практики
Лучшие приложения для ролевых чатов с ИИ для практики языка, подготовки к собеседованиям и ежедневной разговорной практики

2026 г. — новейшие, лучшие и наиболее рейтинговые приложения для ИИ-ролевых чатов, предназначенные для практики языка, подготовки к собеседованиям и ежедневной беглости речи! XIX.AI предлагает мощную коллекцию, меняющую правила игры: бесплатные и платные варианты, реальные тесты и обновляемые еженедельно рейтинги. Эти обязательные к использованию инструменты помогут вам улучшить навыки письма, преодолеть трудности с беглостью и повысить эффективность общения во всех повседневных ситуациях. Исследуйте сейчас, чтобы найти идеальный инструмент для развития вашего языка!

10 инструментов
xix.ai
Музыкальная композиция Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.
Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.

2026 год: лучшие и наиболее высоко оценённые инструменты для разделения аудиосигналов с использованием ИИ, отобранные специально для работы над ремиксами, подготовки образцов звука и создания караоке-версий. Эти мощные революционные инструменты проходят реальные тесты, обеспечивая точную изоляцию аудиосигналов и значительно повышая производительность. XIX.AI предоставляет еженедельно обновляемый бесплатный справочник сравнения платных и бесплатных решений, который поможет вам найти оптимальный вариант, соответствующий вашим потребностям. Ознакомьтесь с ним прямо сейчас, чтобы раскрыть потенциал ИИ в вашей работе.

8 инструментов
xix.ai
Анализ данных ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.
ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.

2026 год: лучшие AI-ассистенты для SQL, занявшие верхние строчки рейтингов! XIX.AI собрал мощный набор инструментов, регулярно обновляемый на основе реальных тестов. Эти неотъемлемые инструменты помогают создавать точные дашборды с данными о доходах, анализировать каналы продаж и оперативно отслеживать показатели продуктов, значительно повышая производительность. Ознакомьтесь сейчас, чтобы найти идеальный инструмент для принятия решений на основе данных! 238 символов

9 инструментов
xix.ai
Музыкальная композиция Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен
Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен

2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!

8 инструментов
xix.ai
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Комментарии (18)
0/500
PatrickCarter
PatrickCarter 12 сентября 2026 г., 23:00:09 GMT+03:00

推理模型确实强大,但算钱如流水,普通开发者怎么跟大厂卷?😂

FrankJackson
FrankJackson 10 августа 2025 г., 12:01:00 GMT+03:00

These AI reasoning models are impressive for tackling complex physics problems step by step, but the surging benchmarking costs could stifle innovation for smaller labs. 😟 Reminds me of how tech giants dominate—maybe we need more affordable alternatives?

DouglasRodriguez
DouglasRodriguez 28 июля 2025 г., 4:20:21 GMT+03:00

These AI reasoning models sound cool, but the skyrocketing benchmarking costs are wild! 😳 Makes me wonder if smaller labs can even keep up with the big players like OpenAI.

StevenGonzalez
StevenGonzalez 24 апреля 2025 г., 15:58:05 GMT+03:00

These AI reasoning models are impressive, but the rising costs of benchmarking are a real bummer. It's great for fields like physics, but I hope they find a way to make it more affordable. Otherwise, it's just for the big players. 😕

JackPerez
JackPerez 24 апреля 2025 г., 10:52:48 GMT+03:00

Esses modelos de raciocínio de IA são impressionantes, mas o aumento dos custos de benchmarking é uma decepção. É ótimo para áreas como a física, mas espero que encontrem uma maneira de torná-lo mais acessível. Caso contrário, será apenas para os grandes jogadores. 😕

GregoryJones
GregoryJones 24 апреля 2025 г., 10:10:43 GMT+03:00

AI推論モデルは素晴らしいけど、ベンチマーキングのコストが上がるのは残念です。物理分野には良いけど、もっと手頃な価格になる方法を見つけてほしいです。さもないと、大手企業だけのものになってしまいますね。😕

OR