вариант
Дом
Новости
Эксперты выделяют серьезные недостатки в краудсорсинговых тестах ИИ

Эксперты выделяют серьезные недостатки в краудсорсинговых тестах ИИ

25 апреля 2025 г.
210

Эксперты выделяют серьезные недостатки в краудсорсинговых тестах ИИ

Лаборатории ИИ всё чаще обращаются к платформам краудсорсингового бенчмаркинга, таким как Chatbot Arena, для оценки возможностей своих новейших моделей. Однако некоторые эксперты утверждают, что этот метод вызывает серьёзные этические и академические вопросы.

В последние годы крупные игроки, такие как OpenAI, Google и Meta, используют платформы, которые привлекают пользователей для оценки производительности их будущих моделей. Высокий балл на этих платформах часто подчёркивается лабораториями как свидетельство прогресса их модели. Однако этот подход не обходится без критики.

Критика краудсорсингового бенчмаркинга

Эмили Бендер, профессор лингвистики в Университете Вашингтона и соавтор книги "The AI Con", выразила обеспокоенность по поводу валидности таких бенчмарков, в частности Chatbot Arena. Эта платформа предполагает, что волонтёры сравнивают ответы двух анонимных моделей и выбирают предпочтительный. Бендер утверждает, что для эффективности бенчмарка он должен измерять что-то конкретное и демонстрировать конструктивную валидность, то есть измерение должно точно отражать оцениваемый конструкт. Она считает, что Chatbot Arena не имеет доказательств того, что предпочтение пользователей одного ответа над другим действительно коррелирует с какими-либо определёнными критериями.

Асмелаш Тека Хадгу, сооснователь компании Lesan, занимающейся ИИ, и сотрудник Института распределённых исследований ИИ, предполагает, что эти бенчмарки используются лабораториями ИИ для преувеличенных заявлений о своих моделях. Он упомянул недавний инцидент с моделью Llama 4 Maverick от Meta, где Meta оптимизировала версию для хороших результатов на Chatbot Arena, но решила выпустить менее эффективную версию. Хадгу выступает за то, чтобы бенчмарки были динамическими, распределёнными между несколькими независимыми организациями и адаптированными к конкретным случаям использования в таких областях, как образование и здравоохранение, профессионалами, которые применяют эти модели в своей работе.

Призыв к справедливой оплате и более широким методам оценки

Хадгу и Кристин Глория, бывший руководитель инициативы по новым и интеллектуальным технологиям Института Аспена, утверждают, что оценщики должны получать компенсацию за свою работу, проводя параллели с часто эксплуататорской индустрией маркировки данных. Глория считает краудсорсинговый бенчмаркинг ценным, подобно инициативам гражданской науки, но подчёркивает, что бенчмарки не должны быть единственным критерием оценки, особенно учитывая быстрый темп инноваций в отрасли.

Мэтт Фредриксон, генеральный директор Gray Swan AI, проводящей краудсорсинговые кампании по тестированию на уязвимости, признаёт привлекательность таких платформ для волонтёров, стремящихся изучать и практиковать новые навыки. Однако он подчёркивает, что публичные бенчмарки не могут заменить более глубокие оценки, предоставляемые платными частными экспертизами. Фредриксон предлагает, чтобы разработчики также полагались на внутренние бенчмарки, алгоритмические команды по тестированию уязвимостей и привлечённых экспертов, которые могут предложить более открытые и специфичные для домена выводы.

Взгляды индустрии на бенчмаркинг

Алекс Аталлах, генеральный директор модельного маркетплейса OpenRouter, и Вэй-Лин Чан, докторант по ИИ в Калифорнийском университете в Беркли и один из основателей LMArena (управляющей Chatbot Arena), согласны, что открытые тестирования и бенчмаркинг сами по себе недостаточны. Чан подчёркивает, что цель LMArena — предоставить надёжное, открытое пространство для оценки предпочтений сообщества относительно различных моделей ИИ.

Касаясь споров вокруг бенчмарка Maverick, Чан уточняет, что такие инциденты связаны не с недостатками в дизайне Chatbot Arena, а с неверной интерпретацией её политики лабораториями. LMArena с тех пор обновила свои правила, чтобы обеспечить справедливые и воспроизводимые оценки. Чан подчёркивает, что сообщество платформы — это не просто группа волонтёров или тестировщиков, а вовлечённая группа, которая предоставляет коллективную обратную связь по моделям ИИ.

Продолжающиеся дебаты вокруг использования платформ краудсорсингового бенчмаркинга подчёркивают необходимость более тонкого подхода к оценке моделей ИИ, сочетающего общественный вклад с тщательными профессиональными оценками для обеспечения точности и справедливости.

Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи. Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи. В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
чат-бот Лучшие приложения для ролевых чатов с ИИ для практики языка, подготовки к собеседованиям и ежедневной разговорной практики
Лучшие приложения для ролевых чатов с ИИ для практики языка, подготовки к собеседованиям и ежедневной разговорной практики

2026 г. — новейшие, лучшие и наиболее рейтинговые приложения для ИИ-ролевых чатов, предназначенные для практики языка, подготовки к собеседованиям и ежедневной беглости речи! XIX.AI предлагает мощную коллекцию, меняющую правила игры: бесплатные и платные варианты, реальные тесты и обновляемые еженедельно рейтинги. Эти обязательные к использованию инструменты помогут вам улучшить навыки письма, преодолеть трудности с беглостью и повысить эффективность общения во всех повседневных ситуациях. Исследуйте сейчас, чтобы найти идеальный инструмент для развития вашего языка!

10 инструментов
xix.ai
Музыкальная композиция Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.
Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.

2026 год: лучшие и наиболее высоко оценённые инструменты для разделения аудиосигналов с использованием ИИ, отобранные специально для работы над ремиксами, подготовки образцов звука и создания караоке-версий. Эти мощные революционные инструменты проходят реальные тесты, обеспечивая точную изоляцию аудиосигналов и значительно повышая производительность. XIX.AI предоставляет еженедельно обновляемый бесплатный справочник сравнения платных и бесплатных решений, который поможет вам найти оптимальный вариант, соответствующий вашим потребностям. Ознакомьтесь с ним прямо сейчас, чтобы раскрыть потенциал ИИ в вашей работе.

8 инструментов
xix.ai
Анализ данных ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.
ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.

2026 год: лучшие AI-ассистенты для SQL, занявшие верхние строчки рейтингов! XIX.AI собрал мощный набор инструментов, регулярно обновляемый на основе реальных тестов. Эти неотъемлемые инструменты помогают создавать точные дашборды с данными о доходах, анализировать каналы продаж и оперативно отслеживать показатели продуктов, значительно повышая производительность. Ознакомьтесь сейчас, чтобы найти идеальный инструмент для принятия решений на основе данных! 238 символов

9 инструментов
xix.ai
Музыкальная композиция Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен
Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен

2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!

8 инструментов
xix.ai
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Комментарии (17)
0/500
EricDavis
EricDavis 19 мая 2026 г., 19:00:14 GMT+03:00

這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔

AlbertScott
AlbertScott 1 августа 2025 г., 16:47:34 GMT+03:00

Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?

JonathanAllen
JonathanAllen 27 апреля 2025 г., 10:34:07 GMT+03:00

Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅

AlbertWalker
AlbertWalker 27 апреля 2025 г., 8:24:31 GMT+03:00

Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀

RogerRodriguez
RogerRodriguez 27 апреля 2025 г., 6:52:29 GMT+03:00

I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅

JonathanAllen
JonathanAllen 27 апреля 2025 г., 4:40:09 GMT+03:00

Intéressant, mais inquiétant ! Les benchmarks par crowdsourcing, c’est innovant, mais les failles éthiques me font réfléchir. Les géants comme Google vont devoir être transparents. 🧐

OR