Maison
Les experts mettent en évidence de graves défauts dans les repères d'IA crowdsourcés

Les laboratoires d'IA se tournent de plus en plus vers des plateformes de benchmarking participatif comme Chatbot Arena pour évaluer les capacités de leurs derniers modèles. Cependant, certains experts estiment que cette méthode soulève d'importantes préoccupations éthiques et académiques.
Ces dernières années, des acteurs majeurs comme OpenAI, Google et Meta ont utilisé des plateformes engageant les utilisateurs pour évaluer les performances de leurs modèles à venir. Un score élevé sur ces plateformes est souvent mis en avant par les laboratoires comme preuve de l'avancement de leur modèle. Toutefois, cette approche ne manque pas de critiques.
La critique du benchmarking participatif
Emily Bender, professeure de linguistique à l'Université de Washington et co-auteure de "The AI Con," a exprimé des inquiétudes quant à la validité de ces benchmarks, en particulier Chatbot Arena. Cette plateforme implique des volontaires comparant les réponses de deux modèles anonymes et choisissant leur préféré. Bender soutient qu'un benchmark efficace doit mesurer quelque chose de spécifique et démontrer une validité de construit, c'est-à-dire que la mesure doit refléter précisément le concept évalué. Elle affirme que Chatbot Arena manque de preuves que les préférences des utilisateurs pour une sortie par rapport à une autre correspondent réellement à des critères définis.
Asmelash Teka Hadgu, co-fondateur de l'entreprise d'IA Lesan et membre du Distributed AI Research Institute, suggère que ces benchmarks sont exploités par les laboratoires d'IA pour faire des revendications exagérées sur leurs modèles. Il a cité un incident récent avec le modèle Llama 4 Maverick de Meta, où Meta a affiné une version pour performer sur Chatbot Arena mais a choisi de publier une version moins efficace. Hadgu prône des benchmarks dynamiques, distribués entre plusieurs entités indépendantes et adaptés à des cas d'usage spécifiques dans des domaines comme l'éducation et la santé par des professionnels utilisant ces modèles dans leur travail.
L'appel à une rémunération équitable et à des méthodes d'évaluation plus larges
Hadgu et Kristine Gloria, ancienne dirigeante de l'Initiative sur les technologies émergentes et intelligentes de l'Aspen Institute, soutiennent que les évaluateurs devraient être rémunérés pour leur travail, en comparaison avec l'industrie souvent exploiteuse de l'étiquetage de données. Gloria considère le benchmarking participatif comme précieux, semblable aux initiatives de science citoyenne, mais souligne que les benchmarks ne devraient pas être la seule mesure d'évaluation, surtout compte tenu du rythme rapide de l'innovation industrielle.
Matt Fredrikson, PDG de Gray Swan AI, qui mène des campagnes de red teaming participatif, reconnaît l'attrait de ces plateformes pour les volontaires cherchant à apprendre et pratiquer de nouvelles compétences. Cependant, il insiste sur le fait que les benchmarks publics ne peuvent remplacer les évaluations plus approfondies fournies par des assessments privés rémunérés. Fredrikson suggère que les développeurs devraient également s'appuyer sur des benchmarks internes, des équipes rouges algorithmiques et des experts contractuels capables d'offrir des perspectives plus ouvertes et spécifiques au domaine.
Perspectives de l'industrie sur le benchmarking
Alex Atallah, PDG du marché de modèles OpenRouter, et Wei-Lin Chiang, doctorant en IA à l'UC Berkeley et l'un des fondateurs de LMArena (qui gère Chatbot Arena), conviennent que les tests et benchmarks ouverts seuls sont insuffisants. Chiang souligne que l'objectif de LMArena est de fournir un espace ouvert et fiable pour évaluer les préférences de la communauté concernant différents modèles d'IA.
En réponse à la controverse autour du benchmark Maverick, Chiang précise que ces incidents ne sont pas dus à des failles dans la conception de Chatbot Arena, mais plutôt à des mauvaises interprétations de ses politiques par les laboratoires. LMArena a depuis mis à jour ses politiques pour garantir des évaluations justes et reproductibles. Chiang souligne que la communauté de la plateforme n'est pas simplement un groupe de volontaires ou de testeurs, mais un groupe engagé qui fournit un retour collectif sur les modèles d'IA.
Le débat en cours autour de l'utilisation des plateformes de benchmarking participatif met en lumière la nécessité d'une approche plus nuancée de l'évaluation des modèles d'IA, combinant les contributions du public avec des assessments professionnels rigoureux pour garantir à la fois précision et équité.
Article connexe
Anthropic étend ses outils de codage IA Claude au Japon dans le cadre de sa stratégie de croissance à l’étranger
Anthropic, une entreprise américaine d’intelligence artificielle de premier plan, intensifie sa portée mondiale. Mercredi, l’entreprise a organisé une grande réunion de développeurs, « Code with Claude », à Tokyo, rassemblant près de 500 ingénieurs l
Le géant indien du logiciel réduit ses embauches et promet des licenciements nuls à mesure que les agents IA se développent
Alors que l’intelligence artificielle redéfinit les modèles d’affaires traditionnellement intensifs en main-d’œuvre, Tata Consultancy Services (TCS), l’un des principaux prestataires indiens de sous-traitance logicielle, a dévoilé sa réponse stratégi
La Chine verrouille les modèles d'IA pendant le Gaokao pour bloquer l'aide instantanée aux devoirs
Avec l’approche rapide du Gaokao 2026, les rumeurs concernant la suspension des outils d’intelligence artificielle pendant la période d’examen ont déclenché un intense débat en ligne. En réponse aux préoccupations du public, les principales plateform
Recommandations de sujets spéciaux liés
commentaires (17)
這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔
Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?
Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅
Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀
I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅

Les laboratoires d'IA se tournent de plus en plus vers des plateformes de benchmarking participatif comme Chatbot Arena pour évaluer les capacités de leurs derniers modèles. Cependant, certains experts estiment que cette méthode soulève d'importantes préoccupations éthiques et académiques.
Ces dernières années, des acteurs majeurs comme OpenAI, Google et Meta ont utilisé des plateformes engageant les utilisateurs pour évaluer les performances de leurs modèles à venir. Un score élevé sur ces plateformes est souvent mis en avant par les laboratoires comme preuve de l'avancement de leur modèle. Toutefois, cette approche ne manque pas de critiques.
La critique du benchmarking participatif
Emily Bender, professeure de linguistique à l'Université de Washington et co-auteure de "The AI Con," a exprimé des inquiétudes quant à la validité de ces benchmarks, en particulier Chatbot Arena. Cette plateforme implique des volontaires comparant les réponses de deux modèles anonymes et choisissant leur préféré. Bender soutient qu'un benchmark efficace doit mesurer quelque chose de spécifique et démontrer une validité de construit, c'est-à-dire que la mesure doit refléter précisément le concept évalué. Elle affirme que Chatbot Arena manque de preuves que les préférences des utilisateurs pour une sortie par rapport à une autre correspondent réellement à des critères définis.
Asmelash Teka Hadgu, co-fondateur de l'entreprise d'IA Lesan et membre du Distributed AI Research Institute, suggère que ces benchmarks sont exploités par les laboratoires d'IA pour faire des revendications exagérées sur leurs modèles. Il a cité un incident récent avec le modèle Llama 4 Maverick de Meta, où Meta a affiné une version pour performer sur Chatbot Arena mais a choisi de publier une version moins efficace. Hadgu prône des benchmarks dynamiques, distribués entre plusieurs entités indépendantes et adaptés à des cas d'usage spécifiques dans des domaines comme l'éducation et la santé par des professionnels utilisant ces modèles dans leur travail.
L'appel à une rémunération équitable et à des méthodes d'évaluation plus larges
Hadgu et Kristine Gloria, ancienne dirigeante de l'Initiative sur les technologies émergentes et intelligentes de l'Aspen Institute, soutiennent que les évaluateurs devraient être rémunérés pour leur travail, en comparaison avec l'industrie souvent exploiteuse de l'étiquetage de données. Gloria considère le benchmarking participatif comme précieux, semblable aux initiatives de science citoyenne, mais souligne que les benchmarks ne devraient pas être la seule mesure d'évaluation, surtout compte tenu du rythme rapide de l'innovation industrielle.
Matt Fredrikson, PDG de Gray Swan AI, qui mène des campagnes de red teaming participatif, reconnaît l'attrait de ces plateformes pour les volontaires cherchant à apprendre et pratiquer de nouvelles compétences. Cependant, il insiste sur le fait que les benchmarks publics ne peuvent remplacer les évaluations plus approfondies fournies par des assessments privés rémunérés. Fredrikson suggère que les développeurs devraient également s'appuyer sur des benchmarks internes, des équipes rouges algorithmiques et des experts contractuels capables d'offrir des perspectives plus ouvertes et spécifiques au domaine.
Perspectives de l'industrie sur le benchmarking
Alex Atallah, PDG du marché de modèles OpenRouter, et Wei-Lin Chiang, doctorant en IA à l'UC Berkeley et l'un des fondateurs de LMArena (qui gère Chatbot Arena), conviennent que les tests et benchmarks ouverts seuls sont insuffisants. Chiang souligne que l'objectif de LMArena est de fournir un espace ouvert et fiable pour évaluer les préférences de la communauté concernant différents modèles d'IA.
En réponse à la controverse autour du benchmark Maverick, Chiang précise que ces incidents ne sont pas dus à des failles dans la conception de Chatbot Arena, mais plutôt à des mauvaises interprétations de ses politiques par les laboratoires. LMArena a depuis mis à jour ses politiques pour garantir des évaluations justes et reproductibles. Chiang souligne que la communauté de la plateforme n'est pas simplement un groupe de volontaires ou de testeurs, mais un groupe engagé qui fournit un retour collectif sur les modèles d'IA.
Le débat en cours autour de l'utilisation des plateformes de benchmarking participatif met en lumière la nécessité d'une approche plus nuancée de l'évaluation des modèles d'IA, combinant les contributions du public avec des assessments professionnels rigoureux pour garantir à la fois précision et équité.
Anthropic étend ses outils de codage IA Claude au Japon dans le cadre de sa stratégie de croissance à l’étranger
Anthropic, une entreprise américaine d’intelligence artificielle de premier plan, intensifie sa portée mondiale. Mercredi, l’entreprise a organisé une grande réunion de développeurs, « Code with Claude », à Tokyo, rassemblant près de 500 ingénieurs l
Le géant indien du logiciel réduit ses embauches et promet des licenciements nuls à mesure que les agents IA se développent
Alors que l’intelligence artificielle redéfinit les modèles d’affaires traditionnellement intensifs en main-d’œuvre, Tata Consultancy Services (TCS), l’un des principaux prestataires indiens de sous-traitance logicielle, a dévoilé sa réponse stratégi
La Chine verrouille les modèles d'IA pendant le Gaokao pour bloquer l'aide instantanée aux devoirs
Avec l’approche rapide du Gaokao 2026, les rumeurs concernant la suspension des outils d’intelligence artificielle pendant la période d’examen ont déclenché un intense débat en ligne. En réponse aux préoccupations du public, les principales plateform
這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔
Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?
Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅
Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀
I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅











