専門家は、クラウドソーシングされたAIベンチマークの深刻な欠陥を強調しています

AIラボは、最新モデルの能力を評価するために、Chatbot Arenaのようなクラウドソーシングによるベンチマークプラットフォームにますます注目しています。しかし、一部の専門家は、この方法が重大な倫理的および学術的な懸念を引き起こすと主張しています。
近年、OpenAI、Google、Metaなどの主要企業は、ユーザーを巻き込んで次期モデルのパフォーマンスを評価するプラットフォームを活用してきました。これらのプラットフォームでの高スコアは、ラボがモデルの進歩の証として強調することがよくあります。しかし、このアプローチには批判もあります。
クラウドソーシングベンチマークの批判
ワシントン大学の言語学教授であり、「The AI Con」の共著者であるエミリー・ベンダー氏は、特にChatbot Arenaのようなベンチマークの妥当性について懸念を表明しています。このプラットフォームでは、ボランティアが2つの匿名モデルの応答を比較し、好みのものを選択します。ベンダー氏は、ベンチマークが有効であるためには、特定のものを測定し、構成妥当性(測定が評価対象の構成を正確に反映すること)を示す必要があると主張します。彼女は、Chatbot Arenaには、ユーザーが一方の出力結果を他方よりも好むことが、定義された基準と本当に関連しているという証拠が欠けていると述べています。
AI企業Lesanの共同創業者であり、Distributed AI Research Instituteのフェローであるアスメラシュ・テカ・ハドゥ氏は、これらのベンチマークがAIラボによってモデルの誇張された主張のために悪用されていると示唆しています。彼は、MetaのLlama 4 Maverickモデルに関する最近の事例を挙げ、MetaがChatbot Arenaで良好なパフォーマンスを発揮するように微調整したバージョンを作成したが、代わりに効果の低いバージョンをリリースしたと指摘しました。ハドゥ氏は、ベンチマークは動的で、複数の独立した組織に分散され、教育や医療などの分野でモデルを使用する専門家によって特定のユースケースに合わせて調整されるべきだと主張しています。
公正な報酬とより広範な評価方法の必要性
ハドゥ氏と、Aspen InstituteのEmergent and Intelligent Technologies Initiativeの元リーダーであるクリスティン・グロリア氏は、評価者はその労働に対して報酬を受けるべきだと主張し、しばしば搾取的なデータラベリング業界と比較しています。グロリア氏は、クラウドソーシングによるベンチマークを市民科学イニシアチブに似た価値あるものと見なしていますが、特に業界の急速な革新のペースを考慮すると、ベンチマークが評価の唯一の基準であってはならないと強調しています。
クラウドソーシングによるレッドチームキャンペーンを実施するGray Swan AIのCEO、マット・フレドリクソン氏は、新しいスキルを学び、練習したいボランティアにとってそのようなプラットフォームの魅力があることを認めています。しかし、彼は公開ベンチマークが、有料のプライベート評価によるより詳細な評価を置き換えることはできないと強調します。フレドリクソン氏は、開発者は内部ベンチマーク、アルゴリズムによるレッドチーム、そしてよりオープンエンドでドメイン固有の洞察を提供できる契約専門家にも依存すべきだと提案しています。
ベンチマークに関する業界の視点
モデルマーケットプレイスOpenRouterのCEO、アレックス・アタラ氏と、Chatbot Arenaを管理するLMArenaの創設者の一人でカリフォルニア大学バークレー校のAI博士課程学生であるウェイリン・チアン氏は、オープンテストとベンチマークだけでは不十分であることに同意しています。チアン氏は、LMArenaの目標は、さまざまなAIモデルに関するコミュニティの好みを測定する信頼できるオープンな場を提供することだと強調しています。
Maverickベンチマークをめぐる論争について、チアン氏は、そのような事件はChatbot Arenaの設計上の欠陥によるものではなく、ラボによるポリシーの誤解によるものだと明確にしています。LMArenaは以来、公正で再現可能な評価を確保するためにポリシーを更新しました。チアン氏は、プラットフォームのコミュニティは単なるボランティアやテスターの集まりではなく、AIモデルに対する集団的なフィードバックを提供する積極的なグループだと強調しています。
クラウドソーシングベンチマークプラットフォームの使用をめぐる議論は、公開の意見と厳格な専門的評価を組み合わせた、よりニュアンスのあるAIモデル評価のアプローチが必要であることを浮き彫りにしています。これにより、正確さと公平性の両方が確保されます。
関連記事
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
中国はGaokam中にAIモデルをロックし、即時の宿題支援をブロックしている
2026年の大学入試(Gaokao)が間近に迫る中、試験期間中にAIツールの利用停止に関する噂がインターネット上で激しい議論を巻き起こしている。世間の懸念に応えるため、主要なAIプラットフォームおよび教育アプリは、完全な禁止ではなく、試験関連機能に対して対象を絞った「時間制限ロック」を実施する方針を明らかにした。これらのプラットフォームは、正確な時間ベースの制御メカニズムを採用している。公式の試験時間中には、写真による問題解決や問題分析などの機能が一時的に無効化される。しかし、日常の会話機能や
関連特集おすすめ
コメント (17)
0/500
這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔
Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?
Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅
Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀
I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅

AIラボは、最新モデルの能力を評価するために、Chatbot Arenaのようなクラウドソーシングによるベンチマークプラットフォームにますます注目しています。しかし、一部の専門家は、この方法が重大な倫理的および学術的な懸念を引き起こすと主張しています。
近年、OpenAI、Google、Metaなどの主要企業は、ユーザーを巻き込んで次期モデルのパフォーマンスを評価するプラットフォームを活用してきました。これらのプラットフォームでの高スコアは、ラボがモデルの進歩の証として強調することがよくあります。しかし、このアプローチには批判もあります。
クラウドソーシングベンチマークの批判
ワシントン大学の言語学教授であり、「The AI Con」の共著者であるエミリー・ベンダー氏は、特にChatbot Arenaのようなベンチマークの妥当性について懸念を表明しています。このプラットフォームでは、ボランティアが2つの匿名モデルの応答を比較し、好みのものを選択します。ベンダー氏は、ベンチマークが有効であるためには、特定のものを測定し、構成妥当性(測定が評価対象の構成を正確に反映すること)を示す必要があると主張します。彼女は、Chatbot Arenaには、ユーザーが一方の出力結果を他方よりも好むことが、定義された基準と本当に関連しているという証拠が欠けていると述べています。
AI企業Lesanの共同創業者であり、Distributed AI Research Instituteのフェローであるアスメラシュ・テカ・ハドゥ氏は、これらのベンチマークがAIラボによってモデルの誇張された主張のために悪用されていると示唆しています。彼は、MetaのLlama 4 Maverickモデルに関する最近の事例を挙げ、MetaがChatbot Arenaで良好なパフォーマンスを発揮するように微調整したバージョンを作成したが、代わりに効果の低いバージョンをリリースしたと指摘しました。ハドゥ氏は、ベンチマークは動的で、複数の独立した組織に分散され、教育や医療などの分野でモデルを使用する専門家によって特定のユースケースに合わせて調整されるべきだと主張しています。
公正な報酬とより広範な評価方法の必要性
ハドゥ氏と、Aspen InstituteのEmergent and Intelligent Technologies Initiativeの元リーダーであるクリスティン・グロリア氏は、評価者はその労働に対して報酬を受けるべきだと主張し、しばしば搾取的なデータラベリング業界と比較しています。グロリア氏は、クラウドソーシングによるベンチマークを市民科学イニシアチブに似た価値あるものと見なしていますが、特に業界の急速な革新のペースを考慮すると、ベンチマークが評価の唯一の基準であってはならないと強調しています。
クラウドソーシングによるレッドチームキャンペーンを実施するGray Swan AIのCEO、マット・フレドリクソン氏は、新しいスキルを学び、練習したいボランティアにとってそのようなプラットフォームの魅力があることを認めています。しかし、彼は公開ベンチマークが、有料のプライベート評価によるより詳細な評価を置き換えることはできないと強調します。フレドリクソン氏は、開発者は内部ベンチマーク、アルゴリズムによるレッドチーム、そしてよりオープンエンドでドメイン固有の洞察を提供できる契約専門家にも依存すべきだと提案しています。
ベンチマークに関する業界の視点
モデルマーケットプレイスOpenRouterのCEO、アレックス・アタラ氏と、Chatbot Arenaを管理するLMArenaの創設者の一人でカリフォルニア大学バークレー校のAI博士課程学生であるウェイリン・チアン氏は、オープンテストとベンチマークだけでは不十分であることに同意しています。チアン氏は、LMArenaの目標は、さまざまなAIモデルに関するコミュニティの好みを測定する信頼できるオープンな場を提供することだと強調しています。
Maverickベンチマークをめぐる論争について、チアン氏は、そのような事件はChatbot Arenaの設計上の欠陥によるものではなく、ラボによるポリシーの誤解によるものだと明確にしています。LMArenaは以来、公正で再現可能な評価を確保するためにポリシーを更新しました。チアン氏は、プラットフォームのコミュニティは単なるボランティアやテスターの集まりではなく、AIモデルに対する集団的なフィードバックを提供する積極的なグループだと強調しています。
クラウドソーシングベンチマークプラットフォームの使用をめぐる議論は、公開の意見と厳格な専門的評価を組み合わせた、よりニュアンスのあるAIモデル評価のアプローチが必要であることを浮き彫りにしています。これにより、正確さと公平性の両方が確保されます。
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
中国はGaokam中にAIモデルをロックし、即時の宿題支援をブロックしている
2026年の大学入試(Gaokao)が間近に迫る中、試験期間中にAIツールの利用停止に関する噂がインターネット上で激しい議論を巻き起こしている。世間の懸念に応えるため、主要なAIプラットフォームおよび教育アプリは、完全な禁止ではなく、試験関連機能に対して対象を絞った「時間制限ロック」を実施する方針を明らかにした。これらのプラットフォームは、正確な時間ベースの制御メカニズムを採用している。公式の試験時間中には、写真による問題解決や問題分析などの機能が一時的に無効化される。しかし、日常の会話機能や
這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔
Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?
Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅
Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀
I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅





家






