專家強調了眾包AI基準的嚴重缺陷

AI實驗室日益轉向眾包基準平台,如Chatbot Arena,以評估其最新模型的能力。然而,一些專家認為此方法引發重大倫理與學術問題。
近年來,OpenAI、Google和Meta等主要業者已利用平台讓用戶評估其即將推出的模型表現。在這些平台上的高分常被實驗室用來證明其模型的進步。然而,此方法並非無人批評。
眾包基準的批評
華盛頓大學語言學教授、《The AI Con》合著者Emily Bender對此類基準的有效性表示擔憂,特別是Chatbot Arena。此平台讓志願者比較兩個匿名模型的回應並選擇偏好。Bender認為,一個有效的基準必須測量特定內容並展示結構效度,意即測量應準確反映被評估的結構。她認為Chatbot Arena缺乏證據證明用戶對某輸出的偏好與任何定義標準真正相關。
AI公司Lesan聯合創始人、Distributed AI Research Institute研究員Asmelash Teka Hadgu表示,這些基準被AI實驗室用來誇大其模型的聲稱。他提到Meta的Llama 4 Maverick模型近期事件,Meta微調版本以在Chatbot Arena表現出色,但選擇發布較低效版本。Hadgu主張基準應動態、分散於多個獨立實體,並由教育、醫療等領域使用模型的專業人士為特定用途量身定制。
公平報酬與更廣泛評估方法的呼聲
Hadgu與Aspen Institute新興與智能技術倡議前負責人Kristine Gloria認為,評估者應因其工作獲得報酬,類比於常具剝削性的數據標籤行業。Gloria認為眾包基準有價值,類似公民科學計畫,但強調基準不應是唯一評估標準,尤其考慮到行業創新的快速步伐。
Gray Swan AI執行長Matt Fredrikson,負責眾包紅隊活動,認同此類平台對志願者學習與練習新技能的吸引力。但他強調,公開基準無法取代付費私人評估的深入分析。Fredrikson建議開發者應依賴內部基準、算法紅隊及聘請專家,提供更開放與領域特定的見解。
業界對基準的看法
模型市場OpenRouter執行長Alex Atallah與加州大學伯克利分校AI博士生、LMArena(管理Chatbot Arena)創始人之一Wei-Lin Chiang同意,僅靠公開測試與基準不足。Chiang強調,LMArena的目標是提供可信、開放的空間,以衡量社群對不同AI模型的偏好。
針對Maverick基準爭議,Chiang澄清此類事件非因Chatbot Arena設計缺陷,而是實驗室對其政策的誤解。LMArena已更新政策,確保公平與可重現的評估。Chiang強調,該平台社群不僅是志願者或測試者,而是一個提供AI模型集體反饋的參與群體。
關於眾包基準平台使用的持續爭論,凸顯需更細緻的AI模型評估方法,結合公開意見與嚴謹專業評估,確保準確與公平。
相關文章
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手
連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
相關專題推薦
評論 (17)
0/500
這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔
Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?
Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅
Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀
I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅

AI實驗室日益轉向眾包基準平台,如Chatbot Arena,以評估其最新模型的能力。然而,一些專家認為此方法引發重大倫理與學術問題。
近年來,OpenAI、Google和Meta等主要業者已利用平台讓用戶評估其即將推出的模型表現。在這些平台上的高分常被實驗室用來證明其模型的進步。然而,此方法並非無人批評。
眾包基準的批評
華盛頓大學語言學教授、《The AI Con》合著者Emily Bender對此類基準的有效性表示擔憂,特別是Chatbot Arena。此平台讓志願者比較兩個匿名模型的回應並選擇偏好。Bender認為,一個有效的基準必須測量特定內容並展示結構效度,意即測量應準確反映被評估的結構。她認為Chatbot Arena缺乏證據證明用戶對某輸出的偏好與任何定義標準真正相關。
AI公司Lesan聯合創始人、Distributed AI Research Institute研究員Asmelash Teka Hadgu表示,這些基準被AI實驗室用來誇大其模型的聲稱。他提到Meta的Llama 4 Maverick模型近期事件,Meta微調版本以在Chatbot Arena表現出色,但選擇發布較低效版本。Hadgu主張基準應動態、分散於多個獨立實體,並由教育、醫療等領域使用模型的專業人士為特定用途量身定制。
公平報酬與更廣泛評估方法的呼聲
Hadgu與Aspen Institute新興與智能技術倡議前負責人Kristine Gloria認為,評估者應因其工作獲得報酬,類比於常具剝削性的數據標籤行業。Gloria認為眾包基準有價值,類似公民科學計畫,但強調基準不應是唯一評估標準,尤其考慮到行業創新的快速步伐。
Gray Swan AI執行長Matt Fredrikson,負責眾包紅隊活動,認同此類平台對志願者學習與練習新技能的吸引力。但他強調,公開基準無法取代付費私人評估的深入分析。Fredrikson建議開發者應依賴內部基準、算法紅隊及聘請專家,提供更開放與領域特定的見解。
業界對基準的看法
模型市場OpenRouter執行長Alex Atallah與加州大學伯克利分校AI博士生、LMArena(管理Chatbot Arena)創始人之一Wei-Lin Chiang同意,僅靠公開測試與基準不足。Chiang強調,LMArena的目標是提供可信、開放的空間,以衡量社群對不同AI模型的偏好。
針對Maverick基準爭議,Chiang澄清此類事件非因Chatbot Arena設計缺陷,而是實驗室對其政策的誤解。LMArena已更新政策,確保公平與可重現的評估。Chiang強調,該平台社群不僅是志願者或測試者,而是一個提供AI模型集體反饋的參與群體。
關於眾包基準平台使用的持續爭論,凸顯需更細緻的AI模型評估方法,結合公開意見與嚴謹專業評估,確保準確與公平。
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手
連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔
Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?
Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅
Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀
I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅





首頁






