選項
首頁
新聞
專家強調了眾包AI基準的嚴重缺陷

專家強調了眾包AI基準的嚴重缺陷

2025-04-25
210

專家強調了眾包AI基準的嚴重缺陷

AI實驗室日益轉向眾包基準平台,如Chatbot Arena,以評估其最新模型的能力。然而,一些專家認為此方法引發重大倫理與學術問題。

近年來,OpenAI、Google和Meta等主要業者已利用平台讓用戶評估其即將推出的模型表現。在這些平台上的高分常被實驗室用來證明其模型的進步。然而,此方法並非無人批評。

眾包基準的批評

華盛頓大學語言學教授、《The AI Con》合著者Emily Bender對此類基準的有效性表示擔憂,特別是Chatbot Arena。此平台讓志願者比較兩個匿名模型的回應並選擇偏好。Bender認為,一個有效的基準必須測量特定內容並展示結構效度,意即測量應準確反映被評估的結構。她認為Chatbot Arena缺乏證據證明用戶對某輸出的偏好與任何定義標準真正相關。

AI公司Lesan聯合創始人、Distributed AI Research Institute研究員Asmelash Teka Hadgu表示,這些基準被AI實驗室用來誇大其模型的聲稱。他提到Meta的Llama 4 Maverick模型近期事件,Meta微調版本以在Chatbot Arena表現出色,但選擇發布較低效版本。Hadgu主張基準應動態、分散於多個獨立實體,並由教育、醫療等領域使用模型的專業人士為特定用途量身定制。

公平報酬與更廣泛評估方法的呼聲

Hadgu與Aspen Institute新興與智能技術倡議前負責人Kristine Gloria認為,評估者應因其工作獲得報酬,類比於常具剝削性的數據標籤行業。Gloria認為眾包基準有價值,類似公民科學計畫,但強調基準不應是唯一評估標準,尤其考慮到行業創新的快速步伐。

Gray Swan AI執行長Matt Fredrikson,負責眾包紅隊活動,認同此類平台對志願者學習與練習新技能的吸引力。但他強調,公開基準無法取代付費私人評估的深入分析。Fredrikson建議開發者應依賴內部基準、算法紅隊及聘請專家,提供更開放與領域特定的見解。

業界對基準的看法

模型市場OpenRouter執行長Alex Atallah與加州大學伯克利分校AI博士生、LMArena(管理Chatbot Arena)創始人之一Wei-Lin Chiang同意,僅靠公開測試與基準不足。Chiang強調,LMArena的目標是提供可信、開放的空間,以衡量社群對不同AI模型的偏好。

針對Maverick基準爭議,Chiang澄清此類事件非因Chatbot Arena設計缺陷,而是實驗室對其政策的誤解。LMArena已更新政策,確保公平與可重現的評估。Chiang強調,該平台社群不僅是志願者或測試者,而是一個提供AI模型集體反饋的參與群體。

關於眾包基準平台使用的持續爭論,凸顯需更細緻的AI模型評估方法,結合公開意見與嚴謹專業評估,確保準確與公平。

相關文章
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手 印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手 連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型 前OpenAI首席科學家Ilya的SSI首次釋出模型 AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field 2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (17)
0/500
EricDavis
EricDavis 2026-05-20 00:00:14

這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔

AlbertScott
AlbertScott 2025-08-01 21:47:34

Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?

JonathanAllen
JonathanAllen 2025-04-27 15:34:07

Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅

AlbertWalker
AlbertWalker 2025-04-27 13:24:31

Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀

RogerRodriguez
RogerRodriguez 2025-04-27 11:52:29

I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅

JonathanAllen
JonathanAllen 2025-04-27 09:40:09

Intéressant, mais inquiétant ! Les benchmarks par crowdsourcing, c’est innovant, mais les failles éthiques me font réfléchir. Les géants comme Google vont devoir être transparents. 🧐

OR