選項
首頁
新聞
AI基準:我們現在應該忽略它們嗎?

AI基準:我們現在應該忽略它們嗎?

2025-04-10
283

歡迎體驗TechCrunch的定期AI通訊!我們將短暫休息,但別擔心,您仍可在TechCrunch獲取所有AI報導,包括我的專欄、每日分析及突發新聞。想每天直接收到這些報導?請在此處訂閱我們的每日通訊。

本週,Elon Musk的AI新創公司xAI推出最新旗艦AI模型Grok 3,驅動公司Grok聊天機器人應用程式。他們使用20萬個GPU進行訓練,該模型在數學、程式設計等基準測試中,超越包括OpenAI在內的多個頂尖模型。

但讓我們來談談這些基準測試的真正意義。

在TC,我們報導這些基準數據,儘管我們並不總是對此感到興奮,因為這是AI產業展示模型進步的少數方式之一。問題在於,這些熱門AI基準測試往往聚焦於冷門內容,得分無法真正反映AI在人們實際關心的事務上的表現。

Wharton教授Ethan Mollick在X上表示,急需更好的測試及獨立團體來執行。他指出,AI公司通常自行報告基準結果,這讓人難以完全信任。

「公開基準測試既『平庸』又飽和,許多AI測試就像美食評論,基於主觀感受,」Mollick寫道。「如果AI對工作至關重要,我們需要更多。」

許多人在嘗試為AI設計新基準,但對於最佳方式尚未達成共識。一些人認為基準應聚焦於經濟影響才有用,另一些人則認為實際應用與實用性才是成功的真正衡量標準。

這場爭論可能永無止境。或許,如X用戶Roon建議,除非出現重大AI突破,否則我們應少關注新模型與基準。這樣或許對我們的理智更好,即使可能錯過一些AI熱潮。

如前所述,《本週AI》將暫停更新。感謝讀者們一路以來的支持,無論高低起伏。下次見。

新聞

圖片來源:Nathan Laine/Bloomberg / Getty Images
OpenAI正試圖「解除審查」ChatGPT。Max撰文介紹他們如何改變AI開發方式,擁抱「知識自由」,即使涉及困難或爭議性話題。

OpenAI前技術長Mira Murati創辦新公司Thinking Machines Lab,致力於開發工具以「讓AI滿足[人們的]獨特需求與目標」。

xAI發布Grok 3,並為iOS及網頁版Grok應用程式新增功能。

Meta將於明年春季舉辦首場專注於生成式AI的開發者大會,名為LlamaCon,以其Llama模型命名,定於4月29日舉行。

Paul撰文介紹OpenEuroLLM,由約20個組織合作打造,旨在為歐洲建構「透明AI」基礎模型,尊重歐盟所有語言的「語言與文化多樣性」。

本週研究論文

OpenAI ChatGPT網站顯示於筆電螢幕的示意圖。

圖片來源:Jakub Porzycki/NurPhoto / Getty Images
OpenAI研究人員提出新AI基準SWE-Lancer,測試AI程式設計能力,包含超過1400個自由軟體工程任務,從修復錯誤、添加功能到提出技術實現方案。

OpenAI表示,表現最佳的模型Anthropic的Claude 3.5 Sonnet,在完整SWE-Lancer基準中僅得分40.3%,顯示AI仍有很長的路要走。他們未測試OpenAI的o3-mini或中國DeepSeek的R1等較新模型。

本週模型

中國AI公司Stepfun發布「開放」AI模型Step-Audio,能理解並生成中文、英文、日文的語音。用戶甚至可調整合成音頻的情感與方言,包括歌唱。

Stepfun是多家資金雄厚的中國AI新創之一,發布具寬鬆許可的模型。該公司2023年成立,最近完成一輪數億美元融資,投資者包括中國國有私募股權公司。

雜錦

Nous Research DeepHermes

圖片來源:Nous Research
AI研究團體Nous Research宣稱發布首個結合推理與「直觀語言模型能力」的AI模型。

他們的模型DeepHermes-3 Preview可在短與長「思維鏈」間切換,以平衡準確度與運算能力。在「推理」模式下,解決較難問題時耗時更長,並展示其思考過程。

據報導,Anthropic計畫不久後發布類似模型,OpenAI也表示這在其近期計畫中。

相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率 NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率 正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (62)
0/500
DavidGreen
DavidGreen 2026-06-17 16:00:23

I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.

JonathanDavis
JonathanDavis 2025-08-19 14:26:53

AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.

EdwardWalker
EdwardWalker 2025-08-19 13:00:59

AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?

HarrySmith
HarrySmith 2025-08-12 03:00:59

AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔

BillyLewis
BillyLewis 2025-08-04 14:01:00

AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐

JimmyWilson
JimmyWilson 2025-08-01 10:48:18

AI benchmarks sound fancy, but are they just tech flexing? I mean, cool numbers, but do they really tell us how AI vibes in the real world? 🤔

OR