AI基準:我們現在應該忽略它們嗎?
歡迎體驗TechCrunch的定期AI通訊!我們將短暫休息,但別擔心,您仍可在TechCrunch獲取所有AI報導,包括我的專欄、每日分析及突發新聞。想每天直接收到這些報導?請在此處訂閱我們的每日通訊。
本週,Elon Musk的AI新創公司xAI推出最新旗艦AI模型Grok 3,驅動公司Grok聊天機器人應用程式。他們使用20萬個GPU進行訓練,該模型在數學、程式設計等基準測試中,超越包括OpenAI在內的多個頂尖模型。
但讓我們來談談這些基準測試的真正意義。
在TC,我們報導這些基準數據,儘管我們並不總是對此感到興奮,因為這是AI產業展示模型進步的少數方式之一。問題在於,這些熱門AI基準測試往往聚焦於冷門內容,得分無法真正反映AI在人們實際關心的事務上的表現。
Wharton教授Ethan Mollick在X上表示,急需更好的測試及獨立團體來執行。他指出,AI公司通常自行報告基準結果,這讓人難以完全信任。
「公開基準測試既『平庸』又飽和,許多AI測試就像美食評論,基於主觀感受,」Mollick寫道。「如果AI對工作至關重要,我們需要更多。」
許多人在嘗試為AI設計新基準,但對於最佳方式尚未達成共識。一些人認為基準應聚焦於經濟影響才有用,另一些人則認為實際應用與實用性才是成功的真正衡量標準。
這場爭論可能永無止境。或許,如X用戶Roon建議,除非出現重大AI突破,否則我們應少關注新模型與基準。這樣或許對我們的理智更好,即使可能錯過一些AI熱潮。
如前所述,《本週AI》將暫停更新。感謝讀者們一路以來的支持,無論高低起伏。下次見。
新聞

圖片來源:Nathan Laine/Bloomberg / Getty Images OpenAI正試圖「解除審查」ChatGPT。Max撰文介紹他們如何改變AI開發方式,擁抱「知識自由」,即使涉及困難或爭議性話題。OpenAI前技術長Mira Murati創辦新公司Thinking Machines Lab,致力於開發工具以「讓AI滿足[人們的]獨特需求與目標」。
xAI發布Grok 3,並為iOS及網頁版Grok應用程式新增功能。
Meta將於明年春季舉辦首場專注於生成式AI的開發者大會,名為LlamaCon,以其Llama模型命名,定於4月29日舉行。
Paul撰文介紹OpenEuroLLM,由約20個組織合作打造,旨在為歐洲建構「透明AI」基礎模型,尊重歐盟所有語言的「語言與文化多樣性」。
本週研究論文

圖片來源:Jakub Porzycki/NurPhoto / Getty Images OpenAI研究人員提出新AI基準SWE-Lancer,測試AI程式設計能力,包含超過1400個自由軟體工程任務,從修復錯誤、添加功能到提出技術實現方案。OpenAI表示,表現最佳的模型Anthropic的Claude 3.5 Sonnet,在完整SWE-Lancer基準中僅得分40.3%,顯示AI仍有很長的路要走。他們未測試OpenAI的o3-mini或中國DeepSeek的R1等較新模型。
本週模型
中國AI公司Stepfun發布「開放」AI模型Step-Audio,能理解並生成中文、英文、日文的語音。用戶甚至可調整合成音頻的情感與方言,包括歌唱。
Stepfun是多家資金雄厚的中國AI新創之一,發布具寬鬆許可的模型。該公司2023年成立,最近完成一輪數億美元融資,投資者包括中國國有私募股權公司。
雜錦

圖片來源:Nous Research AI研究團體Nous Research宣稱發布首個結合推理與「直觀語言模型能力」的AI模型。他們的模型DeepHermes-3 Preview可在短與長「思維鏈」間切換,以平衡準確度與運算能力。在「推理」模式下,解決較難問題時耗時更長,並展示其思考過程。
據報導,Anthropic計畫不久後發布類似模型,OpenAI也表示這在其近期計畫中。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (62)
0/500
I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.
AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.
AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?
AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔
AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐
歡迎體驗TechCrunch的定期AI通訊!我們將短暫休息,但別擔心,您仍可在TechCrunch獲取所有AI報導,包括我的專欄、每日分析及突發新聞。想每天直接收到這些報導?請在此處訂閱我們的每日通訊。
本週,Elon Musk的AI新創公司xAI推出最新旗艦AI模型Grok 3,驅動公司Grok聊天機器人應用程式。他們使用20萬個GPU進行訓練,該模型在數學、程式設計等基準測試中,超越包括OpenAI在內的多個頂尖模型。
但讓我們來談談這些基準測試的真正意義。
在TC,我們報導這些基準數據,儘管我們並不總是對此感到興奮,因為這是AI產業展示模型進步的少數方式之一。問題在於,這些熱門AI基準測試往往聚焦於冷門內容,得分無法真正反映AI在人們實際關心的事務上的表現。
Wharton教授Ethan Mollick在X上表示,急需更好的測試及獨立團體來執行。他指出,AI公司通常自行報告基準結果,這讓人難以完全信任。
「公開基準測試既『平庸』又飽和,許多AI測試就像美食評論,基於主觀感受,」Mollick寫道。「如果AI對工作至關重要,我們需要更多。」
許多人在嘗試為AI設計新基準,但對於最佳方式尚未達成共識。一些人認為基準應聚焦於經濟影響才有用,另一些人則認為實際應用與實用性才是成功的真正衡量標準。
這場爭論可能永無止境。或許,如X用戶Roon建議,除非出現重大AI突破,否則我們應少關注新模型與基準。這樣或許對我們的理智更好,即使可能錯過一些AI熱潮。
如前所述,《本週AI》將暫停更新。感謝讀者們一路以來的支持,無論高低起伏。下次見。
新聞

OpenAI前技術長Mira Murati創辦新公司Thinking Machines Lab,致力於開發工具以「讓AI滿足[人們的]獨特需求與目標」。
xAI發布Grok 3,並為iOS及網頁版Grok應用程式新增功能。
Meta將於明年春季舉辦首場專注於生成式AI的開發者大會,名為LlamaCon,以其Llama模型命名,定於4月29日舉行。
Paul撰文介紹OpenEuroLLM,由約20個組織合作打造,旨在為歐洲建構「透明AI」基礎模型,尊重歐盟所有語言的「語言與文化多樣性」。
本週研究論文

OpenAI表示,表現最佳的模型Anthropic的Claude 3.5 Sonnet,在完整SWE-Lancer基準中僅得分40.3%,顯示AI仍有很長的路要走。他們未測試OpenAI的o3-mini或中國DeepSeek的R1等較新模型。
本週模型
中國AI公司Stepfun發布「開放」AI模型Step-Audio,能理解並生成中文、英文、日文的語音。用戶甚至可調整合成音頻的情感與方言,包括歌唱。
Stepfun是多家資金雄厚的中國AI新創之一,發布具寬鬆許可的模型。該公司2023年成立,最近完成一輪數億美元融資,投資者包括中國國有私募股權公司。
雜錦

他們的模型DeepHermes-3 Preview可在短與長「思維鏈」間切換,以平衡準確度與運算能力。在「推理」模式下,解決較難問題時耗時更長,並展示其思考過程。
據報導,Anthropic計畫不久後發布類似模型,OpenAI也表示這在其近期計畫中。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.
AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.
AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?
AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔
AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐





首頁






