關於AI基準測試的辯論已達到神奇寶貝

即使是深受喜愛的寶可夢世界,也無法免於圍繞AI基準測試的爭議。近期在X上的一則病毒式貼文引起了相當大的熱議,聲稱Google的最新Gemini模型在經典寶可夢電玩三部曲中超越了Anthropic領先的Claude模型。根據該貼文,Gemini在一位開發者的Twitch直播中令人印象深刻地抵達了紫苑鎮,而Claude截至二月底仍落後於月見山。
Gemini目前在寶可夢中確實領先Claude,已抵達紫苑鎮
僅有119人觀看直播,實在是極其被低估的直播 pic.twitter.com/8AvSovAI4x
— Jush (@Jush21e8) 2025年4月10日
然而,這則貼文刻意忽略了一個事實:Gemini擁有一定的優勢。Reddit上的敏銳用戶很快指出,Gemini直播背後的開發者打造了一個自訂的小地圖。這個巧妙的工具幫助模型識別遊戲中的「圖塊」,例如可砍伐的樹木,這顯著減少了Gemini在分析螢幕截圖並決定下一步行動所需的時間。
雖然寶可夢可能不是最嚴肅的AI基準測試,但它確實是一個有趣且具啟發性的例子,展示了不同設置如何影響這些測試的結果。以Anthropic的最新模型Anthropic 3.7 Sonnet為例,在旨在測試編碼能力的SWE-bench Verified基準測試中,其得分為62.3%的準確率。但在Anthropic打造的「自訂框架」下,該分數躍升至70.3%。
這還不只如此。Meta對其較新的模型Llama 4 Maverick進行了專為LM Arena基準測試的微調,該模型的原始版本在同一測試中的表現遠不如微調版本。
鑑於AI基準測試,包括我們友好的寶可夢例子,本身就有些不穩定,這些自訂調整和非標準方法使得在模型上市時進行有意義的比較變得更加困難。看來,要將蘋果與蘋果進行比較,正變得越來越困難。
相關文章
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
亞馬遜推出“Alexa for Shopping”,同時將Rufus邊緣化
亞馬遜推出了“Alexa for Shopping”,將 Rufus 購物聊天機器人 Alexa+ 整合到應用程式、網站和 Echo Show 裝置中。該助手回答產品查詢、比較商品、跟蹤價格,並支援購物提醒。它還處理計劃中的購物操作和符合條件的自動購買。據該公司稱,“Alexa for Shopping”將 Rufus 的產品專業知識與 Alexa+ 的個性化助手上下文相結合。亞馬遜表示,Rufus 在 2025 年協助了超過 3 億客戶進行產品研究、比較和購買。GeekWire 報道稱,
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
相關專題推薦
評論 (9)
0/500
¿De verdad comparan a los Pokémon en benchmarks de IA? 😂 Suena raro pero me intriga saber cómo lo hacen. ¿Le harán jugar al Pokémon Rojo/Fuego para ver cuántas medallas consigue sin que se pierda? Sería divertido si fuese así, aunque al final estos rankings a veces se sienten solo una guerra de marketing entre las grandes tecnológicas. ¡Quiero ver un torneo oficial de IA jugando! 🎮
Mais franchement, comparer des IA sur Pokémon ? 😂 C'est comme évaluer un chef étoilé sur sa capacité à faire des nuggets. Cette course aux benchmarks devient absurde – next step on va les tester sur Candy Crush ? En tout cas ça montre à quel point les labos cherchent désespérément des moyens originaux de se démarquer.
Whoa, AI playing Pokémon? That's wild! I wonder if Gemini's got a secret Pikachu strategy or just brute-forced its way through. Gotta catch 'em all, I guess! ⚡️
Debates over AI benchmarking in Pokémon? That's wild! I never thought I'd see the day when AI models are compared using Pokémon games. It's fun but kinda confusing. Can someone explain how Gemini outpaced Claude? 🤯

即使是深受喜愛的寶可夢世界,也無法免於圍繞AI基準測試的爭議。近期在X上的一則病毒式貼文引起了相當大的熱議,聲稱Google的最新Gemini模型在經典寶可夢電玩三部曲中超越了Anthropic領先的Claude模型。根據該貼文,Gemini在一位開發者的Twitch直播中令人印象深刻地抵達了紫苑鎮,而Claude截至二月底仍落後於月見山。
Gemini目前在寶可夢中確實領先Claude,已抵達紫苑鎮
僅有119人觀看直播,實在是極其被低估的直播 pic.twitter.com/8AvSovAI4x
— Jush (@Jush21e8) 2025年4月10日
然而,這則貼文刻意忽略了一個事實:Gemini擁有一定的優勢。Reddit上的敏銳用戶很快指出,Gemini直播背後的開發者打造了一個自訂的小地圖。這個巧妙的工具幫助模型識別遊戲中的「圖塊」,例如可砍伐的樹木,這顯著減少了Gemini在分析螢幕截圖並決定下一步行動所需的時間。
雖然寶可夢可能不是最嚴肅的AI基準測試,但它確實是一個有趣且具啟發性的例子,展示了不同設置如何影響這些測試的結果。以Anthropic的最新模型Anthropic 3.7 Sonnet為例,在旨在測試編碼能力的SWE-bench Verified基準測試中,其得分為62.3%的準確率。但在Anthropic打造的「自訂框架」下,該分數躍升至70.3%。
這還不只如此。Meta對其較新的模型Llama 4 Maverick進行了專為LM Arena基準測試的微調,該模型的原始版本在同一測試中的表現遠不如微調版本。
鑑於AI基準測試,包括我們友好的寶可夢例子,本身就有些不穩定,這些自訂調整和非標準方法使得在模型上市時進行有意義的比較變得更加困難。看來,要將蘋果與蘋果進行比較,正變得越來越困難。
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
¿De verdad comparan a los Pokémon en benchmarks de IA? 😂 Suena raro pero me intriga saber cómo lo hacen. ¿Le harán jugar al Pokémon Rojo/Fuego para ver cuántas medallas consigue sin que se pierda? Sería divertido si fuese así, aunque al final estos rankings a veces se sienten solo una guerra de marketing entre las grandes tecnológicas. ¡Quiero ver un torneo oficial de IA jugando! 🎮
Mais franchement, comparer des IA sur Pokémon ? 😂 C'est comme évaluer un chef étoilé sur sa capacité à faire des nuggets. Cette course aux benchmarks devient absurde – next step on va les tester sur Candy Crush ? En tout cas ça montre à quel point les labos cherchent désespérément des moyens originaux de se démarquer.
Whoa, AI playing Pokémon? That's wild! I wonder if Gemini's got a secret Pikachu strategy or just brute-forced its way through. Gotta catch 'em all, I guess! ⚡️
Debates over AI benchmarking in Pokémon? That's wild! I never thought I'd see the day when AI models are compared using Pokémon games. It's fun but kinda confusing. Can someone explain how Gemini outpaced Claude? 🤯





首頁






