高中生為AI Minecraft建立挑戰創建網站
使用Minecraft進行創意AI基準測試
隨著傳統AI基準測試方法的不足,開發者們正探索創新的方式來評估生成式AI模型的能力。其中一種創意方法是使用Minecraft,這款由Microsoft擁有的熱門沙盒遊戲。一群開發者推出了Minecraft Benchmark,或稱MC-Bench,這是一個讓AI模型根據給定提示競爭創建Minecraft建築的平台。
在MC-Bench上,使用者可以投票選擇他們偏好的AI模型創作,且只有在投票後才會得知每件建築是由哪個模型製作的。這種互動方式不僅吸引了社群參與,還提供了一種獨特的方式來評估AI的能力。

圖片來源:Minecraft Benchmark Adi Singh,一位12年級學生,也是MC-Bench的發起人,認為Minecraft的廣泛知名度是關鍵。作為有史以來最暢銷的電子遊戲,許多人都對它很熟悉,這使得人們即使沒有親自玩過遊戲,也能更容易判斷AI生成建築的品質。Singh向TechCrunch解釋說:「Minecraft讓人們更容易看到[AI發展]的進展。」他補充道:「人們習慣了Minecraft的風格和氛圍。」
MC-Bench由八名志願者組成的團隊支持。像Anthropic、Google、OpenAI和Alibaba這樣的企業提供了他們的產品來運行基準測試提示,但他們並未以其他方式參與該項目。
Singh設想將MC-Bench擴展到超越簡單建築,朝著更複雜、以目標為導向的任務發展。他說:「遊戲可能只是一種測試代理推理的媒介,相較於現實生活更安全,且更可控,適合測試用途,這在我看來更為理想。」
其他遊戲作為AI基準
除了Minecraft,其他遊戲如Pokémon Red、Street Fighter和Pictionary也已被用作AI的實驗性基準。AI基準測試的挑戰在於其複雜性,因為傳統的標準化測試往往偏向AI模型,這是由於它們的訓練方式在狹窄的問題解決領域(如機械記憶或基本推斷)中表現出色。
例如,OpenAI的GPT-4在LSAT考試中能達到88百分位的成績,但在像計算「strawberry」中R的數量這樣較簡單的任務上卻表現不佳。同樣,Anthropic的Claude 3.7 Sonnet在軟體工程基準測試中達到62.3%的準確率,但在玩Pokémon時的表現卻不如大多數五歲的孩子。

圖片來源:Minecraft Benchmark MC-Bench:不僅僅是程式設計基準
從技術上講,MC-Bench是一個程式設計基準,因為它要求AI模型撰寫程式碼來創建像「雪人Frosty」或「原始沙灘上的迷人熱帶小屋」這樣的建築。然而,這個平台的吸引力在於其可及性。使用者評估建築的視覺品質比分析程式碼更容易,這擴大了項目的影響力和收集模型性能數據的潛力。
關於這些分數是否真正反映AI實用性的爭論仍在繼續。然而,Singh認為它們是一個強有力的指標。他說:「目前的排行榜與我使用這些模型的個人經驗相當吻合,這與許多純文字基準不同。」他補充道:「也許[MC-Bench]對企業來說有助於了解他們是否朝著正確的方向前進。」
相關文章
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
相關專題推薦
評論 (27)
0/500
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果
使用Minecraft進行創意AI基準測試
隨著傳統AI基準測試方法的不足,開發者們正探索創新的方式來評估生成式AI模型的能力。其中一種創意方法是使用Minecraft,這款由Microsoft擁有的熱門沙盒遊戲。一群開發者推出了Minecraft Benchmark,或稱MC-Bench,這是一個讓AI模型根據給定提示競爭創建Minecraft建築的平台。
在MC-Bench上,使用者可以投票選擇他們偏好的AI模型創作,且只有在投票後才會得知每件建築是由哪個模型製作的。這種互動方式不僅吸引了社群參與,還提供了一種獨特的方式來評估AI的能力。

Adi Singh,一位12年級學生,也是MC-Bench的發起人,認為Minecraft的廣泛知名度是關鍵。作為有史以來最暢銷的電子遊戲,許多人都對它很熟悉,這使得人們即使沒有親自玩過遊戲,也能更容易判斷AI生成建築的品質。Singh向TechCrunch解釋說:「Minecraft讓人們更容易看到[AI發展]的進展。」他補充道:「人們習慣了Minecraft的風格和氛圍。」
MC-Bench由八名志願者組成的團隊支持。像Anthropic、Google、OpenAI和Alibaba這樣的企業提供了他們的產品來運行基準測試提示,但他們並未以其他方式參與該項目。
Singh設想將MC-Bench擴展到超越簡單建築,朝著更複雜、以目標為導向的任務發展。他說:「遊戲可能只是一種測試代理推理的媒介,相較於現實生活更安全,且更可控,適合測試用途,這在我看來更為理想。」
其他遊戲作為AI基準
除了Minecraft,其他遊戲如Pokémon Red、Street Fighter和Pictionary也已被用作AI的實驗性基準。AI基準測試的挑戰在於其複雜性,因為傳統的標準化測試往往偏向AI模型,這是由於它們的訓練方式在狹窄的問題解決領域(如機械記憶或基本推斷)中表現出色。
例如,OpenAI的GPT-4在LSAT考試中能達到88百分位的成績,但在像計算「strawberry」中R的數量這樣較簡單的任務上卻表現不佳。同樣,Anthropic的Claude 3.7 Sonnet在軟體工程基準測試中達到62.3%的準確率,但在玩Pokémon時的表現卻不如大多數五歲的孩子。

MC-Bench:不僅僅是程式設計基準
從技術上講,MC-Bench是一個程式設計基準,因為它要求AI模型撰寫程式碼來創建像「雪人Frosty」或「原始沙灘上的迷人熱帶小屋」這樣的建築。然而,這個平台的吸引力在於其可及性。使用者評估建築的視覺品質比分析程式碼更容易,這擴大了項目的影響力和收集模型性能數據的潛力。
關於這些分數是否真正反映AI實用性的爭論仍在繼續。然而,Singh認為它們是一個強有力的指標。他說:「目前的排行榜與我使用這些模型的個人經驗相當吻合,這與許多純文字基準不同。」他補充道:「也許[MC-Bench]對企業來說有助於了解他們是否朝著正確的方向前進。」
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果





首頁






