O aluno do ensino médio cria um site para os desafios de construção da AI Minecraft
Benchmarking de IA Criativa com Minecraft
À medida que os métodos tradicionais de benchmarking de IA ficam aquém, os desenvolvedores estão explorando abordagens inovadoras para avaliar a capacidade dos modelos de IA generativa. Um desses métodos criativos envolve o uso do Minecraft, o popular jogo sandbox pertencente à Microsoft. Um grupo de desenvolvedores lançou o Minecraft Benchmark, ou MC-Bench, uma plataforma onde modelos de IA competem na criação de construções no Minecraft com base em prompts fornecidos.
No MC-Bench, os usuários podem votar em qual criação de modelo de IA preferem, e somente após votar descobrem qual modelo fez cada construção. Essa abordagem interativa não apenas envolve a comunidade, mas também oferece uma maneira única de avaliar as capacidades da IA.

Créditos da Imagem: Minecraft Benchmark Adi Singh, um estudante do 12º ano e o iniciador do MC-Bench, acredita que o amplo reconhecimento do Minecraft é fundamental. Como o videogame mais vendido de todos os tempos, ele é familiar para muitos, facilitando a avaliação da qualidade das construções geradas por IA, mesmo para aqueles que não jogaram o jogo. "O Minecraft permite que as pessoas vejam o progresso [do desenvolvimento da IA] muito mais facilmente," explicou Singh à TechCrunch. "As pessoas estão acostumadas com o Minecraft, com a aparência e a vibe."
O MC-Bench é apoiado por uma equipe de oito colaboradores voluntários. Empresas como Anthropic, Google, OpenAI e Alibaba forneceram seus produtos para executar prompts de benchmark, embora não estejam diretamente envolvidas com o projeto.
Singh planeja expandir o MC-Bench além de construções simples para tarefas mais complexas e orientadas a objetivos. "Os jogos podem ser apenas um meio para testar o raciocínio agentivo que é mais seguro do que na vida real e mais controlável para fins de teste, tornando-o mais ideal aos meus olhos," disse ele.
Outros Jogos como Benchmarks de IA
Além do Minecraft, outros jogos como Pokémon Red, Street Fighter e Pictionary têm sido usados como benchmarks experimentais para IA. O desafio de benchmarking de IA reside em sua complexidade, pois os testes padronizados tradicionais frequentemente favorecem modelos de IA devido aos seus métodos de treinamento, que se destacam em áreas específicas de resolução de problemas, como memorização mecânica ou extrapolação básica.
Por exemplo, enquanto o GPT-4 da OpenAI pode alcançar o 88º percentil no LSAT, ele enfrenta dificuldades em tarefas mais simples, como contar o número de Rs em "strawberry". Da mesma forma, o Claude 3.7 Sonnet da Anthropic alcançou 62,3% de precisão em um benchmark de engenharia de software, mas fica aquém ao jogar Pokémon em comparação com a maioria das crianças de cinco anos.

Créditos da Imagem: Minecraft Benchmark MC-Bench: Mais do que Apenas um Benchmark de Programação
Tecnicamente, o MC-Bench é um benchmark de programação porque exige que os modelos de IA escrevam código para criar construções como "Frosty, o Boneco de Neve" ou "uma charmosa cabana tropical em uma praia de areia intocada". No entanto, o apelo da plataforma está em sua acessibilidade. É mais fácil para os usuários avaliarem a qualidade visual de uma construção do que analisar o código, o que amplia o alcance do projeto e o potencial para coleta de dados sobre o desempenho do modelo.
O debate continua sobre se essas pontuações refletem verdadeiramente a utilidade da IA. Singh, no entanto, acredita que elas são um forte indicador. "A tabela de classificação atual reflete de forma bastante próxima minha própria experiência ao usar esses modelos, o que é diferente de muitos benchmarks puramente textuais," disse ele. "Talvez [o MC-Bench] possa ser útil para as empresas saberem se estão indo na direção certa."
Artigo relacionado
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Recomendações de tópicos especiais relacionados
Comentários (27)
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果
Benchmarking de IA Criativa com Minecraft
À medida que os métodos tradicionais de benchmarking de IA ficam aquém, os desenvolvedores estão explorando abordagens inovadoras para avaliar a capacidade dos modelos de IA generativa. Um desses métodos criativos envolve o uso do Minecraft, o popular jogo sandbox pertencente à Microsoft. Um grupo de desenvolvedores lançou o Minecraft Benchmark, ou MC-Bench, uma plataforma onde modelos de IA competem na criação de construções no Minecraft com base em prompts fornecidos.
No MC-Bench, os usuários podem votar em qual criação de modelo de IA preferem, e somente após votar descobrem qual modelo fez cada construção. Essa abordagem interativa não apenas envolve a comunidade, mas também oferece uma maneira única de avaliar as capacidades da IA.

Adi Singh, um estudante do 12º ano e o iniciador do MC-Bench, acredita que o amplo reconhecimento do Minecraft é fundamental. Como o videogame mais vendido de todos os tempos, ele é familiar para muitos, facilitando a avaliação da qualidade das construções geradas por IA, mesmo para aqueles que não jogaram o jogo. "O Minecraft permite que as pessoas vejam o progresso [do desenvolvimento da IA] muito mais facilmente," explicou Singh à TechCrunch. "As pessoas estão acostumadas com o Minecraft, com a aparência e a vibe."
O MC-Bench é apoiado por uma equipe de oito colaboradores voluntários. Empresas como Anthropic, Google, OpenAI e Alibaba forneceram seus produtos para executar prompts de benchmark, embora não estejam diretamente envolvidas com o projeto.
Singh planeja expandir o MC-Bench além de construções simples para tarefas mais complexas e orientadas a objetivos. "Os jogos podem ser apenas um meio para testar o raciocínio agentivo que é mais seguro do que na vida real e mais controlável para fins de teste, tornando-o mais ideal aos meus olhos," disse ele.
Outros Jogos como Benchmarks de IA
Além do Minecraft, outros jogos como Pokémon Red, Street Fighter e Pictionary têm sido usados como benchmarks experimentais para IA. O desafio de benchmarking de IA reside em sua complexidade, pois os testes padronizados tradicionais frequentemente favorecem modelos de IA devido aos seus métodos de treinamento, que se destacam em áreas específicas de resolução de problemas, como memorização mecânica ou extrapolação básica.
Por exemplo, enquanto o GPT-4 da OpenAI pode alcançar o 88º percentil no LSAT, ele enfrenta dificuldades em tarefas mais simples, como contar o número de Rs em "strawberry". Da mesma forma, o Claude 3.7 Sonnet da Anthropic alcançou 62,3% de precisão em um benchmark de engenharia de software, mas fica aquém ao jogar Pokémon em comparação com a maioria das crianças de cinco anos.

MC-Bench: Mais do que Apenas um Benchmark de Programação
Tecnicamente, o MC-Bench é um benchmark de programação porque exige que os modelos de IA escrevam código para criar construções como "Frosty, o Boneco de Neve" ou "uma charmosa cabana tropical em uma praia de areia intocada". No entanto, o apelo da plataforma está em sua acessibilidade. É mais fácil para os usuários avaliarem a qualidade visual de uma construção do que analisar o código, o que amplia o alcance do projeto e o potencial para coleta de dados sobre o desempenho do modelo.
O debate continua sobre se essas pontuações refletem verdadeiramente a utilidade da IA. Singh, no entanto, acredita que elas são um forte indicador. "A tabela de classificação atual reflete de forma bastante próxima minha própria experiência ao usar esses modelos, o que é diferente de muitos benchmarks puramente textuais," disse ele. "Talvez [o MC-Bench] possa ser útil para as empresas saberem se estão indo na direção certa."
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果





Lar






