Студент средней школы создает веб-сайт для создания AI Minecraft.
Креативное тестирование ИИ с помощью Minecraft
Поскольку традиционные методы тестирования ИИ оказываются недостаточными, разработчики исследуют инновационные подходы для оценки возможностей генеративных моделей ИИ. Одним из таких креативных методов является использование Minecraft, популярной песочницы, принадлежащей Microsoft. Группа разработчиков запустила Minecraft Benchmark, или MC-Bench, платформу, где модели ИИ соревнуются в создании построек в Minecraft на основе заданных подсказок.
На MC-Bench пользователи могут голосовать за понравившуюся постройку модели ИИ, и только после голосования они узнают, какая модель создала каждую постройку. Этот интерактивный подход не только вовлекает сообщество, но и предоставляет уникальный способ оценки возможностей ИИ.

Изображение предоставлено: Minecraft Benchmark Ади Сингх, ученик 12-го класса и инициатор MC-Bench, считает, что широкая известность Minecraft играет ключевую роль. Как самая продаваемая видеоигра в истории, она знакома многим, что облегчает людям оценку качества построек, созданных ИИ, даже если они сами не играли в игру. «Minecraft позволяет людям гораздо проще увидеть прогресс [развития ИИ],» — объяснил Сингх в интервью TechCrunch. «Люди привыкли к Minecraft, к его внешнему виду и атмосфере.»
MC-Bench поддерживается командой из восьми добровольных участников. Компании, такие как Anthropic, Google, OpenAI и Alibaba, предоставили свои продукты для выполнения тестовых подсказок, хотя в остальном они не участвуют в проекте.
Сингх планирует расширить MC-Bench за пределы простых построек до более сложных, ориентированных на цели задач. «Игры могут быть просто средством для тестирования агентного мышления, которое безопаснее, чем в реальной жизни, и более контролируемо для целей тестирования, что делает его более идеальным в моих глазах,» — сказал он.
Другие игры как тесты для ИИ
Помимо Minecraft, другие игры, такие как Pokémon Red, Street Fighter и Pictionary, использовались в качестве экспериментальных тестов для ИИ. Сложность тестирования ИИ заключается в его комплексности, поскольку традиционные стандартизированные тесты часто благоприятствуют моделям ИИ из-за их методов обучения, которые превосходят в узких областях решения задач, таких как механическое запоминание или базовая экстраполяция.
Например, GPT-4 от OpenAI может набрать 88-й процентиль на LSAT, но испытывает трудности с более простыми задачами, такими как подсчет количества букв «R» в слове «strawberry». Аналогично, Claude 3.7 Sonnet от Anthropic достиг точности 62,3% в тесте по разработке программного обеспечения, но уступает большинству пятилетних детей в игре Pokémon.

Изображение предоставлено: Minecraft Benchmark MC-Bench: больше, чем просто программный тест
Технически MC-Bench является программным тестом, поскольку требует от моделей ИИ написания кода для создания построек, таких как «Снеговик Фрости» или «очаровательная тропическая хижина на нетронутом песчаном берегу». Однако привлекательность платформы заключается в ее доступности. Пользователям легче оценить визуальное качество постройки, чем анализировать код, что расширяет охват проекта и потенциал для сбора данных о производительности моделей.
Дискуссия о том, действительно ли эти результаты отражают полезность ИИ, продолжается. Однако Сингх считает, что они являются сильным индикатором. «Текущая таблица лидеров довольно точно отражает мой собственный опыт использования этих моделей, в отличие от многих чисто текстовых тестов,» — сказал он. «Возможно, [MC-Bench] может быть полезен компаниям, чтобы понять, движутся ли они в правильном направлении.»
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (27)
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果
Креативное тестирование ИИ с помощью Minecraft
Поскольку традиционные методы тестирования ИИ оказываются недостаточными, разработчики исследуют инновационные подходы для оценки возможностей генеративных моделей ИИ. Одним из таких креативных методов является использование Minecraft, популярной песочницы, принадлежащей Microsoft. Группа разработчиков запустила Minecraft Benchmark, или MC-Bench, платформу, где модели ИИ соревнуются в создании построек в Minecraft на основе заданных подсказок.
На MC-Bench пользователи могут голосовать за понравившуюся постройку модели ИИ, и только после голосования они узнают, какая модель создала каждую постройку. Этот интерактивный подход не только вовлекает сообщество, но и предоставляет уникальный способ оценки возможностей ИИ.

Ади Сингх, ученик 12-го класса и инициатор MC-Bench, считает, что широкая известность Minecraft играет ключевую роль. Как самая продаваемая видеоигра в истории, она знакома многим, что облегчает людям оценку качества построек, созданных ИИ, даже если они сами не играли в игру. «Minecraft позволяет людям гораздо проще увидеть прогресс [развития ИИ],» — объяснил Сингх в интервью TechCrunch. «Люди привыкли к Minecraft, к его внешнему виду и атмосфере.»
MC-Bench поддерживается командой из восьми добровольных участников. Компании, такие как Anthropic, Google, OpenAI и Alibaba, предоставили свои продукты для выполнения тестовых подсказок, хотя в остальном они не участвуют в проекте.
Сингх планирует расширить MC-Bench за пределы простых построек до более сложных, ориентированных на цели задач. «Игры могут быть просто средством для тестирования агентного мышления, которое безопаснее, чем в реальной жизни, и более контролируемо для целей тестирования, что делает его более идеальным в моих глазах,» — сказал он.
Другие игры как тесты для ИИ
Помимо Minecraft, другие игры, такие как Pokémon Red, Street Fighter и Pictionary, использовались в качестве экспериментальных тестов для ИИ. Сложность тестирования ИИ заключается в его комплексности, поскольку традиционные стандартизированные тесты часто благоприятствуют моделям ИИ из-за их методов обучения, которые превосходят в узких областях решения задач, таких как механическое запоминание или базовая экстраполяция.
Например, GPT-4 от OpenAI может набрать 88-й процентиль на LSAT, но испытывает трудности с более простыми задачами, такими как подсчет количества букв «R» в слове «strawberry». Аналогично, Claude 3.7 Sonnet от Anthropic достиг точности 62,3% в тесте по разработке программного обеспечения, но уступает большинству пятилетних детей в игре Pokémon.

MC-Bench: больше, чем просто программный тест
Технически MC-Bench является программным тестом, поскольку требует от моделей ИИ написания кода для создания построек, таких как «Снеговик Фрости» или «очаровательная тропическая хижина на нетронутом песчаном берегу». Однако привлекательность платформы заключается в ее доступности. Пользователям легче оценить визуальное качество постройки, чем анализировать код, что расширяет охват проекта и потенциал для сбора данных о производительности моделей.
Дискуссия о том, действительно ли эти результаты отражают полезность ИИ, продолжается. Однако Сингх считает, что они являются сильным индикатором. «Текущая таблица лидеров довольно точно отражает мой собственный опыт использования этих моделей, в отличие от многих чисто текстовых тестов,» — сказал он. «Возможно, [MC-Bench] может быть полезен компаниям, чтобы понять, движутся ли они в правильном направлении.»
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果





Дом






