Дом
Википедия предоставляет разработчикам искусственного интеллекта свои данные для отрыва от скребков бота

Новая стратегия Википедии по управлению сбором данных для ИИ
Википедия, через Фонд Викимедиа, предпринимает активные шаги для управления влиянием сбора данных для ИИ на свои серверы. В среду они объявили о сотрудничестве с Kaggle, платформой, принадлежащей Google и посвященной науке о данных и машинному обучению, для запуска бета-версии набора данных. Этот набор данных содержит «структурированный контент Википедии на английском и французском языках», специально адаптированный для целей обучения ИИ.
Набор данных, теперь доступный на Kaggle, создан с учетом потребностей разработчиков ИИ, упрощая процесс доступа к машиночитаемым данным статей. Это включает в себя всё: от исследовательских сводок и кратких описаний до ссылок на изображения, данных инфобоксов и различных разделов статей. Важно, что эти данные имеют открытую лицензию и не включают ссылки или нетекстовые элементы, такие как аудиофайлы, что оптимизировано для использования в ИИ, таких как моделирование, тонкая настройка и тестирование.
Подход Викимедиа предлагает хорошо структурированный JSON-формат контента Википедии, который, как они надеются, станет более привлекательным вариантом для разработчиков ИИ по сравнению с традиционным методом сбора или парсинга необработанного текста статей. Этот шаг частично является ответом на нагрузку, которую боты ИИ создают на серверах Википедии из-за потребления пропускной способности.
Уже сейчас Викимедиа заключила соглашения о совместном использовании контента с такими гигантами, как Google и Internet Archive. Однако партнерство с Kaggle, как ожидается, сделает эти данные более доступными для небольших компаний и независимых ученых-данных, расширяя охват и полезность контента Википедии.
Что Kaggle приносит в этот процесс
Бренда Флинн, руководитель партнерств Kaggle, выразила энтузиазм по поводу размещения данных Викимедиа. «Как место, куда сообщество машинного обучения приходит за инструментами и тестами, Kaggle чрезвычайно взволнован тем, что стал хостом для данных Фонда Викимедиа», — заявила она. Роль Kaggle имеет решающее значение для того, чтобы эти данные оставались не только доступными, но также актуальными и полезными для сообщества машинного обучения.
Этот стратегический шаг Википедии направлен не только на снижение нагрузки на её серверы, но и на развитие более структурированных и взаимовыгодных отношений с сообществами ИИ и машинного обучения.
Связанная статья
Warner Music приобретает стартап в области атрибуции с использованием искусственного интеллекта Sureel AI
Warner Music Group (WMG) подтвердила в среду, что приобретает Sureel AI, стартап в области атрибуции с использованием искусственного интеллекта. Собственная технология Sureel создает «ИИ-ДНК» для музыкальных треков, разбивая их на составляющие элемен
Amazon представляет Alexa для покупок, отодвигая Rufus на второй план
Amazon запустила Alexa for Shopping, объединив своего чат-бота для покупок Rufus с Alexa+ в приложении, на веб-сайте и устройствах Echo Show.Ассистент отвечает на запросы о товарах, сравнивает товары, отслеживает цены и поддерживает напоминания о по
Microsoft, Azure и технологии искусственного интеллекта борются с рисками лесных пожаров в Калифорнии
Компания Microsoft инвестирует в разработку систем обнаружения лесных пожаров на основе искусственного интеллекта; Хуан Лависта Феррес, старший вице-президент и главный специалист по данным, обсуждает
Рекомендации по связанным специальным темам
Комментарии (3)
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

Новая стратегия Википедии по управлению сбором данных для ИИ
Википедия, через Фонд Викимедиа, предпринимает активные шаги для управления влиянием сбора данных для ИИ на свои серверы. В среду они объявили о сотрудничестве с Kaggle, платформой, принадлежащей Google и посвященной науке о данных и машинному обучению, для запуска бета-версии набора данных. Этот набор данных содержит «структурированный контент Википедии на английском и французском языках», специально адаптированный для целей обучения ИИ.
Набор данных, теперь доступный на Kaggle, создан с учетом потребностей разработчиков ИИ, упрощая процесс доступа к машиночитаемым данным статей. Это включает в себя всё: от исследовательских сводок и кратких описаний до ссылок на изображения, данных инфобоксов и различных разделов статей. Важно, что эти данные имеют открытую лицензию и не включают ссылки или нетекстовые элементы, такие как аудиофайлы, что оптимизировано для использования в ИИ, таких как моделирование, тонкая настройка и тестирование.
Подход Викимедиа предлагает хорошо структурированный JSON-формат контента Википедии, который, как они надеются, станет более привлекательным вариантом для разработчиков ИИ по сравнению с традиционным методом сбора или парсинга необработанного текста статей. Этот шаг частично является ответом на нагрузку, которую боты ИИ создают на серверах Википедии из-за потребления пропускной способности.
Уже сейчас Викимедиа заключила соглашения о совместном использовании контента с такими гигантами, как Google и Internet Archive. Однако партнерство с Kaggle, как ожидается, сделает эти данные более доступными для небольших компаний и независимых ученых-данных, расширяя охват и полезность контента Википедии.
Что Kaggle приносит в этот процесс
Бренда Флинн, руководитель партнерств Kaggle, выразила энтузиазм по поводу размещения данных Викимедиа. «Как место, куда сообщество машинного обучения приходит за инструментами и тестами, Kaggle чрезвычайно взволнован тем, что стал хостом для данных Фонда Викимедиа», — заявила она. Роль Kaggle имеет решающее значение для того, чтобы эти данные оставались не только доступными, но также актуальными и полезными для сообщества машинного обучения.
Этот стратегический шаг Википедии направлен не только на снижение нагрузки на её серверы, но и на развитие более структурированных и взаимовыгодных отношений с сообществами ИИ и машинного обучения.
Warner Music приобретает стартап в области атрибуции с использованием искусственного интеллекта Sureel AI
Warner Music Group (WMG) подтвердила в среду, что приобретает Sureel AI, стартап в области атрибуции с использованием искусственного интеллекта. Собственная технология Sureel создает «ИИ-ДНК» для музыкальных треков, разбивая их на составляющие элемен
Microsoft, Azure и технологии искусственного интеллекта борются с рисками лесных пожаров в Калифорнии
Компания Microsoft инвестирует в разработку систем обнаружения лесных пожаров на основе искусственного интеллекта; Хуан Лависта Феррес, старший вице-президент и главный специалист по данным, обсуждает
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️











