Hogar
Wikipedia está dando a los desarrolladores de IA sus datos para defenderse de los raspadores de bots

La nueva estrategia de Wikipedia para gestionar el raspado de datos por IA
Wikipedia, a través de la Fundación Wikimedia, está tomando una medida proactiva para gestionar el impacto del raspado de datos por IA en sus servidores. El miércoles, anunciaron una colaboración con Kaggle, una plataforma propiedad de Google y dedicada a la ciencia de datos y el aprendizaje automático, para lanzar un conjunto de datos beta. Este conjunto de datos contiene "contenido estructurado de Wikipedia en inglés y francés," diseñado específicamente para propósitos de entrenamiento de IA.
El conjunto de datos, ahora disponible en Kaggle, ha sido creado pensando en los desarrolladores de IA, simplificando el proceso de acceso a datos de artículos legibles por máquina. Esto incluye desde resúmenes de investigación y descripciones cortas hasta enlaces de imágenes, datos de infoboxes y varias secciones de artículos. Es importante destacar que estos datos están licenciados abiertamente y no incluyen referencias ni elementos no textuales como archivos de audio, asegurando que estén optimizados para casos de uso de IA como modelado, ajuste fino y evaluación comparativa.
El enfoque de Wikimedia ofrece un formato JSON bien estructurado del contenido de Wikipedia, que esperan sea una opción más atractiva para los desarrolladores de IA en comparación con el método tradicional de raspado o análisis de texto de artículos en bruto. Esta medida responde en parte a la presión que los bots de IA han estado ejerciendo sobre los servidores de Wikipedia debido a su consumo de ancho de banda.
Ya, Wikimedia ha establecido acuerdos de intercambio de contenido con gigantes como Google y el Internet Archive. Sin embargo, la colaboración con Kaggle se espera que haga estos datos más accesibles para empresas más pequeñas y científicos de datos independientes, ampliando el alcance y la utilidad del contenido de Wikipedia.
Lo que Kaggle aporta
Brenda Flynn, líder de asociaciones de Kaggle, expresó entusiasmo por alojar los datos de Wikimedia. "Como el lugar al que la comunidad de aprendizaje automático acude por herramientas y pruebas, Kaggle está extremadamente emocionada de ser el anfitrión de los datos de la Fundación Wikimedia," afirmó. El rol de Kaggle es crucial para mantener estos datos no solo accesibles, sino también relevantes y útiles para la comunidad de aprendizaje automático.
Esta movida estratégica de Wikipedia no solo busca aliviar la carga en sus servidores, sino que también fomenta una relación más estructurada y beneficiosa con las comunidades de IA y aprendizaje automático.
Artículo relacionado
Warner Music adquiere la startup de atribución de IA Sureel AI
Warner Music Group (WMG) confirmó el miércoles que está adquiriendo Sureel AI, una startup de atribución de inteligencia artificial. La tecnología propietaria de Sureel genera un «ADN de IA» para las pistas musicales, descomponiéndolas en sus element
Amazon presenta Alexa para Compras mientras relega a Rufus a un segundo plano
Amazon ha lanzado Alexa para Compras, fusionando su chatbot de compras Rufus con Alexa+ en la aplicación, el sitio web y los dispositivos Echo Show.El asistente responde consultas sobre productos, compara artículos, rastrea precios y admite recordat
Microsoft, Azure y la tecnología de IA combaten los riesgos de incendios forestales en California
Microsoft invierte en la detección de incendios forestales basada en la inteligencia artificial; Juan Lavista Ferres, vicepresidente corporativo y científico jefe de datos, analiza estrategias para mi
Recomendaciones de temas especiales relacionados
comentario (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

La nueva estrategia de Wikipedia para gestionar el raspado de datos por IA
Wikipedia, a través de la Fundación Wikimedia, está tomando una medida proactiva para gestionar el impacto del raspado de datos por IA en sus servidores. El miércoles, anunciaron una colaboración con Kaggle, una plataforma propiedad de Google y dedicada a la ciencia de datos y el aprendizaje automático, para lanzar un conjunto de datos beta. Este conjunto de datos contiene "contenido estructurado de Wikipedia en inglés y francés," diseñado específicamente para propósitos de entrenamiento de IA.
El conjunto de datos, ahora disponible en Kaggle, ha sido creado pensando en los desarrolladores de IA, simplificando el proceso de acceso a datos de artículos legibles por máquina. Esto incluye desde resúmenes de investigación y descripciones cortas hasta enlaces de imágenes, datos de infoboxes y varias secciones de artículos. Es importante destacar que estos datos están licenciados abiertamente y no incluyen referencias ni elementos no textuales como archivos de audio, asegurando que estén optimizados para casos de uso de IA como modelado, ajuste fino y evaluación comparativa.
El enfoque de Wikimedia ofrece un formato JSON bien estructurado del contenido de Wikipedia, que esperan sea una opción más atractiva para los desarrolladores de IA en comparación con el método tradicional de raspado o análisis de texto de artículos en bruto. Esta medida responde en parte a la presión que los bots de IA han estado ejerciendo sobre los servidores de Wikipedia debido a su consumo de ancho de banda.
Ya, Wikimedia ha establecido acuerdos de intercambio de contenido con gigantes como Google y el Internet Archive. Sin embargo, la colaboración con Kaggle se espera que haga estos datos más accesibles para empresas más pequeñas y científicos de datos independientes, ampliando el alcance y la utilidad del contenido de Wikipedia.
Lo que Kaggle aporta
Brenda Flynn, líder de asociaciones de Kaggle, expresó entusiasmo por alojar los datos de Wikimedia. "Como el lugar al que la comunidad de aprendizaje automático acude por herramientas y pruebas, Kaggle está extremadamente emocionada de ser el anfitrión de los datos de la Fundación Wikimedia," afirmó. El rol de Kaggle es crucial para mantener estos datos no solo accesibles, sino también relevantes y útiles para la comunidad de aprendizaje automático.
Esta movida estratégica de Wikipedia no solo busca aliviar la carga en sus servidores, sino que también fomenta una relación más estructurada y beneficiosa con las comunidades de IA y aprendizaje automático.
Warner Music adquiere la startup de atribución de IA Sureel AI
Warner Music Group (WMG) confirmó el miércoles que está adquiriendo Sureel AI, una startup de atribución de inteligencia artificial. La tecnología propietaria de Sureel genera un «ADN de IA» para las pistas musicales, descomponiéndolas en sus element
Microsoft, Azure y la tecnología de IA combaten los riesgos de incendios forestales en California
Microsoft invierte en la detección de incendios forestales basada en la inteligencia artificial; Juan Lavista Ferres, vicepresidente corporativo y científico jefe de datos, analiza estrategias para mi
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️











