Wikipedia gibt KI -Entwicklern seine Daten, um Bot -Scrapers abzuwehren

Wikipedias neue Strategie zur Verwaltung von KI-Datenscraping
Wikipedia, über die Wikimedia Foundation, unternimmt proaktive Schritte, um die Auswirkungen von KI-Datenscraping auf seine Server zu bewältigen. Am Mittwoch kündigten sie eine Zusammenarbeit mit Kaggle an, einer von Google betriebenen Plattform für Datenwissenschaft und maschinelles Lernen, um ein Beta-Datenset zu starten. Dieses Datenset enthält „strukturierte Wikipedia-Inhalte auf Englisch und Französisch“, die speziell für KI-Trainingszwecke zugeschnitten sind.
Das nun auf Kaggle verfügbare Datenset wurde mit Blick auf KI-Entwickler erstellt und vereinfacht den Zugriff auf maschinenlesbare Artikeldaten. Dazu gehören Forschungszusammenfassungen, Kurzbeschreibungen, Bildlinks, Infobox-Daten und verschiedene Artikelabschnitte. Wichtig ist, dass diese Daten offen lizenziert sind und keine Referenzen oder nicht-textuelle Elemente wie Audiodateien enthalten, um für KI-Anwendungsfälle wie Modellierung, Feinabstimmung und Benchmarking optimiert zu sein.
Wikimedias Ansatz bietet ein gut strukturiertes JSON-Format von Wikipedias Inhalten, das für KI-Entwickler eine attraktivere Option sein soll als das traditionelle Scraping oder Parsen von rohem Artikeltext. Dieser Schritt erfolgt teilweise als Reaktion auf die Belastung, die KI-Bots durch ihren Bandbreitenverbrauch auf Wikipedias Server ausüben.
Wikimedia hat bereits Inhalte-Sharing-Vereinbarungen mit Giganten wie Google und dem Internet Archive. Die Partnerschaft mit Kaggle soll diese Daten jedoch auch für kleinere Unternehmen und unabhängige Datenwissenschaftler zugänglicher machen und die Reichweite sowie den Nutzen von Wikipedias Inhalten erweitern.
Was Kaggle mitbringt
Brenda Flynn, Kaggles Partnerschaftsleiterin, zeigte sich begeistert, Wikimedias Daten zu hosten. „Als der Ort, an dem die Machine-Learning-Community nach Tools und Tests sucht, ist Kaggle extrem begeistert, der Host für die Daten der Wikimedia Foundation zu sein“, erklärte sie. Kaggles Rolle ist entscheidend, um diese Daten nicht nur zugänglich, sondern auch relevant und nützlich für die Machine-Learning-Community zu halten.
Dieser strategische Schritt von Wikipedia zielt nicht nur darauf ab, die Belastung seiner Server zu verringern, sondern fördert auch eine strukturiertere und vorteilhaftere Beziehung zu den KI- und Machine-Learning-Communities.
Verwandter Artikel
USA verhängen Sanktionen gegen ausländische Beamte wegen Social-Media-Vorschriften
USA stellen sich gegen globale Regelungen für digitale InhalteDas US-Außenministerium hat diese Woche eine scharfe diplomatische Rüge gegen die europäische Politik zur Kontrolle digitaler Inhalte au
"Dot AI Companion App kündigt Schließung an, stellt personalisierten Service ein"
Dot, eine KI-Begleitanwendung, die als persönlicher Freund und Vertrauter fungieren soll, wird laut einer Ankündigung seiner Entwickler vom Freitag seinen Betrieb einstellen. New Computer, das Startup
Anthropic löst Rechtsstreit über AI-generierte Buchpiraterie
Anthropic hat einen bedeutenden Urheberrechtsstreit mit US-Autoren beigelegt. Das Unternehmen hat einer vorgeschlagenen Sammelklage zugestimmt, mit der ein potenziell kostspieliger Prozess vermieden w
Kommentare (2)
0/200
JustinJohnson
15. August 2025 17:00:59 MESZ
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️
0
EricMartin
31. Juli 2025 03:41:20 MESZ
Wow, Wikipedia teaming up with Kaggle to tackle AI scraping? That's a smart move! I love how they're turning a problem into an opportunity for data science. Wonder if this will spark new AI innovations or just keep the bots at bay. 🤔
0
Wikipedias neue Strategie zur Verwaltung von KI-Datenscraping
Wikipedia, über die Wikimedia Foundation, unternimmt proaktive Schritte, um die Auswirkungen von KI-Datenscraping auf seine Server zu bewältigen. Am Mittwoch kündigten sie eine Zusammenarbeit mit Kaggle an, einer von Google betriebenen Plattform für Datenwissenschaft und maschinelles Lernen, um ein Beta-Datenset zu starten. Dieses Datenset enthält „strukturierte Wikipedia-Inhalte auf Englisch und Französisch“, die speziell für KI-Trainingszwecke zugeschnitten sind.
Das nun auf Kaggle verfügbare Datenset wurde mit Blick auf KI-Entwickler erstellt und vereinfacht den Zugriff auf maschinenlesbare Artikeldaten. Dazu gehören Forschungszusammenfassungen, Kurzbeschreibungen, Bildlinks, Infobox-Daten und verschiedene Artikelabschnitte. Wichtig ist, dass diese Daten offen lizenziert sind und keine Referenzen oder nicht-textuelle Elemente wie Audiodateien enthalten, um für KI-Anwendungsfälle wie Modellierung, Feinabstimmung und Benchmarking optimiert zu sein.
Wikimedias Ansatz bietet ein gut strukturiertes JSON-Format von Wikipedias Inhalten, das für KI-Entwickler eine attraktivere Option sein soll als das traditionelle Scraping oder Parsen von rohem Artikeltext. Dieser Schritt erfolgt teilweise als Reaktion auf die Belastung, die KI-Bots durch ihren Bandbreitenverbrauch auf Wikipedias Server ausüben.
Wikimedia hat bereits Inhalte-Sharing-Vereinbarungen mit Giganten wie Google und dem Internet Archive. Die Partnerschaft mit Kaggle soll diese Daten jedoch auch für kleinere Unternehmen und unabhängige Datenwissenschaftler zugänglicher machen und die Reichweite sowie den Nutzen von Wikipedias Inhalten erweitern.
Was Kaggle mitbringt
Brenda Flynn, Kaggles Partnerschaftsleiterin, zeigte sich begeistert, Wikimedias Daten zu hosten. „Als der Ort, an dem die Machine-Learning-Community nach Tools und Tests sucht, ist Kaggle extrem begeistert, der Host für die Daten der Wikimedia Foundation zu sein“, erklärte sie. Kaggles Rolle ist entscheidend, um diese Daten nicht nur zugänglich, sondern auch relevant und nützlich für die Machine-Learning-Community zu halten.
Dieser strategische Schritt von Wikipedia zielt nicht nur darauf ab, die Belastung seiner Server zu verringern, sondern fördert auch eine strukturiertere und vorteilhaftere Beziehung zu den KI- und Machine-Learning-Communities.



Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️




Wow, Wikipedia teaming up with Kaggle to tackle AI scraping? That's a smart move! I love how they're turning a problem into an opportunity for data science. Wonder if this will spark new AI innovations or just keep the bots at bay. 🤔












