Maison
Plusieurs médias américains bloquent le robot d'indexation « Wayback Machine » d'Internet Archive afin d'empêcher toute utilisation abusive à des fins d'entraînement de l'IA
Comme le rapporte Wired, plusieurs grands médias et plateformes — dont le New York Times, Reddit et la société mère d’USA Today — ont récemment bloqué l’accès à la Wayback Machine d’Internet Archive. Cette mesure vise à empêcher les entreprises spécialisées dans l’IA d’utiliser cet outil d’archivage pour extraire indirectement des contenus protégés par le droit d’auteur afin d’entraîner leurs modèles.

L’ironie d’un blocage tout en en tirant profit
Ironiquement, la récente enquête approfondie menée par USA Today sur les statistiques relatives à la politique d’immigration s’appuyait justement sur des données historiques conservées par la Wayback Machine. Pourtant, le porte-parole du groupe de presse a déclaré avoir entièrement bloqué tous les robots d’indexation, y compris ia_archiverbot, afin de faire face au risque croissant de violation des droits d’auteur par l’IA.
Comment les médias appliquent-ils ces restrictions ?
Au moins 23 sites d’information grand public ont désormais mis en place des restrictions :
Blocage total : le New York Times et Reddit ont directement bloqué le robot d’indexation dédié de la Wayback Machine.
Filtrage de l’interface : The Guardian n’a pas complètement bloqué les robots d’indexation, mais a exclu son contenu de l’API d’Internet Archive et filtré son interface de recherche, rendant ainsi extrêmement difficile l’accès des utilisateurs aux archives historiques.
En réponse à ces mesures de blocage, plus de 100 journalistes en activité, dont Rachel Maddow, ont cosigné une lettre de soutien adressée à l’Electronic Frontier Foundation (EFF). Ils décrivent la Wayback Machine comme un « outil indispensable » pour la vérification des faits, le suivi des changements dans le comportement des institutions puissantes et la préservation de l’histoire numérique.
Les éditeurs affirment que les entreprises d’IA qui entraînent leurs modèles à partir des vastes données d’Internet Archive enfreignent la loi sur le droit d’auteur et leur font directement concurrence. Cependant, Mark Graham, directeur d’Internet Archive, met en garde contre le fait que la fermeture continue de contenus web publics sape gravement la capacité de la société à comprendre les vérités historiques et à exercer un contrôle public. Si cette tendance se poursuit, une grande partie des premiers documents numériques risque d’être définitivement perdue.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
Comme le rapporte Wired, plusieurs grands médias et plateformes — dont le New York Times, Reddit et la société mère d’USA Today — ont récemment bloqué l’accès à la Wayback Machine d’Internet Archive. Cette mesure vise à empêcher les entreprises spécialisées dans l’IA d’utiliser cet outil d’archivage pour extraire indirectement des contenus protégés par le droit d’auteur afin d’entraîner leurs modèles.

L’ironie d’un blocage tout en en tirant profit
Ironiquement, la récente enquête approfondie menée par USA Today sur les statistiques relatives à la politique d’immigration s’appuyait justement sur des données historiques conservées par la Wayback Machine. Pourtant, le porte-parole du groupe de presse a déclaré avoir entièrement bloqué tous les robots d’indexation, y compris ia_archiverbot, afin de faire face au risque croissant de violation des droits d’auteur par l’IA.
Comment les médias appliquent-ils ces restrictions ?
Au moins 23 sites d’information grand public ont désormais mis en place des restrictions :
Blocage total : le New York Times et Reddit ont directement bloqué le robot d’indexation dédié de la Wayback Machine.
Filtrage de l’interface : The Guardian n’a pas complètement bloqué les robots d’indexation, mais a exclu son contenu de l’API d’Internet Archive et filtré son interface de recherche, rendant ainsi extrêmement difficile l’accès des utilisateurs aux archives historiques.
En réponse à ces mesures de blocage, plus de 100 journalistes en activité, dont Rachel Maddow, ont cosigné une lettre de soutien adressée à l’Electronic Frontier Foundation (EFF). Ils décrivent la Wayback Machine comme un « outil indispensable » pour la vérification des faits, le suivi des changements dans le comportement des institutions puissantes et la préservation de l’histoire numérique.
Les éditeurs affirment que les entreprises d’IA qui entraînent leurs modèles à partir des vastes données d’Internet Archive enfreignent la loi sur le droit d’auteur et leur font directement concurrence. Cependant, Mark Graham, directeur d’Internet Archive, met en garde contre le fait que la fermeture continue de contenus web publics sape gravement la capacité de la société à comprendre les vérités historiques et à exercer un contrôle public. Si cette tendance se poursuit, une grande partie des premiers documents numériques risque d’être définitivement perdue.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











