多家美国媒体封锁了互联网档案馆“时光机”的爬虫程序,以防止其被滥用于人工智能训练
据《连线》杂志报道,包括《纽约时报》、Reddit以及《今日美国》母公司在内的多家主要媒体和平台,近期已屏蔽了互联网档案馆的“时光机”(Wayback Machine)服务。此举旨在防止人工智能公司利用该存档工具间接抓取受版权保护的内容,用于模型训练。

一边封锁一边受益的讽刺
颇具讽刺意味的是,《今日美国》近期针对移民政策统计数据所做的深度调查,正是依赖于“时光机”保存的历史数据。然而,该媒体集团的发言人表示,为应对日益加剧的AI侵权风险,他们已全面封锁了所有爬虫程序,包括ia_archiverbot。
媒体机构如何实施限制
目前已有至少23家主流新闻网站实施了限制措施:
完全封锁:《纽约时报》和Reddit已直接封锁“互联网档案馆”的专用爬虫。
界面过滤:《卫报》虽未完全封锁爬虫,但已将其内容排除在互联网档案馆的API之外,并对搜索界面进行了过滤,导致用户极难访问历史存档。
针对这些封锁措施,包括瑞秋·马多在内的100多名现役记者联名致函电子前沿基金会(EFF)表示支持。他们将“时光机”描述为事实核查、追踪强大机构行为变化以及保存数字历史的“不可或缺的工具”。
出版商则辩称,人工智能公司利用互联网档案馆的海量数据进行训练,不仅侵犯了版权法,还直接与他们构成竞争。 然而,互联网档案馆馆长马克·格雷厄姆警告称,公共网络内容的持续封存正在严重削弱社会了解历史真相和进行公众监督的能力。如果这种趋势持续下去,大量早期数字记录可能会面临彻底丢失的风险。
相关文章
科大讯飞发布讯飞星火大模型 V2.5
9月1日,科大讯飞将开源两款面向边缘场景的大语言模型——星火X2.5-4B和星火X2.5-1.7B,据最新官方公告。这两款模型原生支持高达100万token的上下文窗口。它们在智能体交互、数学推理和通用理解等关键领域实现了显著提升,为车载系统、智能设备和物联网生态等边缘应用提供了强有力的支持。在上述边缘模型发布后,科大讯飞计划于9月7日推出拥有2930亿参数的星火X2.5基础模型。该版本将进一步推进代码生成和多智能体协作等核心技术。在公司2026年年中简报会上宣布,一款完全基于国产算力基础设施
Meta 在用户强烈反对后取消了 AI 照片编辑功能
Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
相关专题推荐
评论 (0)
0/500
据《连线》杂志报道,包括《纽约时报》、Reddit以及《今日美国》母公司在内的多家主要媒体和平台,近期已屏蔽了互联网档案馆的“时光机”(Wayback Machine)服务。此举旨在防止人工智能公司利用该存档工具间接抓取受版权保护的内容,用于模型训练。

一边封锁一边受益的讽刺
颇具讽刺意味的是,《今日美国》近期针对移民政策统计数据所做的深度调查,正是依赖于“时光机”保存的历史数据。然而,该媒体集团的发言人表示,为应对日益加剧的AI侵权风险,他们已全面封锁了所有爬虫程序,包括ia_archiverbot。
媒体机构如何实施限制
目前已有至少23家主流新闻网站实施了限制措施:
完全封锁:《纽约时报》和Reddit已直接封锁“互联网档案馆”的专用爬虫。
界面过滤:《卫报》虽未完全封锁爬虫,但已将其内容排除在互联网档案馆的API之外,并对搜索界面进行了过滤,导致用户极难访问历史存档。
针对这些封锁措施,包括瑞秋·马多在内的100多名现役记者联名致函电子前沿基金会(EFF)表示支持。他们将“时光机”描述为事实核查、追踪强大机构行为变化以及保存数字历史的“不可或缺的工具”。
出版商则辩称,人工智能公司利用互联网档案馆的海量数据进行训练,不仅侵犯了版权法,还直接与他们构成竞争。 然而,互联网档案馆馆长马克·格雷厄姆警告称,公共网络内容的持续封存正在严重削弱社会了解历史真相和进行公众监督的能力。如果这种趋势持续下去,大量早期数字记录可能会面临彻底丢失的风险。
科大讯飞发布讯飞星火大模型 V2.5
9月1日,科大讯飞将开源两款面向边缘场景的大语言模型——星火X2.5-4B和星火X2.5-1.7B,据最新官方公告。这两款模型原生支持高达100万token的上下文窗口。它们在智能体交互、数学推理和通用理解等关键领域实现了显著提升,为车载系统、智能设备和物联网生态等边缘应用提供了强有力的支持。在上述边缘模型发布后,科大讯飞计划于9月7日推出拥有2930亿参数的星火X2.5基础模型。该版本将进一步推进代码生成和多智能体协作等核心技术。在公司2026年年中简报会上宣布,一款完全基于国产算力基础设施
Meta 在用户强烈反对后取消了 AI 照片编辑功能
Meta,这家社交媒体巨头,再次卷入关于人工智能与用户隐私之间微妙平衡的公开辩论。据 TechCrunch 报道,Meta 的 Superintelligence Labs 本周早些时候推出了一款新的 AI 图像生成器 Muse Image。然而,一个备受好评的关键功能——允许用户通过“@”符号标记来修改和生成来自公开 Instagram 账户的图像——由于缺乏适当的通知机制,立即引发了用户以及 CAA 等机构的强烈反对。面对强烈的批评,Meta 迅速撤销了该决定,并于周五通过博客文章宣布将
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20





首页






