研究:OpenAI模型记忆的受版权保护内容
一项最新研究表明,OpenAI可能确实使用了受版权保护的材料来训练其部分AI模型,为公司面临的持续法律争议增添了依据。作者、程序员和其他内容创作者指控OpenAI未经许可使用他们的作品——如书籍和代码——来开发其AI模型。虽然OpenAI以合理使用为由进行辩护,但原告认为美国版权法并未为训练数据提供例外条款。
这项研究由华盛顿大学、哥本哈根大学和斯坦福大学的研究人员合作开展,介绍了一种新技术,用于检测通过API访问的模型(如OpenAI的模型)中“记忆”的训练数据。AI模型通过从海量数据中学习来识别模式,从而能够生成文章、图像等。虽然大多数输出并非训练数据的直接复制,但由于学习过程,某些输出不可避免地是复制品。例如,图像模型已知会重现电影截图,而语言模型则被发现几乎是在抄袭新闻文章。
研究中描述的方法聚焦于“高意外性”词汇——在特定语境中不常见的词汇。例如,在句子“Jack和我一动不动地坐着,雷达发出嗡嗡声”中,“雷达”是高意外性词汇,因为相比“引擎”或“收音机”等词汇,它出现在“嗡嗡声”前更不常见。
研究人员测试了多个OpenAI模型,包括GPT-4和GPT-3.5,通过从小说书籍片段和《纽约时报》文章中移除高意外性词汇,并要求模型预测这些缺失的词汇。如果模型能够准确猜测这些词汇,则表明它们在训练过程中记忆了这些文本。

一个让模型“猜测”高意外性词汇的示例。图片来源:OpenAI 结果显示,GPT-4很可能记忆了流行小说书籍的部分内容,包括BookMIA数据集中的受版权保护的电子书。它似乎也记忆了一些《纽约时报》的文章,尽管频率较低。华盛顿大学博士生、研究合著者Abhilasha Ravichander向TechCrunch强调,这些发现突显了训练这些模型可能使用的“有争议数据”。“为了拥有值得信赖的大型语言模型,我们需要能够对其进行探测、审计和科学检查的模型,”Ravichander表示。“我们的工作旨在提供一种探测大型语言模型的工具,但整个生态系统迫切需要更高的数据透明度。”
OpenAI一直推动放宽使用受版权保护数据开发AI模型的规则。尽管该公司与一些内容许可协议达成合作,并为版权持有者提供了退出选项,但它也在向各国政府游说,试图为AI训练建立专门的“合理使用”规则。
相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
评论 (34)
0/500
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?
一项最新研究表明,OpenAI可能确实使用了受版权保护的材料来训练其部分AI模型,为公司面临的持续法律争议增添了依据。作者、程序员和其他内容创作者指控OpenAI未经许可使用他们的作品——如书籍和代码——来开发其AI模型。虽然OpenAI以合理使用为由进行辩护,但原告认为美国版权法并未为训练数据提供例外条款。
这项研究由华盛顿大学、哥本哈根大学和斯坦福大学的研究人员合作开展,介绍了一种新技术,用于检测通过API访问的模型(如OpenAI的模型)中“记忆”的训练数据。AI模型通过从海量数据中学习来识别模式,从而能够生成文章、图像等。虽然大多数输出并非训练数据的直接复制,但由于学习过程,某些输出不可避免地是复制品。例如,图像模型已知会重现电影截图,而语言模型则被发现几乎是在抄袭新闻文章。
研究中描述的方法聚焦于“高意外性”词汇——在特定语境中不常见的词汇。例如,在句子“Jack和我一动不动地坐着,雷达发出嗡嗡声”中,“雷达”是高意外性词汇,因为相比“引擎”或“收音机”等词汇,它出现在“嗡嗡声”前更不常见。
研究人员测试了多个OpenAI模型,包括GPT-4和GPT-3.5,通过从小说书籍片段和《纽约时报》文章中移除高意外性词汇,并要求模型预测这些缺失的词汇。如果模型能够准确猜测这些词汇,则表明它们在训练过程中记忆了这些文本。

华盛顿大学博士生、研究合著者Abhilasha Ravichander向TechCrunch强调,这些发现突显了训练这些模型可能使用的“有争议数据”。“为了拥有值得信赖的大型语言模型,我们需要能够对其进行探测、审计和科学检查的模型,”Ravichander表示。“我们的工作旨在提供一种探测大型语言模型的工具,但整个生态系统迫切需要更高的数据透明度。”
OpenAI一直推动放宽使用受版权保护数据开发AI模型的规则。尽管该公司与一些内容许可协议达成合作,并为版权持有者提供了退出选项,但它也在向各国政府游说,试图为AI训练建立专门的“合理使用”规则。
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?





首页






