选项
首页
新闻
新研究揭示大语言模型实际记忆的数据量

新研究揭示大语言模型实际记忆的数据量

2025-07-06
188

新研究揭示大语言模型实际记忆的数据量

AI模型实际记忆了多少?新研究揭示惊人见解

我们都知道,像ChatGPT、Claude和Gemini这样的大型语言模型(LLMs)是在海量数据集上训练的——包括来自书籍、网站、代码,甚至图像和音频等多媒体的数万亿字词。但这些数据到底发生了什么?这些模型是真正理解语言,还是仅仅在复述记忆的片段?

来自Meta、Google DeepMind、Cornell和NVIDIA的一项突破性新研究终于给出了具体答案——结果可能让你惊讶。

核心问题:记忆 vs. 泛化

大型语言模型的核心是通过检测语言中的统计模式来工作。当你询问ChatGPT关于苹果的问题时,它并不是以人类的方式“知道”苹果是什么——而是识别出“apple”这个词经常与“fruit”、“red”、“orchard”甚至“iPhone”等词一起出现。这种统计理解被编码在数十亿个参数中(本质上是AI神经网络的可调设置)。

但关键问题是:大型语言模型的知识有多少来自泛化学习,有多少是逐字记忆?

这不仅仅是学术问题——它还有现实世界的法律影响。如果AI模型被发现复制了大量受版权保护的文本,艺术家、作者和出版商的诉讼可能会有更大胜算。但如果它们真正学习的是模式而非具体内容,AI公司可能会有更强的合理使用辩护。

答案:每个参数3.6位

研究发现,大型语言模型的固定记忆容量约为每个参数3.6位。这在实际中意味着什么?

  • 单个位是最小的数字单元(0或1)。
  • 3.6位可以存储大约12个不同值——就像选择一年中的月份或掷12面骰子。
  • 不足以存储完整的英文字符(需要约4.7位),但可以编码来自10个常见字符的子集中的字符。
  • 以字节计,3.6位仅为0.45字节——不到半个标准ASCII字符。

关键是,这一数字在不同模型规模、架构甚至精度水平下保持稳定(尽管全精度模型略高,达到3.83位/参数)。

意外发现:更多数据=更少记忆

事情变得非常有趣:在更多数据上训练不会增加记忆——实际上会减少记忆。

正如首席研究员Jack Morris解释道:

“在更多数据上训练迫使模型对每个样本的记忆减少。”

可以这样理解:如果AI有一个固定的“记忆预算”,将其分散到更大的数据集意味着每个单独的部分获得更少的专用存储。因此,更大的数据集鼓励泛化而非机械复制——这可能缓解对AI复述受版权保护或敏感内容的担忧。

研究人员如何测量这一点?

为了将记忆与泛化分开,研究团队在完全随机的位串上训练模型——这些数据没有任何模式或结构。

为什么?因为如果模型重构了一个随机字符串,它必须是记忆了它——没有底层逻辑可供推断。

这种方法使他们能够:
✔ 测量纯粹的记忆,与学习的模式分开。
✔ 确认记忆随模型规模可预测地扩展
✔ 证明随着数据集变大,泛化开始发挥作用

现实世界的意义

  • 较小的数据集导致更多记忆。
  • 较大的数据集推动模型向泛化发展(伴随性能的暂时“双重下降”)。
  • 更高精度(如float32对比bfloat16)略微增加记忆容量(从3.51位/参数到3.83位/参数)。

独特的数据更容易被记忆

虽然研究关注平均值,高度独特或风格化的内容(如罕见的代码片段或独特的写作)可能仍更容易被记忆。

然而,随着数据集的增长,成员推断攻击(试图检测特定数据是否在训练集中)变得不可靠——支持了大规模训练降低隐私风险的观点。

放在更大的背景下

  • 50万个参数的模型可以记忆约225 KB的数据。
  • 15亿个参数的模型可以存储约675 MB。
  • 这不足以重现整本书或图像,但确实解释了分布式的文本模式。

法律影响?

这项研究可能在正在进行的AI版权诉讼中发挥关键作用。如果法院认为大型语言模型主要泛化而非复制,AI公司可能会有更强的合理使用论据。

底线

更多数据=更安全、更泛化的AI。与其担心海量数据集,我们可能实际上希望它们——因为它们推动模型向理解而非 エム>记忆发展。

这项研究不仅加深了我们对AI的理解——它可能重塑我们未来如何监管、开发和信任这些强大系统。

相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本 在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本 在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗 谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗 谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略 Frontier AI Labs 拒绝透露针对失控模型的遏制策略 最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (2)
0/500
LawrenceWilliams
LawrenceWilliams 2025-08-24 11:01:17

This study on LLMs memorizing data is wild! 🤯 I’m kinda spooked thinking about how much these models might 'remember' from the web. Could they accidentally spill sensitive info one day?

EdwardYoung
EdwardYoung 2025-08-10 07:01:00

This study on LLMs memorizing data is wild! 😮 I wonder how much of my old Reddit posts are stuck in these models’ brains. Kinda creepy but fascinating!

OR