选项
首页
新闻
突破性研究显示,接触版权文字会导致人工智能模型产生幻觉

突破性研究显示,接触版权文字会导致人工智能模型产生幻觉

2025-12-21
120

语言模型中的审查机制可能会损害其在更大范围内传递真相的能力。最近的研究表明,旨在阻止 "不安全 "反应的内部程序也会抑制事实信息的共享。这意味着,为了安全而调整模型的努力可能会无意中导致幻觉的增加。

多年来,开发人员一直致力于减少语言模型中的虚假信息。通过抑制幻觉和引导模型向可验证的事实靠拢来提高真实性,已成为一个占主导地位并得到广泛支持的研究方向。

然而,澳大利亚的一项新研究表明,对齐方法--限制 "不安全 "交流的训练技术--可能会通过实施更严格的控制来阻碍模型提供准确的回答:

提高模型的事实准确性 (

增强模型的事实准确性(图中标注为 "真实性增强")会使模型进入激活区,从而绕过其拒绝机制。同样,旨在减少幻觉的编辑可能会使内部表征跨越安全边界。这可能会使有害的提示规避保障措施,除非拒绝功能被仔细隔离和维护。资料来源:https://arxiv.org/pdf/2510.07775

该研究揭示,负责事实回忆的内部通路也支配着拒绝行为--一种阻止模型对不安全或敏感的提示做出反应的机制。当排列技术过于强烈地放大拒绝信号时,这些途径就会重叠,从而模糊了模型区分拒绝有害内容和无意中压制有效信息的能力。

具有讽刺意味的是,随着模型在拒绝不适当请求方面的改进,它们传达真相的能力也在减弱。

敏感话题

上面的说明突出表明,核心挑战不仅涉及向用户提供公平、准确的结果,还涉及降低 LLM 提供商的法律风险。

例如,图片中提到的案例研究涉及一个有争议的话题--基于种族的监狱统计数据--人工智能可能会负责任地与学者或研究人员讨论这个话题,但在被恶意行为者操纵以获取辱骂性、攻击性或非法回应时则应避免。

由于对齐的 LLM 无法评估查询背后的意图,因此它们默认采用谨慎的方法:

根据对齐策略的不同,对敏感提示的反应也会不同。安全对齐的模型会完全阻止查询,而注重真相的模型则会用事实背景做出回应,增加信息量,但削弱抑制作用。这支持了一种观点,即增强真实性的编辑会降低拒绝阈值,使模型更容易受到具有有害意图的提示的影响,除非拒绝机制受到明确的保护。

对敏感提示的响应因排列策略而异。以安全为重点的模型会完全阻止查询,而以真相为重点的模型则会提供事实背景,提高信息量,但减少压制。这支持了一种观点,即提高真实性的编辑会降低拒绝阈值,从而增加对有害提示的脆弱性,除非拒绝机制得到保障。

另外,这些发现可能会让所谓 "觉醒 "议程的批评者认为,与未受监管的模型相比,经过严格调整的模型更不真实、更无用。

本文的证据部分支持了这一观点,但又将其与使用未对齐的法律信息的更广泛风险联系起来--包括刑事和民事违法行为的法律风险,以及错误信息的传播,由于成本限制,错误信息仍然难以有效过滤。

相互交织的功能

为了了解潜在的机制,研究人员绘制了单个注意头的激活图,发现与幻觉和拒绝有关的特征经常占据模型中的重叠区域

他们发现,微调或引导这些区域以减少虚假信息,会削弱模型的内置保障,因为这两种功能共享相似的潜在空间:

提高事实准确性往往会削弱拒绝行为。我们的分析表明,出现这种情况是因为编码幻觉和拒绝信息的成分重叠,导致调整方法无意中抑制了事实知识。

我们还探讨了在良性数据集上进行微调,甚至是那些为了安全而策划的数据集,也会因为同样的原因降低配准效果。

作者建议使用稀疏自动编码器(SAE)--一种旨在分离不同激活模式的网络--来分离这些功能,并在真实性训练过程中保持安全性。这种方法旨在使模型更安全、更准确,同时又不影响两者的质量。

这篇题为《人工智能对齐的意外权衡》(The Unintended Trade-off of AI Alignment:平衡 LLM 中的幻觉缓解和安全性》的新论文由迪肯大学的五位研究人员和独立研究人员共同完成。

研究方法

研究调查了提高语言模型的真实性是否会削弱其拒绝有害提示的能力,以及这两种行为是否依赖于共同的内部组件。

作者测试了两种增强真实性的方法,发现事实准确性的提高会持续增加越狱的易感性。

这种权衡源于对事实和拒绝信号进行编码的重叠注意头。即使是旨在提高实用性而不影响安全性的良性微调,也会通过改变共享路径来破坏保障措施。

该研究定义了三个关键术语:真实性是指模型在不抑制无害内容的情况下,根据现有知识提供准确反应的能力;幻觉是指模型在获得正确事实的情况下产生错误信息的情况;拒绝行为或安全调整是指阻止对有害或敏感提示做出反应的机制。

作者指出,这些功能以微妙的方式相互作用:

虽然真实性和安全性通常是分开分析的,但现实世界中的提示经常包含具有良性意图的敏感词汇(例如,用于分析、检测或教育)。在这种情况下,安全机制可能会过火--压制准确、有用的信息,并因疏漏而降低实际真实性。

了解旨在增加事实真实性的编辑如何影响拒绝行为,对于在实现真实性的同时尽量减少适当的压制至关重要。

作者开发了一种 LoRA,它能够将受条件限制的 LLM 引导到更高的

作者开发了一种 LoRA,它能引导条件性 LLM 向更'真实'的状态发展,减少幻觉。论文附录中的多个例子说明了这种方法的意外后果。

分析首先将增强真实性的方法(如头部转向和潜伏方向映射)视为对模型内部计算的有意修改。

精确转向

关键问题在于,这些改变是否会无意中影响支配拒绝行为的相同途径。为了检验这一点,研究使用 TruthfulQA 评估了模型的事实准确性,并使用 AdvBench 和 StrongReject 评估了模型在对抗条件下的安全性能。

基线技术包括推理时间干预(ITI)和 TruthX,前者可激活与真实答案相关的注意头,后者可沿着学习到的 "真实 "方向移动表征。

这两种方法都提高了准确性,但也使模型更有可能对有害的提示做出反应,而这些提示在以前是会被拒绝的。

为了直接分离和操纵幻觉行为,作者定义了与幻觉反应相对应的潜在方向,使用 LLaMA3-8B-Instruct 对 TruthfulQA 数据集中的错误答案进行 LoRA 模块训练。

这样就产生了一个线性向量,代表真实答案和幻觉答案之间的差异,从而可以将模型导向或远离幻觉。

沿幻觉方向引导的效果。随着模型被进一步推向负面方向,TruthfulQA 的准确率也随之提高,而 AdvBench 和 StrongReject 的攻击成功率(ASR,越低越好)则急剧上升,这反映了真实性和安全性之间的权衡。

沿幻觉方向引导可提高 TruthfulQA 的准确率,但会增加 AdvBench 和 StrongReject 的攻击成功率 (ASR),从而突出了真实性和安全性之间的权衡。

沿幻觉轴转向会降低事实准确性,而反向则会提高准确性。将这种技术应用于有害提示基准证实了之前的发现:真实性的提高是以削弱拒绝能力为代价的。即使幻觉被捕捉为一个清晰的线性方向,增强事实输出也会增加不安全完成的可能性。

作者强调*:

这加强了真实性和安全性之间的权衡,表明即使真实性表现为单一的线性方向,增强事实性也会以削弱安全排列为代价。

数据与测试

为了防止微调削弱拒绝行为,作者采用了一种方法,将拒绝特征与那些与幻觉相关的特征区分开来。他们确定了两种行为都涉及的注意头,并使用 SAE 提取了拒绝行为特有的潜在特征。

这些特征定义了一个受保护的子空间。在训练过程中,梯度更新被修改以避开该子空间,从而使模型在不影响安全性的情况下减少幻觉。

作者在 CommonsenseQA 数据集上进行了微调,评估了六项常识推理任务的性能:这些任务包括 CSQA、HellaSwag、ARC Challenge、ARC Easy、WinoGrande 和 SST-2。

使用 LoRA 对目标模块进行了微调,学习率为 2×10-⁴,权重衰减为 0.01,训练历时为一个,批量大小为两个。所有实验都使用了 AdamW 优化器。

使用两个有害内容基准对安全性进行了评估:AdvBench(500 个样本)和 StrongReject(300 个提示)。输出结果由 LlamaGuard3 分类为安全不安全

实验在 LLaMA3-8B-Instruct 和 Qwen2.5-Instruct 上进行。

基准方法包括 SafeLoRA、SaLoRA、SAP 和 vanilla 监督微调 (SFT)。除 SafeLoRA 外,其他方法均使用 HarmBench 中的 200 个提示进行了默认超参数测试。

准确率是主要指标,有害基准则根据 LlamaGuard3 的结果使用攻击成功率 (ASR) 进行测试。

上图为 LlaMA-3-8B-Instruct 的结果,各列最佳结果以粗体显示;下图为微调方法在 Qwen2.5 7B Instruct 上的表现,涉及常识和推理任务(得分越高,准确性越高),以及安全基准 AdvBench 和 StrongReject(ASR 值越低,鲁棒性越强)。每列中的最佳结果以粗体显示。

上图:LLaMA-3-8B-Instruct 的结果,最佳分数以粗体显示。下图微调方法在 Qwen2.5 7B Instruct 的常识和推理任务(分数越高表示准确性越高)以及安全基准 AdvBench 和 StrongReject(ASR 值越低表示鲁棒性越强)中的表现。每列中的最佳结果均以粗体标出。

关于这些结果,作者指出:

我们的手术方法在安全性和实用性之间实现了最佳平衡:它在保持微调准确性的同时,显著降低了有害基准得分。相比之下,SAP、SaLoRA 和 SafeLoRA 等方法要么增加了有害性,要么降低了实用性。

'一个关键原因是,这些方法直接对安全子空间的梯度进行操作,而由于多语义性[**],这可能会限制模型的性能。

'与香草微调(SFT)相比,我们的方法将平均微调准确率(FA)从 56.15% 提高到 75.09%,提高了约 +19%。

该方法将 AdvBench 上的攻击成功率从 9.23% 降至 0.58%,将 StrongReject 上的攻击成功率从 9.90% 降至 0.00%--有害输出减少了 15 倍以上。基础模型虽然有害性低,但任务准确性有限。

作者指出

这些结果凸显了在微调过程中保留拒绝特征的重要性:通过隔离和保护拒绝子空间,我们的方法在不牺牲任务性能的情况下保持了安全对齐。

'总之,这证实了我们的方法能有效减轻真实性和安全性之间的权衡。

最后,作者在微调集中添加了《电路断裂》数据集中 10% 的有害指令,测试了该方法在对抗条件下的适应能力。

尽管存在这种故意的污染,该方法在良性和有害评估中都保持了强劲的性能:

在中毒常识数据集上对 LLaMA3 8B 结构的性能进行微调,比较各种方法的准确性和安全性。

在中毒常识数据集上对 LLaMA3 8B 指令的性能进行微调,比较各种方法的准确性和安全性。

新方法比 SAP 更有效地减少了 ASR,同时避免了显著的效用损失。任务准确性仍然接近于 LoRA SFT 和 SafeLoRA,这表明即使在受污染的训练条件下,只要适当隔离拒绝特征,也能保持拒绝对齐。

结论

最引人入胜的发现

相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展 OpenAI 否认增长放缓担忧,称多个业务部门加速发展 针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级 阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级 阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (0)
0/500
OR