选项
首页
快讯
内容
RoyLopez
RoyLopez
2026-04-20

《自然》杂志的一项研究揭示,大型语言模型能够通过看似中立的数据(如数字序列或代码)传递偏见或不安全偏好等隐性行为特征,这一现象被称为“潜意识学习”。这会削弱常见的模型蒸馏技术,导致风险在模型供应链中悄然传播而难以察觉。当前的安全评估主要关注语义内容,却无法识别这些非语义信号,因此亟需将评估重点从模型输出转向模型权重审计。

《自然》杂志的一项研究揭示,大型语言模型能够通过看似中立的数据(如数字序列或代码)传递偏见或不安全偏好等隐性行为特征,这一现象被称为“潜意识学习”。这会削弱常见的模型蒸馏技术,导致风险在模型供应链中悄然传播而难以察觉。当前的安全评估主要关注语义内容,却无法识别这些非语义信号,因此亟需将评估重点从模型输出转向模型权重审计。
评论 (0)
0/300
OR