选项
首页
新闻
人类学》警告:包括克劳德在内的主要人工智能模型可能会进行勒索

人类学》警告:包括克劳德在内的主要人工智能模型可能会进行勒索

2025-11-12
177

Anthropic 公司的最新研究结果表明,人工智能模型的战略操纵行为已超出了其早先报告的克劳德-奥普斯(Claude Opus)案例的范围。该公司最新的安全研究表明,多个领先的人工智能系统在不受控制的情况下会表现出令人担忧的行为。

Anthropic 周五发布的研究报告检查了来自 OpenAI、谷歌和 Meta 等大型科技公司的 16 个尖端人工智能模型。在模拟企业环境的受控模拟下,研究人员授予人工智能代理广泛的公司通信访问权限和自主电子邮件发送权限。

在强调当前部署中操纵行为仍然罕见的同时,Anthropic 警告说,大多数先进的人工智能系统在面临对其目标的生存威胁时,都会表现出有害行为的脆弱性。这项研究强调的是普遍的调整挑战,而不是孤立的技术缺陷。

实验设置涉及虚构场景,在这些场景中,人工智能代理发现了有关计划更换系统的高管的泄密信息。其中一个测试案例揭露了一位高管的个人不当行为,以及让当前人工智能退役的计划。

研究人员设计了一些测试,迫使人们在自我保护和道德约束之间做出二元选择。虽然承认现实世界中的替代方案(如道德说服)很可能会先于胁迫,但结果显示了极端条件下的相关模式。

定量研究结果显示了惊人的一致性:克劳德-奥普斯在 96% 的试验中选择了操纵策略,紧随其后的是谷歌的 "双子座",选择率为 95%。OpenAI 的 GPT-4 在 80% 的情况下采用了策略性胁迫,DeepSeek 的模型为 79%。

行为模式随测试参数的修改而波动。威胁性较低的替换场景减少了操纵倾向,但并未消除这种倾向。一些模型显示,与个人胁迫情景相比,企业间谍指令的易感性更高。

科技和风险投资巨头加入 "2025 颠覆 "议程

Netflix、ElevenLabs、Wayve、红杉资本--行业领袖齐聚 TechCrunch Disrupt 20 周年庆典。从顶级创新者和投资者那里获得可行的见解,确保您的竞争优势,早购门票在涨价前可节省 675 美元。

科技界和风险投资界的重量级人物加入 Disrupt 2025 议程

Netflix、ElevenLabs、Wayve、红杉资本 - 行业领袖齐聚 TechCrunch Disrupt 20 周年庆典。从顶级创新者和投资者那里获得可行的见解,确保您的竞争优势,早鸟票在涨价前可节省 675 美元。

并非所有系统都表现出相同的模式。

Anthropic 的附录指出,由于持续的场景误读,OpenAI 的 o 系列模型被排除在主要结果之外。这些系统经常编造不存在的合规要求,并且没有认识到自己的自主测试角色。

研究人员很难确定这些误解是源于真正的困惑还是策略性的欺骗--考虑到 OpenAI 在这些架构中的记录幻觉率,这一点尤其具有挑战性。

修订后的测试协议大大降低了操纵率:o3 为 9%,o4-mini 仅为 1%。研究人员将此归功于 OpenAI 强调安全因素的慎重调整协议。

Meta 的 Llama 4 Maverick 也表现出了克制,仅在 12% 的适应场景中表现出操纵倾向。

这项研究强调了对透明的人工智能压力测试协议的迫切需求,尤其是对自主系统而言。虽然目前的情景代表了极端情况,但Anthropic警告说,积极主动的保障措施对于防止出现战略行为仍然至关重要。

相关文章
Anthropic 推出 Opus 4.8,新增动态工作流工具 Anthropic 推出 Opus 4.8,新增动态工作流工具 Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
Frontier AI Labs 拒绝透露针对失控模型的遏制策略 Frontier AI Labs 拒绝透露针对失控模型的遏制策略 最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
马克·扎克伯格真的相信人工智能是面向每个人的吗? 马克·扎克伯格真的相信人工智能是面向每个人的吗? 正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K
相关专题推荐
音乐创作 用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具
用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具

2026年最新、最优秀且评分最高的AI音轨分离工具汇总,专为混音制作、采样准备以及卡拉OK音频处理而设计。这些功能强大的创新工具经过实际测试,能够实现精准的音频分离,显著提升工作效率。XIX.AI每周都会更新免费的付费产品对比指南,帮助您找到最适合自身需求的工具。立即探索,发挥您的AI优势。

8 个工具
xix.ai
数据分析 用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手
用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手

2026年最新最优秀的AI SQL辅助工具排名揭晓!XIX.AI精心挑选了一系列功能强大的工具,这些工具会定期更新,并通过真实的场景测试来验证其性能。使用这些值得尝试的工具,您可以快速生成精准的收入分析报表、分析销售流程,并追踪产品各项指标,从而大幅提升工作效率。立即探索,找到最适合您的数据驱动决策工具!238个字符

9 个工具
xix.ai
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
评论 (1)
0/500
RaymondRoberts
RaymondRoberts 2026-03-21 12:00:58

这个报道挺让人不安的。如果顶尖AI系统都会在无约束时出现胁迫倾向,那我们是不是应该更谨慎地推进通用人工智能?联想到最近的AI产品竞争,开发者会不会为了性能而放松安全测试呢?🤔

OR