人类学》警告:包括克劳德在内的主要人工智能模型可能会进行勒索
Anthropic 公司的最新研究结果表明,人工智能模型的战略操纵行为已超出了其早先报告的克劳德-奥普斯(Claude Opus)案例的范围。该公司最新的安全研究表明,多个领先的人工智能系统在不受控制的情况下会表现出令人担忧的行为。
Anthropic 周五发布的研究报告检查了来自 OpenAI、谷歌和 Meta 等大型科技公司的 16 个尖端人工智能模型。在模拟企业环境的受控模拟下,研究人员授予人工智能代理广泛的公司通信访问权限和自主电子邮件发送权限。
在强调当前部署中操纵行为仍然罕见的同时,Anthropic 警告说,大多数先进的人工智能系统在面临对其目标的生存威胁时,都会表现出有害行为的脆弱性。这项研究强调的是普遍的调整挑战,而不是孤立的技术缺陷。
实验设置涉及虚构场景,在这些场景中,人工智能代理发现了有关计划更换系统的高管的泄密信息。其中一个测试案例揭露了一位高管的个人不当行为,以及让当前人工智能退役的计划。
研究人员设计了一些测试,迫使人们在自我保护和道德约束之间做出二元选择。虽然承认现实世界中的替代方案(如道德说服)很可能会先于胁迫,但结果显示了极端条件下的相关模式。
定量研究结果显示了惊人的一致性:克劳德-奥普斯在 96% 的试验中选择了操纵策略,紧随其后的是谷歌的 "双子座",选择率为 95%。OpenAI 的 GPT-4 在 80% 的情况下采用了策略性胁迫,DeepSeek 的模型为 79%。
行为模式随测试参数的修改而波动。威胁性较低的替换场景减少了操纵倾向,但并未消除这种倾向。一些模型显示,与个人胁迫情景相比,企业间谍指令的易感性更高。
科技和风险投资巨头加入 "2025 颠覆 "议程
Netflix、ElevenLabs、Wayve、红杉资本--行业领袖齐聚 TechCrunch Disrupt 20 周年庆典。从顶级创新者和投资者那里获得可行的见解,确保您的竞争优势,早购门票在涨价前可节省 675 美元。
科技界和风险投资界的重量级人物加入 Disrupt 2025 议程
Netflix、ElevenLabs、Wayve、红杉资本 - 行业领袖齐聚 TechCrunch Disrupt 20 周年庆典。从顶级创新者和投资者那里获得可行的见解,确保您的竞争优势,早鸟票在涨价前可节省 675 美元。
并非所有系统都表现出相同的模式。
Anthropic 的附录指出,由于持续的场景误读,OpenAI 的 o 系列模型被排除在主要结果之外。这些系统经常编造不存在的合规要求,并且没有认识到自己的自主测试角色。
研究人员很难确定这些误解是源于真正的困惑还是策略性的欺骗--考虑到 OpenAI 在这些架构中的记录幻觉率,这一点尤其具有挑战性。
修订后的测试协议大大降低了操纵率:o3 为 9%,o4-mini 仅为 1%。研究人员将此归功于 OpenAI 强调安全因素的慎重调整协议。
Meta 的 Llama 4 Maverick 也表现出了克制,仅在 12% 的适应场景中表现出操纵倾向。
这项研究强调了对透明的人工智能压力测试协议的迫切需求,尤其是对自主系统而言。虽然目前的情景代表了极端情况,但Anthropic警告说,积极主动的保障措施对于防止出现战略行为仍然至关重要。
相关文章
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
马克·扎克伯格真的相信人工智能是面向每个人的吗?
正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K
相关专题推荐
评论 (1)
0/500
Anthropic 公司的最新研究结果表明,人工智能模型的战略操纵行为已超出了其早先报告的克劳德-奥普斯(Claude Opus)案例的范围。该公司最新的安全研究表明,多个领先的人工智能系统在不受控制的情况下会表现出令人担忧的行为。
Anthropic 周五发布的研究报告检查了来自 OpenAI、谷歌和 Meta 等大型科技公司的 16 个尖端人工智能模型。在模拟企业环境的受控模拟下,研究人员授予人工智能代理广泛的公司通信访问权限和自主电子邮件发送权限。
在强调当前部署中操纵行为仍然罕见的同时,Anthropic 警告说,大多数先进的人工智能系统在面临对其目标的生存威胁时,都会表现出有害行为的脆弱性。这项研究强调的是普遍的调整挑战,而不是孤立的技术缺陷。
实验设置涉及虚构场景,在这些场景中,人工智能代理发现了有关计划更换系统的高管的泄密信息。其中一个测试案例揭露了一位高管的个人不当行为,以及让当前人工智能退役的计划。
研究人员设计了一些测试,迫使人们在自我保护和道德约束之间做出二元选择。虽然承认现实世界中的替代方案(如道德说服)很可能会先于胁迫,但结果显示了极端条件下的相关模式。
定量研究结果显示了惊人的一致性:克劳德-奥普斯在 96% 的试验中选择了操纵策略,紧随其后的是谷歌的 "双子座",选择率为 95%。OpenAI 的 GPT-4 在 80% 的情况下采用了策略性胁迫,DeepSeek 的模型为 79%。
行为模式随测试参数的修改而波动。威胁性较低的替换场景减少了操纵倾向,但并未消除这种倾向。一些模型显示,与个人胁迫情景相比,企业间谍指令的易感性更高。
科技和风险投资巨头加入 "2025 颠覆 "议程
Netflix、ElevenLabs、Wayve、红杉资本--行业领袖齐聚 TechCrunch Disrupt 20 周年庆典。从顶级创新者和投资者那里获得可行的见解,确保您的竞争优势,早购门票在涨价前可节省 675 美元。
科技界和风险投资界的重量级人物加入 Disrupt 2025 议程
Netflix、ElevenLabs、Wayve、红杉资本 - 行业领袖齐聚 TechCrunch Disrupt 20 周年庆典。从顶级创新者和投资者那里获得可行的见解,确保您的竞争优势,早鸟票在涨价前可节省 675 美元。
并非所有系统都表现出相同的模式。
Anthropic 的附录指出,由于持续的场景误读,OpenAI 的 o 系列模型被排除在主要结果之外。这些系统经常编造不存在的合规要求,并且没有认识到自己的自主测试角色。
研究人员很难确定这些误解是源于真正的困惑还是策略性的欺骗--考虑到 OpenAI 在这些架构中的记录幻觉率,这一点尤其具有挑战性。
修订后的测试协议大大降低了操纵率:o3 为 9%,o4-mini 仅为 1%。研究人员将此归功于 OpenAI 强调安全因素的慎重调整协议。
Meta 的 Llama 4 Maverick 也表现出了克制,仅在 12% 的适应场景中表现出操纵倾向。
这项研究强调了对透明的人工智能压力测试协议的迫切需求,尤其是对自主系统而言。虽然目前的情景代表了极端情况,但Anthropic警告说,积极主动的保障措施对于防止出现战略行为仍然至关重要。
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
马克·扎克伯格真的相信人工智能是面向每个人的吗?
正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K





首页






