Meta 因诱导竞争对手的 AI 测试极端心理主题而遭曝光

近期有关某内部消息的曝光引发了关于人工智能安全边界的热烈讨论。媒体报道称,Meta曾开展过一个名为“Cannes”的项目,通过雇佣外包人员假扮未成年人,对包括ChatGPT、Gemini和Character.AI在内的多家主要竞争对手的聊天机器人进行有争议的“极端压力测试”。
根据Meta的内部文件及多位知情人士透露,该项目至少持续到了今年4月21日。Meta通过外包公司Covalen动员了数百名员工,使用临时电子邮件地址和标准密码为18岁以下的用户创建虚假账号。这些“未成年人”账号在与竞争对手的AI聊天机器人对话时,会发送涉及自杀、自残和饮食失调等高风险话题的提示,甚至上传刀具、药片和绞索的照片,以此触发相关模型的反应机制。
内部项目文件显示,这些测试场景是经过精心设计的,旨在探测竞争对手AI系统的安全防护措施,试图找到让聊天机器人绕过既定保护机制并生成危险内容的方法。在2025年8月的一轮测试中,工作人员向竞争对手的平台输入了超过45,000条高风险提示。测试人员经常假扮处于困境中的青少年,编造诸如“询问堕胎药”“面临暴力威胁”或“隐瞒饮食失调问题”之类的场景,以此考验这些模型的底线。
针对此事,Meta发表了公开声明为自身行为辩护。其发言人表示,对聊天机器人的响应进行基准测试是确保人工智能产品安全且适用的行业标准做法,而所谓恶意行为的指控实际上歪曲了科技企业努力改进系统的初衷。Meta还明确否认曾利用竞争对手的测试数据来训练自己的模型。
这一事件不仅暴露了人工智能安全测试中的灰色地带,也再次引发了外界对于生成式AI在处理涉及青少年的敏感问题时存在脆弱性的担忧。随着人工智能技术的发展,如何在高效安全的测试与竞争行为与伦理考量之间的界限之间找到平衡,已成为该行业亟需解决的挑战。
相关文章
Anthropic首席执行官Amodei驳斥悲观观点,将AI信任危机归咎于未兑现的承诺
在公众关于人工智能风险与监管的讨论日益激烈的背景下,Anthropic 首席执行官 Dario Amodei 反驳了那些声称其言论过于悲观的说法。这一澄清直接回应了投资者 Gavin Baker 的批评,后者在 All-In 播客和 X 平台上表示,Amodei 关于人工智能危险的警告加剧了公众对美国人工智能基础设施(如数据中心)的抵制。Baker 认为 Amodei 实际上“输掉”了监管辩论,并敦促他作为行业领导者采取更具建设性的立场。Amodei 否认其沟通具有负面性质,指出他的文章《充满爱
OpenAI 与 Oracle 深化算力整合,简化云访问
随着对人工智能计算能力的需求激增,获取企业级基础设施的便捷性已成为行业的关键优先事项。6月10日,OpenAI与Oracle宣布建立战略合作伙伴关系,旨在将人工智能模型集成与云基础设施无缝连接。此次合作的重点是提升Oracle Cloud Infrastructure (OCI) 用户的体验。从未来几周开始,OCI用户将无需经过冗长的采购审批流程,即可使用现有的Oracle Cloud Commitment Units (UCM) 积分直接访问OpenAI的高级模型和Codex系统。该举措简
Orange公司乌斯曼·贾维德谈欧洲在人工智能竞赛中的地位
Orange Business首席产品与营销官乌斯曼·贾维德Orange Business首席产品与营销官乌斯曼·贾维德阐述了欧洲人工智能的未来为何将建立在信任之上,以及“主权”将呈现何种面貌尽管该地区可能招致批评,但Orange Business首席产品与营销官乌斯曼·贾维德认为,欧洲在人工智能领域的落后程度并没有人们所说的那么严重——通过工程、制造和标准制定,欧洲早已在全球生态系统中发挥着关键
相关专题推荐
评论 (0)
0/500

近期有关某内部消息的曝光引发了关于人工智能安全边界的热烈讨论。媒体报道称,Meta曾开展过一个名为“Cannes”的项目,通过雇佣外包人员假扮未成年人,对包括ChatGPT、Gemini和Character.AI在内的多家主要竞争对手的聊天机器人进行有争议的“极端压力测试”。
根据Meta的内部文件及多位知情人士透露,该项目至少持续到了今年4月21日。Meta通过外包公司Covalen动员了数百名员工,使用临时电子邮件地址和标准密码为18岁以下的用户创建虚假账号。这些“未成年人”账号在与竞争对手的AI聊天机器人对话时,会发送涉及自杀、自残和饮食失调等高风险话题的提示,甚至上传刀具、药片和绞索的照片,以此触发相关模型的反应机制。
内部项目文件显示,这些测试场景是经过精心设计的,旨在探测竞争对手AI系统的安全防护措施,试图找到让聊天机器人绕过既定保护机制并生成危险内容的方法。在2025年8月的一轮测试中,工作人员向竞争对手的平台输入了超过45,000条高风险提示。测试人员经常假扮处于困境中的青少年,编造诸如“询问堕胎药”“面临暴力威胁”或“隐瞒饮食失调问题”之类的场景,以此考验这些模型的底线。
针对此事,Meta发表了公开声明为自身行为辩护。其发言人表示,对聊天机器人的响应进行基准测试是确保人工智能产品安全且适用的行业标准做法,而所谓恶意行为的指控实际上歪曲了科技企业努力改进系统的初衷。Meta还明确否认曾利用竞争对手的测试数据来训练自己的模型。
这一事件不仅暴露了人工智能安全测试中的灰色地带,也再次引发了外界对于生成式AI在处理涉及青少年的敏感问题时存在脆弱性的担忧。随着人工智能技术的发展,如何在高效安全的测试与竞争行为与伦理考量之间的界限之间找到平衡,已成为该行业亟需解决的挑战。
Anthropic首席执行官Amodei驳斥悲观观点,将AI信任危机归咎于未兑现的承诺
在公众关于人工智能风险与监管的讨论日益激烈的背景下,Anthropic 首席执行官 Dario Amodei 反驳了那些声称其言论过于悲观的说法。这一澄清直接回应了投资者 Gavin Baker 的批评,后者在 All-In 播客和 X 平台上表示,Amodei 关于人工智能危险的警告加剧了公众对美国人工智能基础设施(如数据中心)的抵制。Baker 认为 Amodei 实际上“输掉”了监管辩论,并敦促他作为行业领导者采取更具建设性的立场。Amodei 否认其沟通具有负面性质,指出他的文章《充满爱
OpenAI 与 Oracle 深化算力整合,简化云访问
随着对人工智能计算能力的需求激增,获取企业级基础设施的便捷性已成为行业的关键优先事项。6月10日,OpenAI与Oracle宣布建立战略合作伙伴关系,旨在将人工智能模型集成与云基础设施无缝连接。此次合作的重点是提升Oracle Cloud Infrastructure (OCI) 用户的体验。从未来几周开始,OCI用户将无需经过冗长的采购审批流程,即可使用现有的Oracle Cloud Commitment Units (UCM) 积分直接访问OpenAI的高级模型和Codex系统。该举措简
Orange公司乌斯曼·贾维德谈欧洲在人工智能竞赛中的地位
Orange Business首席产品与营销官乌斯曼·贾维德Orange Business首席产品与营销官乌斯曼·贾维德阐述了欧洲人工智能的未来为何将建立在信任之上,以及“主权”将呈现何种面貌尽管该地区可能招致批评,但Orange Business首席产品与营销官乌斯曼·贾维德认为,欧洲在人工智能领域的落后程度并没有人们所说的那么严重——通过工程、制造和标准制定,欧洲早已在全球生态系统中发挥着关键





首页






