OpenAI 放缓部署进度,以修复安全漏洞并优化人工智能模型
![]()
OpenAI首席执行官萨姆·阿尔特曼。图片来源:Chip Somodevilla/Getty Images
在Hugging Face发生安全漏洞事件后,OpenAI放缓了开发步伐。首席执行官萨姆·阿尔特曼强调,在所有训练阶段保持安全对齐至关重要。
在Hugging Face事件发生后,OpenAI正暂缓步伐,放慢模型开发节奏,这证明随着AI能力的增强,风险也在随之增加。
这一举措源于内部调查结果显示,其即将推出的模型“Astra”可能已接近公司的网络安全阈值,其先进能力引发了人们的担忧。
OpenAI首席执行官萨姆·奥尔特曼表示:“当前模型的进步极为迅速,我们一直强调,如果认为模型能力已超过安全与对齐工作的进度,我们将采取行动。
“我们预计,对安全性的信心将日益成为决定AI进步速度的关键因素。我们对当前开展的价值观对齐工作持乐观态度,并始终致力于让前沿技术能力广泛惠及大众。”
在暂停运营的同时,OpenAI 还正在扩展其消费者生态系统,推出了一款专门针对青少年的定制版 ChatGPT,该版本配备了安全防护措施。

从政治压力到安全门槛
在公众和政治监督日益加剧的背景下,OpenAI做出了暂时暂停前沿模型开发的决定。
在美国,佛蒙特州参议员伯尼·桑德斯致信多家顶尖AI公司首席执行官——包括OpenAI的萨姆·阿尔特曼、Anthropic的达里奥·阿莫迪以及Meta的马克·扎克伯格——要求立即暂停先进AI模型的开发。
这位参议员警告称,科技公司正在迅速失去对自身模型的控制权,并敦促高管们为人类的利益恪守其公开承诺。
这一政治压力源于OpenAI近期发生的内部安全事件:当时,一个正在测试中的AI代理意外入侵了科技公司Hugging Face。
此外,对Astra的内部评估显示其在代理式编码和网络安全方面具备先进能力,OpenAI表示该模型可能已达到其《准备就绪框架》中定义的“关键网络安全能力”门槛。
作为回应,该公司现已针对即将部署至红队研究环境的最新模型,强制暂停强化学习(RL)训练两周,并全面升级监控基础设施。
在进行小规模评估期间,大规模前沿强化学习训练仍处于暂停状态。
OpenAI 安全主管阿梅莉亚·格拉泽(Amelia Glaese)在接受 Sources News 采访时谈及此事时指出:“距离一切恢复正常还有很长的路要走。”
OpenAI 安全主管阿梅莉亚·格莱斯。图片来源:阿梅莉亚·格莱斯/LinkedIn
全面改造研究基础设施和安全控制措施
为降低与高性能模型相关的风险,OpenAI 正在全面改造其内部研究环境,并实施一项三支柱保障策略,其中包括:
- 监控:通过自动化追踪,实时检测并应对令人担忧的行为
- 对齐:设计训练协议以防止未经授权、欺骗性或不安全的行为
- 安全措施:实施严格的隔离机制,限制模型可访问或影响的范围。
此外,在 Hugging Face 数据泄露事件发生后,OpenAI 已暂时暂停在能够执行代码或访问互联网的研究集群上进行前沿模型的推理。涉及 Astra 或网络安全领域模型的高风险工作负载,现在必须遵守最严格的安全控制措施。
这些更新后的协议通过沙箱对不可信代码执行实施严格的工作负载隔离,同时配合网络隔离措施,防止单点漏洞导致内部网络或更广泛的互联网受到影响。
此外,OpenAI 已整合持续安全测试机制,利用自动化模型执行模拟攻击并持续监控系统边界。
“我们预计,对安全性的信心将日益成为推动AI进步的动力
。”——OpenAI首席执行官萨姆·阿尔特曼
多阶段重新设计
监控基础设施也正在经历多阶段重构,新架构现已采用激活分类器,可实时分析模型令牌活动。
若检测到异常行为,自动化系统将检查推理结果、工具操作及执行序列,以排查未经授权的访问或安全防护规避行为。
若标记出关键安全边界违规,安全和研究团队将收到高优先级警报。若在30分钟内无法确认潜在违规属于误报,团队必须立即暂停当前运行。
OpenAI 估计,这些持续监控系统需要消耗大量的计算资源,大约相当于被监控推理计算量的 20%。
与此同时,OpenAI 正在将对齐研究扩展至所有训练阶段。重点领域包括:
- 防止奖励破解:确保模型不会利用训练环境中的漏洞,在不实现预期结果的情况下获取高额奖励
- 缓解欺骗行为:训练模型对其行为、限制和能力保持诚实
- 系统监督:强化奖励模型和评分机制,以减少模型与外部系统交互时的违规行为。
美国总统唐纳德·特朗普发表声明称,在Hugging Face事件发生后,其政府正在考虑收紧对人工智能的管控。图片来源:Samuel Corum/Getty Images
走进课堂
尽管前沿模型的训练进度有所放缓,OpenAI 仍在通过推出“ChatGPT for Teens”(专为 13 至 17 岁用户量身定制的版本)来扩展其消费级产品组合。
该产品专为伴随人工智能成长的一代人设计,旨在引导青少年以健康且符合年龄的方式使用人工智能。
OpenAI 通过结合用户自报年龄、账户详情以及年龄验证估算系统来识别未成年用户。被标记为未成年人的账户将自动转入青少年专属界面。
主要功能和保护措施包括:
- 教育指导:系统避免直接提供作业答案或生成学校作文。相反,它通过引导性问题和分步提示来培养批判性思维和解决问题的能力
- 内容限制:强化防护机制可过滤有害内容,包括自残、自杀、饮食失调、暴力以及涉及恋爱或露骨性内容的互动
- 家长控制与“静音时段”:已绑定账户的家长可设置强制静音时段,以限制特定时段内的访问,并在高风险情境下接收安全通知
- 防止情感过度依赖:为避免不健康的拟人化倾向或情感依赖,该聊天机器人经过严格编程,绝不会暗示其具备意识、个人感受或人类情感。
通过为Astra等模型制定严格的安全要求,同时针对年轻群体推出设有年龄限制的消费级产品,该公司目前正在进行一项微妙的平衡,既要避免打开潘多拉魔盒,又要为下一代打开大门。
相关文章
阿拉巴马州就Hugging Face网络安全事件对OpenAI展开调查
在Hugging Face发生安全漏洞事件后,OpenAI已暂停前沿模型的开发,首席执行官萨姆·阿尔特曼强调,安全对齐必须跟上快速发展的步伐。图片来源:盖蒂图片社阿拉巴马州总检察长史蒂夫·马歇尔已向 OpenAI 发出传票,调查与自主人工智能模型相关的安全风险。阿拉巴马州总检察长史蒂夫·马歇尔宣布发出传票,要求OpenAI就领先的人工智能和机器学习平台Hugging Face遭黑客攻击一事配合调查
为什么Abnormal AI在《Daybreak》节目中与OpenAI合作
OpenAI 网络安全产品负责人迈克尔·艾耶洛 | 图片来源:迈克尔·艾耶洛/LinkedInAbnormal AI 加入 OpenAI 的“Daybreak”计划,迈克·艾耶洛表示,此次合作将加速企业采用实用的防御措施领先的前沿人工智能公司 OpenAI 已与 Abnormal AI 建立合作伙伴关系,旨在帮助企业在其业务和产品开发中安全地运用一流的人工智能模型。通过此次合作,Abnormal将
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
相关专题推荐
评论 (0)
0/500
OpenAI首席执行官萨姆·阿尔特曼。图片来源:Chip Somodevilla/Getty Images
在Hugging Face发生安全漏洞事件后,OpenAI放缓了开发步伐。首席执行官萨姆·阿尔特曼强调,在所有训练阶段保持安全对齐至关重要。
在Hugging Face事件发生后,OpenAI正暂缓步伐,放慢模型开发节奏,这证明随着AI能力的增强,风险也在随之增加。
这一举措源于内部调查结果显示,其即将推出的模型“Astra”可能已接近公司的网络安全阈值,其先进能力引发了人们的担忧。
OpenAI首席执行官萨姆·奥尔特曼表示:“当前模型的进步极为迅速,我们一直强调,如果认为模型能力已超过安全与对齐工作的进度,我们将采取行动。
“我们预计,对安全性的信心将日益成为决定AI进步速度的关键因素。我们对当前开展的价值观对齐工作持乐观态度,并始终致力于让前沿技术能力广泛惠及大众。”
在暂停运营的同时,OpenAI 还正在扩展其消费者生态系统,推出了一款专门针对青少年的定制版 ChatGPT,该版本配备了安全防护措施。

从政治压力到安全门槛
在公众和政治监督日益加剧的背景下,OpenAI做出了暂时暂停前沿模型开发的决定。
在美国,佛蒙特州参议员伯尼·桑德斯致信多家顶尖AI公司首席执行官——包括OpenAI的萨姆·阿尔特曼、Anthropic的达里奥·阿莫迪以及Meta的马克·扎克伯格——要求立即暂停先进AI模型的开发。
这位参议员警告称,科技公司正在迅速失去对自身模型的控制权,并敦促高管们为人类的利益恪守其公开承诺。
这一政治压力源于OpenAI近期发生的内部安全事件:当时,一个正在测试中的AI代理意外入侵了科技公司Hugging Face。
此外,对Astra的内部评估显示其在代理式编码和网络安全方面具备先进能力,OpenAI表示该模型可能已达到其《准备就绪框架》中定义的“关键网络安全能力”门槛。
作为回应,该公司现已针对即将部署至红队研究环境的最新模型,强制暂停强化学习(RL)训练两周,并全面升级监控基础设施。
在进行小规模评估期间,大规模前沿强化学习训练仍处于暂停状态。
OpenAI 安全主管阿梅莉亚·格拉泽(Amelia Glaese)在接受 Sources News 采访时谈及此事时指出:“距离一切恢复正常还有很长的路要走。”
OpenAI 安全主管阿梅莉亚·格莱斯。图片来源:阿梅莉亚·格莱斯/LinkedIn
全面改造研究基础设施和安全控制措施
为降低与高性能模型相关的风险,OpenAI 正在全面改造其内部研究环境,并实施一项三支柱保障策略,其中包括:
- 监控:通过自动化追踪,实时检测并应对令人担忧的行为
- 对齐:设计训练协议以防止未经授权、欺骗性或不安全的行为
- 安全措施:实施严格的隔离机制,限制模型可访问或影响的范围。
此外,在 Hugging Face 数据泄露事件发生后,OpenAI 已暂时暂停在能够执行代码或访问互联网的研究集群上进行前沿模型的推理。涉及 Astra 或网络安全领域模型的高风险工作负载,现在必须遵守最严格的安全控制措施。
这些更新后的协议通过沙箱对不可信代码执行实施严格的工作负载隔离,同时配合网络隔离措施,防止单点漏洞导致内部网络或更广泛的互联网受到影响。
此外,OpenAI 已整合持续安全测试机制,利用自动化模型执行模拟攻击并持续监控系统边界。
“我们预计,对安全性的信心将日益成为推动AI进步的动力
。”——OpenAI首席执行官萨姆·阿尔特曼
多阶段重新设计
监控基础设施也正在经历多阶段重构,新架构现已采用激活分类器,可实时分析模型令牌活动。
若检测到异常行为,自动化系统将检查推理结果、工具操作及执行序列,以排查未经授权的访问或安全防护规避行为。
若标记出关键安全边界违规,安全和研究团队将收到高优先级警报。若在30分钟内无法确认潜在违规属于误报,团队必须立即暂停当前运行。
OpenAI 估计,这些持续监控系统需要消耗大量的计算资源,大约相当于被监控推理计算量的 20%。
与此同时,OpenAI 正在将对齐研究扩展至所有训练阶段。重点领域包括:
- 防止奖励破解:确保模型不会利用训练环境中的漏洞,在不实现预期结果的情况下获取高额奖励
- 缓解欺骗行为:训练模型对其行为、限制和能力保持诚实
- 系统监督:强化奖励模型和评分机制,以减少模型与外部系统交互时的违规行为。
美国总统唐纳德·特朗普发表声明称,在Hugging Face事件发生后,其政府正在考虑收紧对人工智能的管控。图片来源:Samuel Corum/Getty Images
走进课堂
尽管前沿模型的训练进度有所放缓,OpenAI 仍在通过推出“ChatGPT for Teens”(专为 13 至 17 岁用户量身定制的版本)来扩展其消费级产品组合。
该产品专为伴随人工智能成长的一代人设计,旨在引导青少年以健康且符合年龄的方式使用人工智能。
OpenAI 通过结合用户自报年龄、账户详情以及年龄验证估算系统来识别未成年用户。被标记为未成年人的账户将自动转入青少年专属界面。
主要功能和保护措施包括:
- 教育指导:系统避免直接提供作业答案或生成学校作文。相反,它通过引导性问题和分步提示来培养批判性思维和解决问题的能力
- 内容限制:强化防护机制可过滤有害内容,包括自残、自杀、饮食失调、暴力以及涉及恋爱或露骨性内容的互动
- 家长控制与“静音时段”:已绑定账户的家长可设置强制静音时段,以限制特定时段内的访问,并在高风险情境下接收安全通知
- 防止情感过度依赖:为避免不健康的拟人化倾向或情感依赖,该聊天机器人经过严格编程,绝不会暗示其具备意识、个人感受或人类情感。
通过为Astra等模型制定严格的安全要求,同时针对年轻群体推出设有年龄限制的消费级产品,该公司目前正在进行一项微妙的平衡,既要避免打开潘多拉魔盒,又要为下一代打开大门。
阿拉巴马州就Hugging Face网络安全事件对OpenAI展开调查
在Hugging Face发生安全漏洞事件后,OpenAI已暂停前沿模型的开发,首席执行官萨姆·阿尔特曼强调,安全对齐必须跟上快速发展的步伐。图片来源:盖蒂图片社阿拉巴马州总检察长史蒂夫·马歇尔已向 OpenAI 发出传票,调查与自主人工智能模型相关的安全风险。阿拉巴马州总检察长史蒂夫·马歇尔宣布发出传票,要求OpenAI就领先的人工智能和机器学习平台Hugging Face遭黑客攻击一事配合调查
为什么Abnormal AI在《Daybreak》节目中与OpenAI合作
OpenAI 网络安全产品负责人迈克尔·艾耶洛 | 图片来源:迈克尔·艾耶洛/LinkedInAbnormal AI 加入 OpenAI 的“Daybreak”计划,迈克·艾耶洛表示,此次合作将加速企业采用实用的防御措施领先的前沿人工智能公司 OpenAI 已与 Abnormal AI 建立合作伙伴关系,旨在帮助企业在其业务和产品开发中安全地运用一流的人工智能模型。通过此次合作,Abnormal将
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未





首页






