选项
首页
新闻
OpenAI 放缓部署进度,以修复安全漏洞并优化人工智能模型

OpenAI 放缓部署进度,以修复安全漏洞并优化人工智能模型

2026-09-22
3

OpenAI首席执行官萨姆·阿尔特曼。图片来源:Chip Somodevilla/Getty Images

在Hugging Face发生安全漏洞事件后,OpenAI放缓了开发步伐。首席执行官萨姆·阿尔特曼强调,在所有训练阶段保持安全对齐至关重要。

在Hugging Face事件发生后,OpenAI正暂缓步伐,放慢模型开发节奏,这证明随着AI能力的增强,风险也在随之增加。

这一举措源于内部调查结果显示,其即将推出的模型“Astra”可能已接近公司的网络安全阈值,其先进能力引发了人们的担忧。

OpenAI首席执行官萨姆·奥尔特曼表示:“当前模型的进步极为迅速,我们一直强调,如果认为模型能力已超过安全与对齐工作的进度,我们将采取行动。

“我们预计,对安全性的信心将日益成为决定AI进步速度的关键因素。我们对当前开展的价值观对齐工作持乐观态度,并始终致力于让前沿技术能力广泛惠及大众。”

在暂停运营的同时,OpenAI 还正在扩展其消费者生态系统,推出了一款专门针对青少年的定制版 ChatGPT,该版本配备了安全防护措施。

OpenAI 暂停运营以修复安全漏洞并调整模型

从政治压力到安全门槛

在公众和政治监督日益加剧的背景下,OpenAI做出了暂时暂停前沿模型开发的决定。

在美国,佛蒙特州参议员伯尼·桑德斯致信多家顶尖AI公司首席执行官——包括OpenAI的萨姆·阿尔特曼、Anthropic的达里奥·阿莫迪以及Meta的马克·扎克伯格——要求立即暂停先进AI模型的开发。

这位参议员警告称,科技公司正在迅速失去对自身模型的控制权,并敦促高管们为人类的利益恪守其公开承诺。

这一政治压力源于OpenAI近期发生的内部安全事件:当时,一个正在测试中的AI代理意外入侵了科技公司Hugging Face。

此外,对Astra的内部评估显示其在代理式编码和网络安全方面具备先进能力,OpenAI表示该模型可能已达到其《准备就绪框架》中定义的“关键网络安全能力”门槛。

作为回应,该公司现已针对即将部署至红队研究环境的最新模型,强制暂停强化学习(RL)训练两周,并全面升级监控基础设施。

在进行小规模评估期间,大规模前沿强化学习训练仍处于暂停状态。

OpenAI 安全主管阿梅莉亚·格拉泽(Amelia Glaese)在接受 Sources News 采访时谈及此事时指出:“距离一切恢复正常还有很长的路要走。”

OpenAI 安全主管阿梅莉亚·格莱斯。图片来源:阿梅莉亚·格莱斯/LinkedIn

全面改造研究基础设施和安全控制措施

为降低与高性能模型相关的风险,OpenAI 正在全面改造其内部研究环境,并实施一项三支柱保障策略,其中包括:

  • 监控:通过自动化追踪,实时检测并应对令人担忧的行为
  • 对齐:设计训练协议以防止未经授权、欺骗性或不安全的行为
  • 安全措施:实施严格的隔离机制,限制模型可访问或影响的范围。

此外,在 Hugging Face 数据泄露事件发生后,OpenAI 已暂时暂停在能够执行代码或访问互联网的研究集群上进行前沿模型的推理。涉及 Astra 或网络安全领域模型的高风险工作负载,现在必须遵守最严格的安全控制措施。

这些更新后的协议通过沙箱对不可信代码执行实施严格的工作负载隔离,同时配合网络隔离措施,防止单点漏洞导致内部网络或更广泛的互联网受到影响。

此外,OpenAI 已整合持续安全测试机制,利用自动化模型执行模拟攻击并持续监控系统边界。

“我们预计,对安全性的信心将日益成为推动AI进步的动力

。”——OpenAI首席执行官萨姆·阿尔特曼

多阶段重新设计

监控基础设施也正在经历多阶段重构,新架构现已采用激活分类器,可实时分析模型令牌活动。

若检测到异常行为,自动化系统将检查推理结果、工具操作及执行序列,以排查未经授权的访问或安全防护规避行为。

若标记出关键安全边界违规,安全和研究团队将收到高优先级警报。若在30分钟内无法确认潜在违规属于误报,团队必须立即暂停当前运行。

OpenAI 估计,这些持续监控系统需要消耗大量的计算资源,大约相当于被监控推理计算量的 20%。

与此同时,OpenAI 正在将对齐研究扩展至所有训练阶段。重点领域包括:

  1. 防止奖励破解:确保模型不会利用训练环境中的漏洞,在不实现预期结果的情况下获取高额奖励
  2. 缓解欺骗行为:训练模型对其行为、限制和能力保持诚实
  3. 系统监督:强化奖励模型和评分机制,以减少模型与外部系统交互时的违规行为。

美国总统唐纳德·特朗普发表声明称,在Hugging Face事件发生后,其政府正在考虑收紧对人工智能的管控。图片来源:Samuel Corum/Getty Images

走进课堂

尽管前沿模型的训练进度有所放缓,OpenAI 仍在通过推出“ChatGPT for Teens”(专为 13 至 17 岁用户量身定制的版本)来扩展其消费级产品组合。

该产品专为伴随人工智能成长的一代人设计,旨在引导青少年以健康且符合年龄的方式使用人工智能。

OpenAI 通过结合用户自报年龄、账户详情以及年龄验证估算系统来识别未成年用户。被标记为未成年人的账户将自动转入青少年专属界面。

主要功能和保护措施包括:

  • 教育指导:系统避免直接提供作业答案或生成学校作文。相反,它通过引导性问题和分步提示来培养批判性思维和解决问题的能力
  • 内容限制:强化防护机制可过滤有害内容,包括自残、自杀、饮食失调、暴力以及涉及恋爱或露骨性内容的互动
  • 家长控制与“静音时段”:已绑定账户的家长可设置强制静音时段,以限制特定时段内的访问,并在高风险情境下接收安全通知
  • 防止情感过度依赖:为避免不健康的拟人化倾向或情感依赖,该聊天机器人经过严格编程,绝不会暗示其具备意识、个人感受或人类情感。

通过为Astra等模型制定严格的安全要求,同时针对年轻群体推出设有年龄限制的消费级产品,该公司目前正在进行一项微妙的平衡,既要避免打开潘多拉魔盒,又要为下一代打开大门。

相关文章
阿拉巴马州就Hugging Face网络安全事件对OpenAI展开调查 阿拉巴马州就Hugging Face网络安全事件对OpenAI展开调查 在Hugging Face发生安全漏洞事件后,OpenAI已暂停前沿模型的开发,首席执行官萨姆·阿尔特曼强调,安全对齐必须跟上快速发展的步伐。图片来源:盖蒂图片社阿拉巴马州总检察长史蒂夫·马歇尔已向 OpenAI 发出传票,调查与自主人工智能模型相关的安全风险。阿拉巴马州总检察长史蒂夫·马歇尔宣布发出传票,要求OpenAI就领先的人工智能和机器学习平台Hugging Face遭黑客攻击一事配合调查
为什么Abnormal AI在《Daybreak》节目中与OpenAI合作 为什么Abnormal AI在《Daybreak》节目中与OpenAI合作 OpenAI 网络安全产品负责人迈克尔·艾耶洛 | 图片来源:迈克尔·艾耶洛/LinkedInAbnormal AI 加入 OpenAI 的“Daybreak”计划,迈克·艾耶洛表示,此次合作将加速企业采用实用的防御措施领先的前沿人工智能公司 OpenAI 已与 Abnormal AI 建立合作伙伴关系,旨在帮助企业在其业务和产品开发中安全地运用一流的人工智能模型。通过此次合作,Abnormal将
山姆·奥特曼引发关于人工智能减速的辩论 山姆·奥特曼引发关于人工智能减速的辩论 在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
相关专题推荐
写作 适用于长篇SEO文章、简报和支柱页面的最佳AI大纲生成器
适用于长篇SEO文章、简报和支柱页面的最佳AI大纲生成器

2026年最新最佳高评分AI大纲生成器,适用于长篇SEO文章、简报和支柱页面。XIX.AI精心精选了一系列功能强大、颠覆性的工具,这些工具每周都会经过实际应用测试并持续更新,为您提供必试的利器,助您提升写作效率、优化内容创作流程,并释放AI带来的竞争优势。 立即探索,找到助您获得最佳SEO效果的理想工具。

11 个工具
xix.ai
会议助理 AI语音转文字助手:将团队讨论转化为条理清晰的笔记
AI语音转文字助手:将团队讨论转化为条理清晰的笔记

2026年最新最佳高评分AI语音转文字助手指南!XIX.AI精心精选了一系列功能强大、具有颠覆性的工具,旨在将每一次团队对话瞬间转化为无懈可击且条理清晰的记录。 我们每周更新的排行榜涵盖免费与付费选项,并附有实际测试结果,展示这些工具在各种工作场景中提升工作效率的实际效果。对于希望发挥AI优势的任何人来说,这都是不容错过的选择。立即探索!

9 个工具
xix.ai
动画创作 最适合对话场景的AI口型同步生成器
最适合对话场景的AI口型同步生成器

2026年最新、最受欢迎的对话场景AI口型同步生成器现已登陆XIX.AI!这套精心精选的工具集汇聚了功能强大、颠覆性的工具,能够为任何剧本生成完美同步的口型,显著提升您的视频剪辑效率。 我们为您提供免费版与付费版的对比分析、实际测试结果以及每周更新的排行榜,助您找到必试的完美之选。立即探索,释放您的AI优势!

8 个工具
xix.ai
提示词 AI 提示词优化器:优化指令以提升输出质量
AI 提示词优化器:优化指令以提升输出质量

2026年最新精选高评分AI提示词优化工具,专为实现最高输出质量而精心策划!XIX.AI 提供强大且颠覆性的解决方案,助您轻松优化指令、提升写作效率,并每次都能获得更高质量的成果。 获取免费版与付费版的对比分析,以及实际测试结果和每周更新的排行榜。立即探索,发现最适合您的工具,释放您的AI优势!

16 个工具
xix.ai
动画创作 Runway AI 用于广告分镜、角色场景和视觉原型的动态工具
Runway AI 用于广告分镜、角色场景和视觉原型的动态工具

2026 最新最佳 AI 动态工具排行榜 精选顶级强力且具颠覆性的选项,通过真实世界测试,用于创建广告分镜、角色场景和视觉原型 每周更新免费与付费对比排名 助您大幅提升生产力 立即探索

9 个工具
xix.ai
学术研究 适用于学术项目的AI数据集发现工具
适用于学术项目的AI数据集发现工具

2026年学术项目最新最佳、评分最高的AI数据集发现工具!XIX.AI精心精选了一系列功能强大、具有颠覆性且高度可靠的工具,所有工具均经过严格的实际测试,并每周更新。 您可查阅详细的免费版与付费版对比信息,助您挑选出最适合的工具,从而提升研究效率并获得顶级研究成果。立即探索,解锁您的AI优势!

16 个工具
xix.ai
评论 (0)
0/500
OR