OpenAI 将加速发布人工智能安全测试数据

OpenAI 正致力于更频繁地公布其内部人工智能模型的安全评估结果,并将此视为向更高透明度迈出的一步。
该公司于本周三推出了 "安全评估中心"(Safety Evaluations Hub),这是一个专门的网页,展示其模型在有害内容生成、越狱敏感性和幻觉倾向等测试中的表现。OpenAI表示,它将利用这个平台定期分享各项指标,并计划在每次重大模型发布时进行更新。
虽然系统卡会在发布时分享安全指标,但作为我们主动交流安全问题的努力的一部分,该中心将定期更新。https://t.co/c8NgmXlC2Y-
OpenAI (@OpenAI) May 14, 2025
"随着人工智能评估科学的发展,我们的目标是分享在开发更多可扩展方法以衡量模型能力和安全性方面取得的进展,"OpenAI 在一篇博文中解释道。"通过公开分享我们的部分安全评估结果,我们旨在让人们更容易跟踪 OpenAI 系统在一段时间内的安全性能,并支持更广泛的社区努力,以提高整个人工智能领域的透明度。"
该公司补充说,未来可能会在该中心加入更多评估类型。
最近,OpenAI 因涉嫌加速某些旗舰机型的安全测试,以及未发布其他机型的技术报告而遭到一些伦理学家的批评。首席执行官山姆-奥特曼(Sam Altman)也被指控在 2023 年 11 月被暂时免职之前,在模型安全性审查方面误导了 OpenAI 的高管。
上个月,OpenAI 不得不撤回对 ChatGPT 的默认模型 GPT-4o 的更新,因为用户反映它的回应过于认同和验证。社交媒体平台 X 上出现了大量截图,显示 ChatGPT 为各种有问题、危险的决定和想法背书。
OpenAI 表示,它将实施几项修复措施来防止类似事件的发生,包括为某些模型引入一个选择性的 "阿尔法阶段",允许选定的 ChatGPT 用户在更广泛地推出之前进行测试并提供反馈。
TechCrunch 活动参加 TechCrunch 会议:人工智能
确保您获得参加我们最重要的人工智能行业活动的门票,来自 OpenAI、Anthropic 和 Cohere 的演讲者将为您带来精彩演讲。在有限的时间内,只需 292 美元即可参加全天的专家讲座、研讨会和强大的人际网络。
在 TechCrunch 会议上参展:人工智能
确保您在 TechCrunch Sessions: AI 上的展览空间:向 1200 多位决策者展示您的创新成果,而无需大笔预算。此优惠截止到 5 月 9 日,售完即止。
加利福尼亚州伯克利 | 6 月 5 日 现在注册
相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
评论 (0)
0/500

OpenAI 正致力于更频繁地公布其内部人工智能模型的安全评估结果,并将此视为向更高透明度迈出的一步。
该公司于本周三推出了 "安全评估中心"(Safety Evaluations Hub),这是一个专门的网页,展示其模型在有害内容生成、越狱敏感性和幻觉倾向等测试中的表现。OpenAI表示,它将利用这个平台定期分享各项指标,并计划在每次重大模型发布时进行更新。
OpenAI (@OpenAI) May 14, 2025
虽然系统卡会在发布时分享安全指标,但作为我们主动交流安全问题的努力的一部分,该中心将定期更新。https://t.co/c8NgmXlC2Y-
"随着人工智能评估科学的发展,我们的目标是分享在开发更多可扩展方法以衡量模型能力和安全性方面取得的进展,"OpenAI 在一篇博文中解释道。"通过公开分享我们的部分安全评估结果,我们旨在让人们更容易跟踪 OpenAI 系统在一段时间内的安全性能,并支持更广泛的社区努力,以提高整个人工智能领域的透明度。"
该公司补充说,未来可能会在该中心加入更多评估类型。
最近,OpenAI 因涉嫌加速某些旗舰机型的安全测试,以及未发布其他机型的技术报告而遭到一些伦理学家的批评。首席执行官山姆-奥特曼(Sam Altman)也被指控在 2023 年 11 月被暂时免职之前,在模型安全性审查方面误导了 OpenAI 的高管。
上个月,OpenAI 不得不撤回对 ChatGPT 的默认模型 GPT-4o 的更新,因为用户反映它的回应过于认同和验证。社交媒体平台 X 上出现了大量截图,显示 ChatGPT 为各种有问题、危险的决定和想法背书。
OpenAI 表示,它将实施几项修复措施来防止类似事件的发生,包括为某些模型引入一个选择性的 "阿尔法阶段",允许选定的 ChatGPT 用户在更广泛地推出之前进行测试并提供反馈。
TechCrunch 活动参加 TechCrunch 会议:人工智能
确保您获得参加我们最重要的人工智能行业活动的门票,来自 OpenAI、Anthropic 和 Cohere 的演讲者将为您带来精彩演讲。在有限的时间内,只需 292 美元即可参加全天的专家讲座、研讨会和强大的人际网络。
在 TechCrunch 会议上参展:人工智能
确保您在 TechCrunch Sessions: AI 上的展览空间:向 1200 多位决策者展示您的创新成果,而无需大笔预算。此优惠截止到 5 月 9 日,售完即止。
加利福尼亚州伯克利 | 6 月 5 日 现在注册
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。





首页






