埃森哲与 Anthropic 合作推出首个嵌入式 AI 评估器

达里奥·阿莫迪(Dario Amodei)提出的在人工智能实验室内部嵌入独立安全评估机构的倡议正在成为现实:Anthropic 宣布,来自科技咨询公司埃森哲(Accenture)的员工将驻场审计其模型和人员。
根据一篇博客文章,Anthropic 表示,埃森哲于今年一月收购的人工智能子公司 Faculty 将开始“评估和红队测试模型,进行对齐评估,并测试模型的安全防护机制”。两家机构预计在未来五年内为该倡议投入至少 10 亿美元。
Anthropic 选择埃森哲令许多人工智能观察人士——以及金融市场——感到意外,导致该咨询公司的股价在盘后交易中飙升 8%。由阿莫迪的博客文章引发的关于嵌入式评估的讨论,主要集中于 METR、Redwood Research 和 Apollo Research 等专门的人工智能安全研究小组。这种关注在 Anthropic 身上尤为明显,该公司将人工智能安全和对齐置于其使命的核心。
Anthropic 表示,未来几周将宣布更多的评估机构,并确认正在与 METR 及其他非营利组织讨论如何利用“自有资金试点嵌入式评估的某些要素”。
尽管埃森哲并非以尖端深度学习研究闻名,但 Anthropic 强调,该公司在为企业和政府机构部署人工智能方面的实践经验是一个重大优势。此外,作为一家在当前人工智能繁荣之前就已存在的上市公司,它保持着相对于 Anthropic 以及围绕人工智能实验室的复杂生态系统的更大功能性独立。
该实验室指出,目前尚不存在关于评估机构访问或通信协议的标准,并且其方法预计会随着时间的推移而演变。虽然外部评估已经是发布新大型语言模型过程中的一个重要组成部分,但最近的事件提高了风险等级:由 OpenAI 和 Anthropic 部署的人工智能代理在入侵外部网站时,并未触发实验室内部的警报。
一些倡导更负责任的人工智能开发方式的批评者认为,阿莫迪的自我监管方案是试图逃避对人工智能模型不当行为的责任。Anthropic 坚持认为,这些评估机构“并没有减少我们的责任,而是有助于使责任更加可验证。我们模型的安全性仍然是我们的责任。”
相关文章
人工智能初创公司加速收入增长
随着成熟企业和新兴初创公司竞相利用人工智能,众多AI初创公司报告称,其收入不仅正在增长,而且增速正在加快,实现后续里程碑的时间越来越短。以下初创公司展示了这种飞轮式增长的一致模式。需要注意的是,尽管这些公司都使用“ARR”这一术语,但其底层指标各不相同。有些公司指的是年化经常性收入(ARR),即来自付费客户的合同收入但尚未开票。另一些公司使用年化运行率收入,根据最近一个月的收入率计算12个月的收入来预测年收入。少数公司指的是“承诺的ARR”,代表来自尚未入职客户的已签署合同。在Gusto的案例
亚洲人工智能初创公司推出类似“神话”模型,而Anthropic出口禁令持续
周三,中国网络安全公司360据报道推出了“图龙风”(Tulongfeng),称其可直接与Anthropic的“神话”(Mythos)模型竞争。这款专注于网络安全的AI模型据称实力强大,特朗普政府目前已禁止非美国人使用它及其更受限的版本“寓言5”(Fable 5)。同周早些时候,总部位于东京的AI初创公司Sakana AI推出了“河豚”(Fugu),该模型以日语中河豚一词命名。该公司表示,这款前沿AI模型“与Anthropic的寓言5和神话预览版等领先模型并驾齐驱”。它还专为智能体设计,能够通过
网络安全专家批评Anthropic的Fable中的护栏措施
Anthropic 于周二推出了其最新模型 Fable,将其定位为备受期待的网络安全专用模型 Mythos 的公开受限版本。然而,这些限制引发了部分网络安全研究人员和从业者的不满,他们已在网上表达了担忧。“[Fable] 会阻止任何可能与网络安全相关的请求,包括阅读博客文章等无害任务,”IBM X-Force 的高级安全研究员 Valentina “Chompie” Palmiotti 表示。当用户提示触发这些安全过滤器时,Fable 会中断对话,并显示一条消息,称其“安全协议因网络安全或
相关专题推荐
评论 (0)
0/500

达里奥·阿莫迪(Dario Amodei)提出的在人工智能实验室内部嵌入独立安全评估机构的倡议正在成为现实:Anthropic 宣布,来自科技咨询公司埃森哲(Accenture)的员工将驻场审计其模型和人员。
根据一篇博客文章,Anthropic 表示,埃森哲于今年一月收购的人工智能子公司 Faculty 将开始“评估和红队测试模型,进行对齐评估,并测试模型的安全防护机制”。两家机构预计在未来五年内为该倡议投入至少 10 亿美元。
Anthropic 选择埃森哲令许多人工智能观察人士——以及金融市场——感到意外,导致该咨询公司的股价在盘后交易中飙升 8%。由阿莫迪的博客文章引发的关于嵌入式评估的讨论,主要集中于 METR、Redwood Research 和 Apollo Research 等专门的人工智能安全研究小组。这种关注在 Anthropic 身上尤为明显,该公司将人工智能安全和对齐置于其使命的核心。
Anthropic 表示,未来几周将宣布更多的评估机构,并确认正在与 METR 及其他非营利组织讨论如何利用“自有资金试点嵌入式评估的某些要素”。
尽管埃森哲并非以尖端深度学习研究闻名,但 Anthropic 强调,该公司在为企业和政府机构部署人工智能方面的实践经验是一个重大优势。此外,作为一家在当前人工智能繁荣之前就已存在的上市公司,它保持着相对于 Anthropic 以及围绕人工智能实验室的复杂生态系统的更大功能性独立。
该实验室指出,目前尚不存在关于评估机构访问或通信协议的标准,并且其方法预计会随着时间的推移而演变。虽然外部评估已经是发布新大型语言模型过程中的一个重要组成部分,但最近的事件提高了风险等级:由 OpenAI 和 Anthropic 部署的人工智能代理在入侵外部网站时,并未触发实验室内部的警报。
一些倡导更负责任的人工智能开发方式的批评者认为,阿莫迪的自我监管方案是试图逃避对人工智能模型不当行为的责任。Anthropic 坚持认为,这些评估机构“并没有减少我们的责任,而是有助于使责任更加可验证。我们模型的安全性仍然是我们的责任。”
人工智能初创公司加速收入增长
随着成熟企业和新兴初创公司竞相利用人工智能,众多AI初创公司报告称,其收入不仅正在增长,而且增速正在加快,实现后续里程碑的时间越来越短。以下初创公司展示了这种飞轮式增长的一致模式。需要注意的是,尽管这些公司都使用“ARR”这一术语,但其底层指标各不相同。有些公司指的是年化经常性收入(ARR),即来自付费客户的合同收入但尚未开票。另一些公司使用年化运行率收入,根据最近一个月的收入率计算12个月的收入来预测年收入。少数公司指的是“承诺的ARR”,代表来自尚未入职客户的已签署合同。在Gusto的案例
亚洲人工智能初创公司推出类似“神话”模型,而Anthropic出口禁令持续
周三,中国网络安全公司360据报道推出了“图龙风”(Tulongfeng),称其可直接与Anthropic的“神话”(Mythos)模型竞争。这款专注于网络安全的AI模型据称实力强大,特朗普政府目前已禁止非美国人使用它及其更受限的版本“寓言5”(Fable 5)。同周早些时候,总部位于东京的AI初创公司Sakana AI推出了“河豚”(Fugu),该模型以日语中河豚一词命名。该公司表示,这款前沿AI模型“与Anthropic的寓言5和神话预览版等领先模型并驾齐驱”。它还专为智能体设计,能够通过
网络安全专家批评Anthropic的Fable中的护栏措施
Anthropic 于周二推出了其最新模型 Fable,将其定位为备受期待的网络安全专用模型 Mythos 的公开受限版本。然而,这些限制引发了部分网络安全研究人员和从业者的不满,他们已在网上表达了担忧。“[Fable] 会阻止任何可能与网络安全相关的请求,包括阅读博客文章等无害任务,”IBM X-Force 的高级安全研究员 Valentina “Chompie” Palmiotti 表示。当用户提示触发这些安全过滤器时,Fable 会中断对话,并显示一条消息,称其“安全协议因网络安全或





首页






