网络安全专家批评Anthropic的Fable中的护栏措施

Anthropic 于周二推出了其最新模型 Fable,将其定位为备受期待的网络安全专用模型 Mythos 的公开受限版本。
然而,这些限制引发了部分网络安全研究人员和从业者的不满,他们已在网上表达了担忧。
“[Fable] 会阻止任何可能与网络安全相关的请求,包括阅读博客文章等无害任务,”IBM X-Force 的高级安全研究员 Valentina “Chompie” Palmiotti 表示。
当用户提示触发这些安全过滤器时,Fable 会中断对话,并显示一条消息,称其“安全协议因网络安全或生物主题标记了此输入”。
这些限制旨在降低 Fable 被用于创建恶意软件或利用软件的风险——这是 Anthropic 一直关注的持续性问题。生物领域的限制则源于对开发生物武器的类似担忧。
Anthropic 在 4 月发布 Mythos 时,将访问权限限制在 Project Glasswing 项目下的少数公司和组织,该计划旨在部署该模型以保护关键软件和基础设施。上周,Anthropic 将 Mythos 的访问权限扩大到了 15 个国家的数百个组织。
尽管初衷良好,但许多网络安全专家仍对看似武断的限制感到沮丧。资深网络安全专家 Matt Suiche 告诉 TechCrunch,“如果你要求它编写安全代码,它会将其解读为与网络安全相关的工作,而非软件工程的最佳实践,从而导致降级。”当触发护栏机制时,Fable 会回退到 Claude Opus 4.8。“它似乎依赖于关键词,因此‘网络安全’词汇表中的任何术语都会激活过滤器,”他指出。
联系我们
您是否有关于黑客如何利用 AI,或网络安全公司如何整合 AI 的更多见解?我们欢迎您的意见。您可以从个人设备和网络,通过 Signal 联系 Lorenzo Franceschi-Bicchierai(电话:+1 917 257 1382),或通过 Telegram 和 Keybase(@lorenzofb)以及电子邮件。
“然而,鉴于我们仍处于早期阶段,他们正在完善其护栏机制,这是可以理解的。我相信,随着 Anthropic 和其他前沿模型开发商与新一代网络安全公司更紧密地合作,这些限制将会演变,”Tolmo(一家 AI 网络安全初创公司)的技术人员 Suiche 表示。“最初过度限制并在随后逐步放宽护栏是更可取的。”
另一位研究人员在 X 上抱怨称,“即使是请求代码审查”也会激活 Fable 的安全过滤器。
Anthropic 尚未立即回应置评请求。
除了模型层面的护栏外,Anthropic 还要求网络安全专业人员申请其网络安全验证计划。获得批准的用户在使用 Claude 进行网络安全任务时将面临更少的限制。OpenAI 也提供了一个名为“Trusted Access for Cyber”的类似计划。
相关文章
白宫放弃“超级智能”的AI标签
正在加载播放器……本周,白宫召集了几乎所有主要科技公司的首席执行官齐聚一堂——包括扎克伯格、贝索斯、马斯克以及 Anthropic 的达里奥·阿莫迪——签署了一份人工智能安全承诺,美国总统唐纳德·特朗普称该承诺“具有道德约束力”。特朗普还签署了一项行政命令,正式将人工智能重新定义为“超级智能”,与此同时,Meta 和 OpenAI 正致力于使其人工智能产品更加用户友好,尽管来自企业部门的人工智能最大金融投资仍在持续涌入。在本期 TechCrunch 的 Equity 播客节目中,Kirste
Anthropic 推出 Sonnet 5.5,作为更快、更便宜的工作伙伴
在各大 AI 模型持续竞争的背景下,Anthropic 推出了其中端产品 Sonnet 的最新迭代版本,承诺相比前代版本实现速度的大幅提升和成本的显著降低。Anthropic 将 Sonnet 5.5 定位为适用于日常工作流程的多功能工具,涵盖软件开发和文档创作等领域。Sonnet 5 是 5.5 版本的前身,大约在三个月前推出,其主要优势在于具有成本效益的智能体(agentic)部署能力。5.5 版本的关键改进在于速度的提升。Anthropic 表示,Sonnet 5.5 的运行速度比前
Anthropic 与特朗普政府的最新冲突实际上可能对其有利,销售数据显示
Anthropic 正经历着一个非凡的月份。据 Ramp 数据显示,这家 AI 公司首次超越 OpenAI,在商业支出市场份额中占据首位,并在五月以 650 亿美元的融资额和 9650 亿美元的估值收官。随后不久,Anthropic 提交了保密的首次公开募股(IPO)文件,据报道,这得益于其首个盈利季度的表现。周五,特朗普政府通过要求 Anthropic 阻止非美国用户(包括其自身员工)访问其最新模型——受限的 Mythos 5 和近期公开的 Fable 5——进一步加剧了紧张局势。这一指
相关专题推荐
评论 (0)
0/500

Anthropic 于周二推出了其最新模型 Fable,将其定位为备受期待的网络安全专用模型 Mythos 的公开受限版本。
然而,这些限制引发了部分网络安全研究人员和从业者的不满,他们已在网上表达了担忧。
“[Fable] 会阻止任何可能与网络安全相关的请求,包括阅读博客文章等无害任务,”IBM X-Force 的高级安全研究员 Valentina “Chompie” Palmiotti 表示。
当用户提示触发这些安全过滤器时,Fable 会中断对话,并显示一条消息,称其“安全协议因网络安全或生物主题标记了此输入”。
这些限制旨在降低 Fable 被用于创建恶意软件或利用软件的风险——这是 Anthropic 一直关注的持续性问题。生物领域的限制则源于对开发生物武器的类似担忧。
Anthropic 在 4 月发布 Mythos 时,将访问权限限制在 Project Glasswing 项目下的少数公司和组织,该计划旨在部署该模型以保护关键软件和基础设施。上周,Anthropic 将 Mythos 的访问权限扩大到了 15 个国家的数百个组织。
尽管初衷良好,但许多网络安全专家仍对看似武断的限制感到沮丧。资深网络安全专家 Matt Suiche 告诉 TechCrunch,“如果你要求它编写安全代码,它会将其解读为与网络安全相关的工作,而非软件工程的最佳实践,从而导致降级。”当触发护栏机制时,Fable 会回退到 Claude Opus 4.8。“它似乎依赖于关键词,因此‘网络安全’词汇表中的任何术语都会激活过滤器,”他指出。
联系我们
您是否有关于黑客如何利用 AI,或网络安全公司如何整合 AI 的更多见解?我们欢迎您的意见。您可以从个人设备和网络,通过 Signal 联系 Lorenzo Franceschi-Bicchierai(电话:+1 917 257 1382),或通过 Telegram 和 Keybase(@lorenzofb)以及电子邮件。
“然而,鉴于我们仍处于早期阶段,他们正在完善其护栏机制,这是可以理解的。我相信,随着 Anthropic 和其他前沿模型开发商与新一代网络安全公司更紧密地合作,这些限制将会演变,”Tolmo(一家 AI 网络安全初创公司)的技术人员 Suiche 表示。“最初过度限制并在随后逐步放宽护栏是更可取的。”
另一位研究人员在 X 上抱怨称,“即使是请求代码审查”也会激活 Fable 的安全过滤器。
Anthropic 尚未立即回应置评请求。
除了模型层面的护栏外,Anthropic 还要求网络安全专业人员申请其网络安全验证计划。获得批准的用户在使用 Claude 进行网络安全任务时将面临更少的限制。OpenAI 也提供了一个名为“Trusted Access for Cyber”的类似计划。
白宫放弃“超级智能”的AI标签
正在加载播放器……本周,白宫召集了几乎所有主要科技公司的首席执行官齐聚一堂——包括扎克伯格、贝索斯、马斯克以及 Anthropic 的达里奥·阿莫迪——签署了一份人工智能安全承诺,美国总统唐纳德·特朗普称该承诺“具有道德约束力”。特朗普还签署了一项行政命令,正式将人工智能重新定义为“超级智能”,与此同时,Meta 和 OpenAI 正致力于使其人工智能产品更加用户友好,尽管来自企业部门的人工智能最大金融投资仍在持续涌入。在本期 TechCrunch 的 Equity 播客节目中,Kirste
Anthropic 推出 Sonnet 5.5,作为更快、更便宜的工作伙伴
在各大 AI 模型持续竞争的背景下,Anthropic 推出了其中端产品 Sonnet 的最新迭代版本,承诺相比前代版本实现速度的大幅提升和成本的显著降低。Anthropic 将 Sonnet 5.5 定位为适用于日常工作流程的多功能工具,涵盖软件开发和文档创作等领域。Sonnet 5 是 5.5 版本的前身,大约在三个月前推出,其主要优势在于具有成本效益的智能体(agentic)部署能力。5.5 版本的关键改进在于速度的提升。Anthropic 表示,Sonnet 5.5 的运行速度比前
Anthropic 与特朗普政府的最新冲突实际上可能对其有利,销售数据显示
Anthropic 正经历着一个非凡的月份。据 Ramp 数据显示,这家 AI 公司首次超越 OpenAI,在商业支出市场份额中占据首位,并在五月以 650 亿美元的融资额和 9650 亿美元的估值收官。随后不久,Anthropic 提交了保密的首次公开募股(IPO)文件,据报道,这得益于其首个盈利季度的表现。周五,特朗普政府通过要求 Anthropic 阻止非美国用户(包括其自身员工)访问其最新模型——受限的 Mythos 5 和近期公开的 Fable 5——进一步加剧了紧张局势。这一指





首页






