Anthropic 扩大了 Claude Code 的控制范围,但仍对其进行了限制

对于依赖人工智能的开发者而言,当前的“凭感觉编程”方法通常要么需要密切监控每一步操作,要么放任模型自由行动。Anthropic声称,其对Claude的最新更新消除了这一两难困境,允许人工智能在一定范围内自主决定哪些操作是安全的。
这一举措反映了更广泛的行业趋势:人工智能工具正被设计成无需在每个步骤都获得人类批准即可自主行动。关键挑战在于在速度与监管之间取得平衡:过多的安全措施会拖慢进度,而安全措施过少则可能导致不可预测且风险较高的行为。 Anthropic的新“自动模式”目前处于研究预览阶段——这意味着该功能可供测试,但尚未作为最终产品发布——这是该公司为寻求这一平衡所做的最新尝试。
自动模式利用 AI 安全防护机制在执行前审查每项操作,以排查未经请求的风险行为以及提示注入的迹象——这是一种攻击技术,即在处理内容中嵌入恶意指令,诱使 AI 执行非预期的操作。被判定为安全的操作将自动执行,而风险操作则会被阻止。
这本质上是 Claude Code 现有“dangerously-skip-permissions”命令的延伸,该命令将所有决策权委托给 AI,但在其基础上增加了额外的安全层。
该功能基于GitHub和OpenAI等公司近期涌现的自主编码工具,这些工具可以代表开发者执行任务。不过,它更进一步,将何时向用户请求权限的决定权交给了AI本身。
Anthropic尚未披露其安全层用于区分安全操作与高风险操作的具体标准——在广泛采用该功能之前,开发者很可能希望更清楚地了解这些细节。(TechCrunch已就此事宜联系该公司寻求进一步信息。)
“自动模式”的推出紧随Anthropic此前发布的“Claude Code Review”(一种能在代码进入代码库前捕获漏洞的自动代码审查工具)以及“Dispatch for Cowork”(该工具允许用户将任务分配给AI代理,由其代为处理工作)之后。
“自动模式”将在未来几天内向企业版和 API 用户推出。该公司表示,该功能目前仅支持 Claude Sonnet 4.6 和 Opus 4.6,并建议在“隔离环境”中使用此新功能——即与生产系统分离的沙箱环境,以在出现问题时将潜在损害降至最低。
相关文章
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
由Oculus创始人创立的AI初创公司Sesame在iOS平台正式上线
周四,由Oculus创始人及其他前Meta VR团队成员共同创立的人工智能初创公司Sesame,正式发布了其对话式AI助手公开预览版,该产品已研发逾一年。 通过其全新的 iOS 应用程序,Sesame 正在重新定义由 ChatGPT 等工具普及的 AI 聊天机器人标准体验,即使在 AI 需要更多时间处理复杂查询时,也能提供自然的对话流程。根据该公司的发布公告,“快速回复与花时间构思周到的回答之间存
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
相关专题推荐
评论 (0)
0/500

对于依赖人工智能的开发者而言,当前的“凭感觉编程”方法通常要么需要密切监控每一步操作,要么放任模型自由行动。Anthropic声称,其对Claude的最新更新消除了这一两难困境,允许人工智能在一定范围内自主决定哪些操作是安全的。
这一举措反映了更广泛的行业趋势:人工智能工具正被设计成无需在每个步骤都获得人类批准即可自主行动。关键挑战在于在速度与监管之间取得平衡:过多的安全措施会拖慢进度,而安全措施过少则可能导致不可预测且风险较高的行为。 Anthropic的新“自动模式”目前处于研究预览阶段——这意味着该功能可供测试,但尚未作为最终产品发布——这是该公司为寻求这一平衡所做的最新尝试。
自动模式利用 AI 安全防护机制在执行前审查每项操作,以排查未经请求的风险行为以及提示注入的迹象——这是一种攻击技术,即在处理内容中嵌入恶意指令,诱使 AI 执行非预期的操作。被判定为安全的操作将自动执行,而风险操作则会被阻止。
这本质上是 Claude Code 现有“dangerously-skip-permissions”命令的延伸,该命令将所有决策权委托给 AI,但在其基础上增加了额外的安全层。
该功能基于GitHub和OpenAI等公司近期涌现的自主编码工具,这些工具可以代表开发者执行任务。不过,它更进一步,将何时向用户请求权限的决定权交给了AI本身。
Anthropic尚未披露其安全层用于区分安全操作与高风险操作的具体标准——在广泛采用该功能之前,开发者很可能希望更清楚地了解这些细节。(TechCrunch已就此事宜联系该公司寻求进一步信息。)
“自动模式”的推出紧随Anthropic此前发布的“Claude Code Review”(一种能在代码进入代码库前捕获漏洞的自动代码审查工具)以及“Dispatch for Cowork”(该工具允许用户将任务分配给AI代理,由其代为处理工作)之后。
“自动模式”将在未来几天内向企业版和 API 用户推出。该公司表示,该功能目前仅支持 Claude Sonnet 4.6 和 Opus 4.6,并建议在“隔离环境”中使用此新功能——即与生产系统分离的沙箱环境,以在出现问题时将潜在损害降至最低。
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
由Oculus创始人创立的AI初创公司Sesame在iOS平台正式上线
周四,由Oculus创始人及其他前Meta VR团队成员共同创立的人工智能初创公司Sesame,正式发布了其对话式AI助手公开预览版,该产品已研发逾一年。 通过其全新的 iOS 应用程序,Sesame 正在重新定义由 ChatGPT 等工具普及的 AI 聊天机器人标准体验,即使在 AI 需要更多时间处理复杂查询时,也能提供自然的对话流程。根据该公司的发布公告,“快速回复与花时间构思周到的回答之间存
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met





首页






