Claude Opus 4.7 正式发布,将可靠性置于智能之上
Anthropic 今年保持着激进的开发节奏,几乎每隔一天就会推出新功能。备受期待的 Claude Opus 4.7 刚刚正式发布,有趣的是,Anthropic 在公告中直言不讳地表示:“这并非我们最强大的模型。” 传闻中更强大的 Claude Mythos Preview 仍处于待命状态。尽管如此,Opus 4.7 依然引发了广泛关注,因为它致力于解决“更可靠”而非“更智能”的问题。

基准测试结果尤为亮眼。在严苛的编程基准测试 SWE-bench Pro 上, 4.7版从上一版本的53.4%跃升至64.3%,提升近11个百分点,超越了GPT-5.4(57.7%)和Gemini 3.1 Pro(54.2%)。 在视觉推理基准测试CharXiv上,其得分从69.1%跃升至82.1%,这得益于新增的2576像素长边识别能力,其清晰度是前代产品的三倍以上。 在工具调用评估 MCP-Atlas 上,其得分达到 77.3%;而在法律 AI 平台 Harvey 的 BigLaw 基准测试中,得分高达 90.9%。 然而,在代理搜索评估BrowseComp上,4.7版从83.7%微降至79.3%,被GPT-5.4和Gemini超越——这归因于其“不编造”的个性,当信息不完整时,它更倾向于报告错误而非进行猜测。
除了数据之外,其性格的转变更值得关注。Replit的负责人在测试后指出:“它在技术讨论中能与我针锋相对,帮助我做出更明智的决策,确实表现得像一位更优秀的同事。”数据科学平台Hex也观察到,当数据缺失时,4.7会直接报告错误,而非像以往那样提供“看似合理但完全错误”的替代值。 与此同时,任务恢复能力也显著提升——Notion 团队的测试表明,该工具的错误率已降至此前水平的三分之一,当工具链出现故障时,它能够绕过障碍并独立完成任务。 Vercel 甚至发现了一种新行为:在编写系统级代码之前,4.7 会先自行进行数学证明。

当然,能力提升伴随着代价。4.7 引入了新的分词器,处理相同文本时生成的令牌数量增加了 1 到 1.35 倍。此外,它在处理复杂任务时往往会“思考得更久一些”,因此实际消耗几乎肯定会更高。 为解决这一问题,Anthropic新增了“xhigh”超强思考强度级别。Claude Code已将所有包默认设置为该级别,并推出了Deep Review指令/ultrareview、面向Max用户的Auto Mode扩展,以及“任务预算”功能的公开测试版,以帮助开发者管理令牌使用。
功能更强大的 Mythos Preview 近期已通过“Project Glasswing”项目向企业开放,用于网络安全研究,但由于其能力过于强大且安全评估尚未完成,目前尚未公开发布。
今日发布的 4.7 版本标志着 Anthropic 高频迭代节奏中的最新里程碑。Mythos 终将面世——而当它真正到来时,目前已相当强大的 4.7 版本或许仅仅是个开始。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (0)
0/500
Anthropic 今年保持着激进的开发节奏,几乎每隔一天就会推出新功能。备受期待的 Claude Opus 4.7 刚刚正式发布,有趣的是,Anthropic 在公告中直言不讳地表示:“这并非我们最强大的模型。” 传闻中更强大的 Claude Mythos Preview 仍处于待命状态。尽管如此,Opus 4.7 依然引发了广泛关注,因为它致力于解决“更可靠”而非“更智能”的问题。

基准测试结果尤为亮眼。在严苛的编程基准测试 SWE-bench Pro 上, 4.7版从上一版本的53.4%跃升至64.3%,提升近11个百分点,超越了GPT-5.4(57.7%)和Gemini 3.1 Pro(54.2%)。 在视觉推理基准测试CharXiv上,其得分从69.1%跃升至82.1%,这得益于新增的2576像素长边识别能力,其清晰度是前代产品的三倍以上。 在工具调用评估 MCP-Atlas 上,其得分达到 77.3%;而在法律 AI 平台 Harvey 的 BigLaw 基准测试中,得分高达 90.9%。 然而,在代理搜索评估BrowseComp上,4.7版从83.7%微降至79.3%,被GPT-5.4和Gemini超越——这归因于其“不编造”的个性,当信息不完整时,它更倾向于报告错误而非进行猜测。
除了数据之外,其性格的转变更值得关注。Replit的负责人在测试后指出:“它在技术讨论中能与我针锋相对,帮助我做出更明智的决策,确实表现得像一位更优秀的同事。”数据科学平台Hex也观察到,当数据缺失时,4.7会直接报告错误,而非像以往那样提供“看似合理但完全错误”的替代值。 与此同时,任务恢复能力也显著提升——Notion 团队的测试表明,该工具的错误率已降至此前水平的三分之一,当工具链出现故障时,它能够绕过障碍并独立完成任务。 Vercel 甚至发现了一种新行为:在编写系统级代码之前,4.7 会先自行进行数学证明。

当然,能力提升伴随着代价。4.7 引入了新的分词器,处理相同文本时生成的令牌数量增加了 1 到 1.35 倍。此外,它在处理复杂任务时往往会“思考得更久一些”,因此实际消耗几乎肯定会更高。 为解决这一问题,Anthropic新增了“xhigh”超强思考强度级别。Claude Code已将所有包默认设置为该级别,并推出了Deep Review指令/ultrareview、面向Max用户的Auto Mode扩展,以及“任务预算”功能的公开测试版,以帮助开发者管理令牌使用。
功能更强大的 Mythos Preview 近期已通过“Project Glasswing”项目向企业开放,用于网络安全研究,但由于其能力过于强大且安全评估尚未完成,目前尚未公开发布。
今日发布的 4.7 版本标志着 Anthropic 高频迭代节奏中的最新里程碑。Mythos 终将面世——而当它真正到来时,目前已相当强大的 4.7 版本或许仅仅是个开始。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






