Cursor Composer 2 与 Claude Opus 4.6:基准测试引发新一轮人工智能编程争论
3月19日,Cursor正式发布了其自主研发的编程模型Composer 2。 这一消息在开发者社区中立即引发热议——据 Cursor 称,Composer 2 在 Terminal-Bench 2.0 测试中获得了 61.7% 的得分,在相同的测试条件下,这一成绩显著超过了 Claude Opus 4.6 的 58.0%。
Anthropic的旗舰模型竟被自家IDE内置的模型超越?随着消息传开,相关争论迅速涌现。

三项关键基准测试结果
Cursor 发布了三组基准测试结果,均已公开:
Terminal-Bench 2.0(代理式终端编码任务):Composer 2 得分 61.7%,超越了 Claude Opus 4.6 的 58.0%。 不过,OpenAI GPT-5.4仍以75.1%的成绩保持领先。CursorBench(Cursor内的真实编程场景): Composer 2 达到 61.3%,较前代 Composer 1.5 的 44.2% 大幅跃升,同时也高于 Claude Opus 4.6 的 58.2%。SWE-bench 多语言(多语言软件工程): Composer 2 取得 73.7% 的成绩,较其前代产品有显著提升。不过,有一点值得注意:Anthropic此前曾报告称,在优化设置下,Claude Opus 4.6在Terminal-Bench 2.0上的得分达到65.4%,远高于Cursor引用的58.0%。 这种差异源于测试框架——Cursor使用了Harbor等第三方代理环境,并取五次运行结果的平均值,而Anthropic的数据则来自其自身的优化配置。由于采用的参考系统不同,这两组数据无法直接比较。 Cursor并未回避这一问题;其公告中明确指出“结果取决于智能体、测试框架和设置”。
成本仅为Opus 4.6的十分之一
性价比才是 Composer 2 真正的隐形优势。
其定价为每百万输入/输出令牌 0.50 美元/2.50 美元,相比之下,Claude Opus 4.6 的定价为 5 美元/25 美元,GPT-5.4 为 2.5 美元/15 美元,两者形成鲜明对比。 Cursor 解释称,Composer 2 是专为长周期编码任务从零开始构建的,利用其专有的强化学习(RL)训练和“自我摘要”技术,同时降低了延迟和成本——他们将其描述为“前沿智能 + 极致速度”。
Composer 2 是 Cursor 的第三款自研模型,继 Composer 1(2025 年 10 月)和 1.5 版(2026 年 2 月)之后推出。此次发布重点强调“长周期任务”,并将一个更快、更轻量级的变体设为 Cursor IDE 中的默认模型。
“浴火重生”的深层含义
Cursor 决定将其模型与 Opus 4.6 直接对比,这标志着更广泛的人工智能编码工具格局正在发生转变。
OpenAI 和 Anthropic 在通用前沿能力上展开竞争,而像 Cursor 这样的垂直工具提供商则另辟蹊径:将特定任务的性能打磨到卓越水平,进而利用价格优势脱颖而出。 VentureBeat 和 The New Stack 等媒体指出,Composer 2 将加速“多模型路由”的实际落地——即使用 Opus 或 GPT 进行复杂推理,而将 Composer 2 用于日常高频编码,从而兼得两者的优势。
Claude Opus 4.6 于 2 月 5 日发布,并在 Terminal-Bench 2.0、Humanity's Last Exam 和 GDPval-AA 等多个基准测试中名列前茅。Cursor 的新测试结果至少对该模型在专业编码领域的统治地位提出了质疑。
目前开发者的反响大多积极,但许多人表示希望先观察其在实际项目中的表现再下结论——这是一种合理的态度,毕竟基准测试终究只是基准测试。Cursor 已向订阅用户开放了在 IDE 内免费试用 Composer 2 的权限。
数据来源:Cursor官方公告及主流科技媒体,截至2026年3月20日。最新排名可访问tbench.ai或Cursor官网查看。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (0)
0/500
3月19日,Cursor正式发布了其自主研发的编程模型Composer 2。 这一消息在开发者社区中立即引发热议——据 Cursor 称,Composer 2 在 Terminal-Bench 2.0 测试中获得了 61.7% 的得分,在相同的测试条件下,这一成绩显著超过了 Claude Opus 4.6 的 58.0%。
Anthropic的旗舰模型竟被自家IDE内置的模型超越?随着消息传开,相关争论迅速涌现。

三项关键基准测试结果
Cursor 发布了三组基准测试结果,均已公开:
Terminal-Bench 2.0(代理式终端编码任务):Composer 2 得分 61.7%,超越了 Claude Opus 4.6 的 58.0%。 不过,OpenAI GPT-5.4仍以75.1%的成绩保持领先。CursorBench(Cursor内的真实编程场景): Composer 2 达到 61.3%,较前代 Composer 1.5 的 44.2% 大幅跃升,同时也高于 Claude Opus 4.6 的 58.2%。SWE-bench 多语言(多语言软件工程): Composer 2 取得 73.7% 的成绩,较其前代产品有显著提升。不过,有一点值得注意:Anthropic此前曾报告称,在优化设置下,Claude Opus 4.6在Terminal-Bench 2.0上的得分达到65.4%,远高于Cursor引用的58.0%。 这种差异源于测试框架——Cursor使用了Harbor等第三方代理环境,并取五次运行结果的平均值,而Anthropic的数据则来自其自身的优化配置。由于采用的参考系统不同,这两组数据无法直接比较。 Cursor并未回避这一问题;其公告中明确指出“结果取决于智能体、测试框架和设置”。
成本仅为Opus 4.6的十分之一
性价比才是 Composer 2 真正的隐形优势。
其定价为每百万输入/输出令牌 0.50 美元/2.50 美元,相比之下,Claude Opus 4.6 的定价为 5 美元/25 美元,GPT-5.4 为 2.5 美元/15 美元,两者形成鲜明对比。 Cursor 解释称,Composer 2 是专为长周期编码任务从零开始构建的,利用其专有的强化学习(RL)训练和“自我摘要”技术,同时降低了延迟和成本——他们将其描述为“前沿智能 + 极致速度”。
Composer 2 是 Cursor 的第三款自研模型,继 Composer 1(2025 年 10 月)和 1.5 版(2026 年 2 月)之后推出。此次发布重点强调“长周期任务”,并将一个更快、更轻量级的变体设为 Cursor IDE 中的默认模型。
“浴火重生”的深层含义
Cursor 决定将其模型与 Opus 4.6 直接对比,这标志着更广泛的人工智能编码工具格局正在发生转变。
OpenAI 和 Anthropic 在通用前沿能力上展开竞争,而像 Cursor 这样的垂直工具提供商则另辟蹊径:将特定任务的性能打磨到卓越水平,进而利用价格优势脱颖而出。 VentureBeat 和 The New Stack 等媒体指出,Composer 2 将加速“多模型路由”的实际落地——即使用 Opus 或 GPT 进行复杂推理,而将 Composer 2 用于日常高频编码,从而兼得两者的优势。
Claude Opus 4.6 于 2 月 5 日发布,并在 Terminal-Bench 2.0、Humanity's Last Exam 和 GDPval-AA 等多个基准测试中名列前茅。Cursor 的新测试结果至少对该模型在专业编码领域的统治地位提出了质疑。
目前开发者的反响大多积极,但许多人表示希望先观察其在实际项目中的表现再下结论——这是一种合理的态度,毕竟基准测试终究只是基准测试。Cursor 已向订阅用户开放了在 IDE 内免费试用 Composer 2 的权限。
数据来源:Cursor官方公告及主流科技媒体,截至2026年3月20日。最新排名可访问tbench.ai或Cursor官网查看。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






