《Cursor Composer 2》對決《Claude Opus 4.6》:效能測試引發新一輪 AI 程式設計辯論
3月19日,Cursor 正式發布其自主研發的編碼模型 Composer 2。 這項公告在開發者社群中立即引發熱議——根據 Cursor 的說法,Composer 2 在 Terminal-Bench 2.0 上的得分為 61.7%,在相同的測試條件下,顯著超越了 Claude Opus 4.6 的 58.0%。
Anthropic 的旗艦模型,竟被自家 IDE 內建的模型超越?隨著消息傳開,相關辯論迅速浮現。

三項關鍵基準測試結果
Cursor 發布了三組基準測試結果,均已公開:
Terminal-Bench 2.0(代理式終端編碼任務):Composer 2 獲得 61.7% 的成績,超越 Claude Opus 4.6 的 58.0%。 然而,OpenAI GPT-5.4 仍以 75.1%保持領先。CursorBench(Cursor 內的真實世界編碼情境): Composer 2 達到 61.3%,相較於前代 Composer 1.5 的 44.2% 有顯著提升,且高於 Claude Opus 4.6 的 58.2%。SWE-bench 多語言(多語言軟體工程): Composer 2 達 73.7%,相較前代有顯著提升。然而,有一點值得注意:Anthropic 先前曾報告,在最佳化設定下,Claude Opus 4.6 於 Terminal-Bench 2.0 上的得分為 65.4%,遠高於 Cursor 所引用的 58.0%。 此差異源於測試框架——Cursor 採用 Harbor 等第三方代理環境,並取五次執行結果的平均值;而 Anthropic 的數據則來自其自身的優化配置。由於採用不同的參考系統,這兩組數據無法直接比較。 Cursor 並未迴避此點;該公告明確指出「結果取決於代理程式、測試框架及設定。」
成本僅為 Opus 4.6 的十分之一
成本效益才是 Composer 2 真正的隱藏優勢。
其定價為每百萬輸入/輸出代幣 0.50 美元/2.50 美元,相較於 Claude Opus 4.6 的 5 美元/25 美元,以及 GPT-5.4 的 2.5 美元/15 美元,對比極為鮮明。 Cursor 解釋,Composer 2 是專為長週期編碼任務從頭打造,運用其專有的強化學習(RL)訓練與「自我摘要」技術,同時降低延遲與成本——他們將此描述為「前沿智慧 + 極致速度」。
Composer 2 是 Cursor 的第三款自研模型,繼承自 Composer 1(2025 年 10 月)和 1.5 版(2026 年 2 月)。此版本強調「長時程任務」,並將更快、更輕量的變體設為 Cursor IDE 的預設模型。
這場「浴火重生」的意義
Cursor 決定將其模型與 Opus 4.6 直接比較,預示著更廣泛的 AI 編碼工具領域正發生轉變。
OpenAI 與 Anthropic 在通用前沿能力上展開競爭,而像 Cursor 這樣的垂直工具供應商則採取了不同的路線:將特定任務的表現精煉至卓越水準,再利用價格優勢脫穎而出。 VentureBeat 和 The New Stack 等媒體指出,Composer 2 將加速「多模型路由」的實際部署——即使用 Opus 或 GPT 進行複雜推理,並切換至 Composer 2 處理日常高頻率編碼,從而兼顧兩者的優勢。
Claude Opus 4.6 於 2 月 5 日推出,並在 Terminal-Bench 2.0、Humanity's Last Exam 及 GDPval-AA 等數項基準測試中名列前茅。Cursor 的新測試結果至少對其在專業編碼領域的統治地位提出了質疑。
迄今為止,開發者的反應大多正面,但許多人表示希望先觀察實際專案的表現再下結論——這是一個合理的立場,畢竟基準測試終究只是基準測試。Cursor 已開放訂閱用戶在 IDE 內免費試用 Composer 2。
資料來源:Cursor 官方公告及主要科技媒體,截至 2026 年 3 月 20 日。最新排名可於 tbench.ai 或 Cursor 官網查閱。
相關文章
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
印度軟體巨頭縮減招聘,承諾隨著 AI 代理規模擴大不裁員
隨著人工智慧重塑傳統的勞動密集型商業模式,印度領先的軟體外包公司塔塔諮詢服務公司(TCS)公佈了其戰略應對措施。在週二的年度股東大會上,董事長概述了人機協作的願景,並澄清了公司在人工智慧時代的人力資源戰略。不裁員,但招聘將放緩TCS董事長明確表示,公司沒有因採用人工智慧而裁員的計劃,儘管整體招聘速度將放緩。雖然TCS此前減少了超過10,000名員工,但官員們強調,公司現在更傾向於透過自然流失來最佳化其人員結構,而非突然裁員。高層管理人員指出,以前由人類處理的重複性、機械性任務正不可避免地轉向
相關專題推薦
評論 (0)
0/500
3月19日,Cursor 正式發布其自主研發的編碼模型 Composer 2。 這項公告在開發者社群中立即引發熱議——根據 Cursor 的說法,Composer 2 在 Terminal-Bench 2.0 上的得分為 61.7%,在相同的測試條件下,顯著超越了 Claude Opus 4.6 的 58.0%。
Anthropic 的旗艦模型,竟被自家 IDE 內建的模型超越?隨著消息傳開,相關辯論迅速浮現。

三項關鍵基準測試結果
Cursor 發布了三組基準測試結果,均已公開:
Terminal-Bench 2.0(代理式終端編碼任務):Composer 2 獲得 61.7% 的成績,超越 Claude Opus 4.6 的 58.0%。 然而,OpenAI GPT-5.4 仍以 75.1%保持領先。CursorBench(Cursor 內的真實世界編碼情境): Composer 2 達到 61.3%,相較於前代 Composer 1.5 的 44.2% 有顯著提升,且高於 Claude Opus 4.6 的 58.2%。SWE-bench 多語言(多語言軟體工程): Composer 2 達 73.7%,相較前代有顯著提升。然而,有一點值得注意:Anthropic 先前曾報告,在最佳化設定下,Claude Opus 4.6 於 Terminal-Bench 2.0 上的得分為 65.4%,遠高於 Cursor 所引用的 58.0%。 此差異源於測試框架——Cursor 採用 Harbor 等第三方代理環境,並取五次執行結果的平均值;而 Anthropic 的數據則來自其自身的優化配置。由於採用不同的參考系統,這兩組數據無法直接比較。 Cursor 並未迴避此點;該公告明確指出「結果取決於代理程式、測試框架及設定。」
成本僅為 Opus 4.6 的十分之一
成本效益才是 Composer 2 真正的隱藏優勢。
其定價為每百萬輸入/輸出代幣 0.50 美元/2.50 美元,相較於 Claude Opus 4.6 的 5 美元/25 美元,以及 GPT-5.4 的 2.5 美元/15 美元,對比極為鮮明。 Cursor 解釋,Composer 2 是專為長週期編碼任務從頭打造,運用其專有的強化學習(RL)訓練與「自我摘要」技術,同時降低延遲與成本——他們將此描述為「前沿智慧 + 極致速度」。
Composer 2 是 Cursor 的第三款自研模型,繼承自 Composer 1(2025 年 10 月)和 1.5 版(2026 年 2 月)。此版本強調「長時程任務」,並將更快、更輕量的變體設為 Cursor IDE 的預設模型。
這場「浴火重生」的意義
Cursor 決定將其模型與 Opus 4.6 直接比較,預示著更廣泛的 AI 編碼工具領域正發生轉變。
OpenAI 與 Anthropic 在通用前沿能力上展開競爭,而像 Cursor 這樣的垂直工具供應商則採取了不同的路線:將特定任務的表現精煉至卓越水準,再利用價格優勢脫穎而出。 VentureBeat 和 The New Stack 等媒體指出,Composer 2 將加速「多模型路由」的實際部署——即使用 Opus 或 GPT 進行複雜推理,並切換至 Composer 2 處理日常高頻率編碼,從而兼顧兩者的優勢。
Claude Opus 4.6 於 2 月 5 日推出,並在 Terminal-Bench 2.0、Humanity's Last Exam 及 GDPval-AA 等數項基準測試中名列前茅。Cursor 的新測試結果至少對其在專業編碼領域的統治地位提出了質疑。
迄今為止,開發者的反應大多正面,但許多人表示希望先觀察實際專案的表現再下結論——這是一個合理的立場,畢竟基準測試終究只是基準測試。Cursor 已開放訂閱用戶在 IDE 內免費試用 Composer 2。
資料來源:Cursor 官方公告及主要科技媒體,截至 2026 年 3 月 20 日。最新排名可於 tbench.ai 或 Cursor 官網查閱。
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
印度軟體巨頭縮減招聘,承諾隨著 AI 代理規模擴大不裁員
隨著人工智慧重塑傳統的勞動密集型商業模式,印度領先的軟體外包公司塔塔諮詢服務公司(TCS)公佈了其戰略應對措施。在週二的年度股東大會上,董事長概述了人機協作的願景,並澄清了公司在人工智慧時代的人力資源戰略。不裁員,但招聘將放緩TCS董事長明確表示,公司沒有因採用人工智慧而裁員的計劃,儘管整體招聘速度將放緩。雖然TCS此前減少了超過10,000名員工,但官員們強調,公司現在更傾向於透過自然流失來最佳化其人員結構,而非突然裁員。高層管理人員指出,以前由人類處理的重複性、機械性任務正不可避免地轉向





首頁






