選項
首頁
新聞
Claude Opus 4.7 正式推出,重視可靠性勝於智能

Claude Opus 4.7 正式推出,重視可靠性勝於智能

2026-06-05
85

Anthropic 今年持續保持強勁的開發步調,幾乎每隔一天就會推出新功能。備受期待的 Claude Opus 4.7 剛正式發布,有趣的是,Anthropic 在公告中直言不諱地表示:「這並非我們最強大的模型。」 傳聞中更強大的 Claude Mythos Preview 仍處於待命狀態。儘管如此,Opus 4.7 仍引起了相當大的關注,因為它著重解決的是「更可靠」而非「更聰明」的問題。

image.png

基準測試結果相當亮眼。在嚴苛的程式設計基準測試 SWE-bench Pro 上, 4.7 版本的成績從前一版的 53.4% 躍升至 64.3%,提升近 11 個百分點,超越了 GPT-5.4(57.7%)和 Gemini 3.1 Pro(54.2%)。 在視覺推理基準測試 CharXiv 上,其表現從 69.1% 躍升至 82.1%,這主要得益於新增的 2576 像素長邊識別能力,其清晰度較前代產品提升了三倍以上。 在工具呼叫評估 MCP-Atlas 上,其得分為 77.3%;而在法律 AI 平台 Harvey 的 BigLaw 基準測試中,則達到 90.9%。 然而,在代理式搜尋評估BrowseComp上,4.7版從83.7%微幅下滑至79.3%,被GPT-5.4和Gemini超越——這歸因於其「不捏造」的個性,當資訊不完整時,它傾向於報告錯誤而非進行推測。

除了數字之外,性格的轉變更值得注意。Replit 的負責人在測試後指出:「它在技術討論中能與我切磋,協助我做出更佳決策,確實像一位更優秀的同事。」數據科學平台 Hex 也觀察到,當資料缺失時,4.7 會直接回報錯誤,而非像以往那樣提供「看似合理但完全錯誤」的替代值。 與此同時,任務韌性也顯著提升——Notion 團隊的測試顯示,該工具的錯誤率已降至先前水平的三分之一,且當工具鏈發生故障時,它能克服障礙並獨立完成任務。 Vercel 甚至發現了一種新行為:在編寫系統級代碼之前,4.7 會先自行進行數學證明。

image.png

當然,能力提升伴隨著代價。4.7 引入了新的分詞器,針對相同文本生成的令牌數量增加了 1 到 1.35 倍。此外,它在處理複雜任務時傾向於「思考更久一些」,因此實際消耗量幾乎肯定會更高。 為解決此問題,Anthropic 新增了「xhigh」超高額度思考強度等級。Claude Code 已預設將所有套件設為此等級,並推出「深度審查」指令 / ultrareview、針對 Max 用戶的 Auto Mode 擴充功能,以及「任務預算」功能的公開測試版,以協助開發者管理字元使用量。

功能更強大的 Mythos Preview 近期已透過「Project Glasswing」計畫向企業開放,用於網路安全研究;但由於其能力過於強大且安全評估尚未完成,目前尚未對外公開發布。

今日發布的 4.7 版本標誌著 Anthropic 高頻次發布節奏中的最新里程碑。Mythos 終將問世——而當它真正登場時,現已相當強大的 4.7 版本或許僅僅是序幕。

相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
評論 (0)
0/500
OR