人類揭示其最聰明的“混合推理” AI模型
Anthropic 剛剛推出了 Claude 3.7 Sonnet,標誌著其首個「混合推理模型」的首次亮相。這個突破性的模型旨在應對更複雜的挑戰,相較於早期版本,在數學和程式設計等任務上表現更出色。
為了配合這一進展,Anthropic 同時推出了 Claude Code 的「有限研究預覽」,這是一款代理程式設計工具。雖然 Anthropic 已經為 Cursor 等 AI 程式設計解決方案提供支持,但 Claude Code 被定位為一個互動性強的夥伴,能夠搜尋和閱讀程式碼、修改檔案、撰寫和執行測試、將程式碼推送至 GitHub,並使用命令列工具。
Claude 3.7 Sonnet 將從週一開始在 Claude 應用程式以及 Anthropic 的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 中提供。價格與其前身 3.5 Sonnet 保持一致,為每百萬輸入 token 3 美元,每百萬輸出 token 15 美元。
與 OpenAI 等競爭對手提供獨立的推理模型不同,Anthropic 強調將推理能力直接整合到模型本身中。正如 Anthropic 的產品研究負責人 Dianne Penn 對《The Verge》解釋說:「我們從根本上相信,推理是 AI 的一項功能,而不是完全獨立的東西。」例如,Claude 不會在處理簡單查詢如「現在是什麼時間?」時遇到太多困難,但在處理複雜的提示,如計畫為期兩週的義大利旅行並考慮天氣條件時,表現尤為出色。
Anthropic
Anthropic
Penn 指出,Claude 3.7 Sonnet 在代理程式設計、金融和法律事務方面顯示出顯著的進步。雖然 Claude 尚未支持即時網路搜尋——這是其他模型已具備的能力——但其知識截止日期為 2024 年 10 月,使其更具時效性。開發者可以透過其 scratchpad 功能影響模型的運作方式,並指定確切的回應時間。Anthropic 的產品副總裁 Michael Gerstenhaber 表示:「有時,開發者只需要表明回答問題不應超過 200 毫秒」,這突顯了一項策略性產品決策。
在內部,Anthropic 的員工已利用新模型設計前端網站介面、創建互動遊戲,並進行長達 45 分鐘的程式設計活動,例如建立測試集和反覆改進測試案例,根據 Penn 的說法。

Claude Code。Anthropic
Penn 提到,Anthropic 透過讓模型玩老式 Pokémon 電子遊戲來評估其能力,將模型的 API 對接到控制器介面。雖然 Claude 3.5 Sonnet 最初難以離開 Pallet Town,但 Claude 3.7 已成功擊敗了幾位道館領袖。
Elon Musk 上週推出的 Grok-3 凸顯了 AI 模型競爭的快速步伐。目前,憑藉 Claude 3.7 Sonnet 的出色表現,Anthropic 暫時領先。其發布暗示了未來一個模型即可處理所有任務,而無需針對不同功能使用專門工具。
相關文章
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
亞馬遜推出“Alexa for Shopping”,同時將Rufus邊緣化
亞馬遜推出了“Alexa for Shopping”,將 Rufus 購物聊天機器人 Alexa+ 整合到應用程式、網站和 Echo Show 裝置中。該助手回答產品查詢、比較商品、跟蹤價格,並支援購物提醒。它還處理計劃中的購物操作和符合條件的自動購買。據該公司稱,“Alexa for Shopping”將 Rufus 的產品專業知識與 Alexa+ 的個性化助手上下文相結合。亞馬遜表示,Rufus 在 2025 年協助了超過 3 億客戶進行產品研究、比較和購買。GeekWire 報道稱,
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
相關專題推薦
評論 (4)
0/500
Hybrid reasoning sounds like a game-changer for coding tasks, but I'm curious about the real-world cost. The article mentions new pricing tiers—will this make AI development more accessible or just widen the gap between big labs and indie researchers? 🤔
¡Otra IA 'más inteligente'? 😅 La verdad es que estos lanzamientos ya se sienten como una rutina mensual. Me interesa eso del "razonamiento híbrido", pero me pregunto: ¿realmente resolverá problemas del mundo real de forma más confiable, o solo será mejor en benchmarks artificiales? Veremos cómo se compara en usabilidad con GPT-o.
ハイブリッド推論モデルって何?数学やコーディングが得意なのはすごいけど、AIが複雑な問題を解けるようになると、人間の仕事が奪われるんじゃないかと少し心配😅 でも技術の進歩は止められないから、うまく付き合っていくしかないですね。
Anthropic 剛剛推出了 Claude 3.7 Sonnet,標誌著其首個「混合推理模型」的首次亮相。這個突破性的模型旨在應對更複雜的挑戰,相較於早期版本,在數學和程式設計等任務上表現更出色。
為了配合這一進展,Anthropic 同時推出了 Claude Code 的「有限研究預覽」,這是一款代理程式設計工具。雖然 Anthropic 已經為 Cursor 等 AI 程式設計解決方案提供支持,但 Claude Code 被定位為一個互動性強的夥伴,能夠搜尋和閱讀程式碼、修改檔案、撰寫和執行測試、將程式碼推送至 GitHub,並使用命令列工具。
Claude 3.7 Sonnet 將從週一開始在 Claude 應用程式以及 Anthropic 的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 中提供。價格與其前身 3.5 Sonnet 保持一致,為每百萬輸入 token 3 美元,每百萬輸出 token 15 美元。
與 OpenAI 等競爭對手提供獨立的推理模型不同,Anthropic 強調將推理能力直接整合到模型本身中。正如 Anthropic 的產品研究負責人 Dianne Penn 對《The Verge》解釋說:「我們從根本上相信,推理是 AI 的一項功能,而不是完全獨立的東西。」例如,Claude 不會在處理簡單查詢如「現在是什麼時間?」時遇到太多困難,但在處理複雜的提示,如計畫為期兩週的義大利旅行並考慮天氣條件時,表現尤為出色。
Anthropic
Anthropic
Penn 指出,Claude 3.7 Sonnet 在代理程式設計、金融和法律事務方面顯示出顯著的進步。雖然 Claude 尚未支持即時網路搜尋——這是其他模型已具備的能力——但其知識截止日期為 2024 年 10 月,使其更具時效性。開發者可以透過其 scratchpad 功能影響模型的運作方式,並指定確切的回應時間。Anthropic 的產品副總裁 Michael Gerstenhaber 表示:「有時,開發者只需要表明回答問題不應超過 200 毫秒」,這突顯了一項策略性產品決策。
在內部,Anthropic 的員工已利用新模型設計前端網站介面、創建互動遊戲,並進行長達 45 分鐘的程式設計活動,例如建立測試集和反覆改進測試案例,根據 Penn 的說法。

Claude Code。Anthropic
Penn 提到,Anthropic 透過讓模型玩老式 Pokémon 電子遊戲來評估其能力,將模型的 API 對接到控制器介面。雖然 Claude 3.5 Sonnet 最初難以離開 Pallet Town,但 Claude 3.7 已成功擊敗了幾位道館領袖。
Elon Musk 上週推出的 Grok-3 凸顯了 AI 模型競爭的快速步伐。目前,憑藉 Claude 3.7 Sonnet 的出色表現,Anthropic 暫時領先。其發布暗示了未來一個模型即可處理所有任務,而無需針對不同功能使用專門工具。
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
Hybrid reasoning sounds like a game-changer for coding tasks, but I'm curious about the real-world cost. The article mentions new pricing tiers—will this make AI development more accessible or just widen the gap between big labs and indie researchers? 🤔
¡Otra IA 'más inteligente'? 😅 La verdad es que estos lanzamientos ya se sienten como una rutina mensual. Me interesa eso del "razonamiento híbrido", pero me pregunto: ¿realmente resolverá problemas del mundo real de forma más confiable, o solo será mejor en benchmarks artificiales? Veremos cómo se compara en usabilidad con GPT-o.
ハイブリッド推論モデルって何?数学やコーディングが得意なのはすごいけど、AIが複雑な問題を解けるようになると、人間の仕事が奪われるんじゃないかと少し心配😅 でも技術の進歩は止められないから、うまく付き合っていくしかないですね。





首頁






