智譜釋出GLM-5.3:7400億引數不變,透過後訓練程式設計能力方法實現50%效能提升
智譜於8月14日正式釋出GLM-5.3,其引數量保持與前代GLM-5.3一致的740億,跳過了此前傳聞的萬億引數升級,該升級可能留待GLM-5.5版本。透過先進的後訓練技術,智譜將GLM-5.3的效能提升了50%,在多個主流基準測試中位居當前開源模型前列。其程式碼生成與智慧體(Agent)能力可與Claude Opus 4.8相媲美,在程式設計效率方面超越其他國內模型。
關鍵基準測試的提升凸顯了模型能力的增強。在評估真實終端環境中複雜任務完成的Terminal-Bench 3.0上,得分從4.6飆升至28.3。在專注於長期軟體工程與持續程式碼修改的DeepSWE v1.1中,效能從46.2提升至66.9。在涵蓋多種專業場景、強調跨工具協作與長期任務的Agents’ Last Exam中,得分從23.8提升至28.5。此外,GLM-5.3在涵蓋44個職業領域、評估高價值知識工作的GDPval-AA v2中取得了1,769分,展現出基於程式設計技能的強大專業任務執行能力。總體而言,該模型在複雜軟體工程、終端操作及更廣泛的現實世界智慧體任務方面取得了顯著進步。

最具說服力的證據來自智譜自研的Z.ai Code Bench評測套件。該套件將模型置於真實的本地開發環境中,在各種推理模式下執行端到端任務,高度模擬使用程式碼智慧體的體驗。結果表明,GLM-5.3在有效性與Token效率之間實現了最佳平衡:在High模式下,其準確率達到31.4%,優於Claude Opus 4.8最大模式的29.5%,而每任務平均僅消耗約50,000個Token,相比之下Opus 4.8需消耗120,000個Token。這表明GLM-5.3能夠以顯著更短的執行路徑完成相同任務。

關於產品可用性,GLM-5.3現已在智譜官方編碼工具ZCode及生產力工具AutoClaw上開放使用,面向所有GLM Coding Plan使用者及訂閱者開放。包括TraeWork、TraeCode、Kousi、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode和OpenCode在內的第三方編碼平臺也已提供早期訪問許可權。API即將上線,所有模型權重將在完成必要的安全增強後於兩週內開源。智譜的策略側重於限制模型的潛在攻擊能力,同時保留其防禦價值。今日13:00,所有GLM Coding Plan使用者的配額已重置,後端使用統計資料顯示所有人的限制已恢復。
相關文章
Tesollo 在人手機器人研發之際啟動 IPO 發行
Tesollo 正在研發相容任何仿人平臺的高自由度機械手。| 圖片來源:Tesollo機器人機械手創新企業 Tesollo Inc. 在成功完成 B 輪融資以支援全球擴張後,已正式啟動計劃於明年進行的首次公開募股(IPO)準備工作。該公司總部位於韓國仁川,專注於製造核心機器人部件、先進末端執行器以及旨在提升機器人自主性和實現人機無縫協作的系統。“透過我們的 IPO,我們旨在建立全球客戶信賴的企業基礎,並加速我們在海外市場的擴張,”Tesollo 執行長 Kim Young-Jin 表示。“通
由裡德·霍夫曼和馬克·平庫斯聯合創立的新AI實驗室Prentis,正在洽談籌集1億美元資金。
據兩位知情人士透露,專注於計算機使用模型的新興AI研究實驗室Prentis,由連續創業者Ritankar Das與科技行業資深人士Reid Hoffman和Mark Pincus聯合創立,目前正在談判以10億美元的估值籌集1億美元資金。自今年4月推出以來,Prentis一直在訓練模型,使其掌握辦公人員在各種文件和系統中處理的常規工作流程,旨在建立能夠控制計算機以自動化這些任務的AI代理。Prentis計劃開發針對特定客戶需求定製的代理,例如處理保險索賠和自動化關稅退稅例外情況,從而消除人類手
AIR 籌集 5000 萬美元,助力企業稽覈 AI 智慧體使用的技能與附加元件
隨著企業越來越多地允許 AI 智慧體訪問其內部系統,圍繞這些智慧體所依賴的工具——包括技能、外掛、MCP 伺服器以及實現網際網路互動的附加元件——正在形成一個新的軟體供應鏈。AI 安全初創公司 AIR 認為,企業需要一種監控該供應鏈的方法,目前該公司已結束隱身狀態,透過兩輪種子輪融資籌集了 5000 萬美元,以開發必要的產品。AIR 由 Yair Saban(執行長)和 Niv Hoffman(技術長)創立,兩人均為以色列 8200 情報部隊的前成員,專注於進攻性網路安全。AIR 提供
相關專題推薦
評論 (0)
0/500
智譜於8月14日正式釋出GLM-5.3,其引數量保持與前代GLM-5.3一致的740億,跳過了此前傳聞的萬億引數升級,該升級可能留待GLM-5.5版本。透過先進的後訓練技術,智譜將GLM-5.3的效能提升了50%,在多個主流基準測試中位居當前開源模型前列。其程式碼生成與智慧體(Agent)能力可與Claude Opus 4.8相媲美,在程式設計效率方面超越其他國內模型。
關鍵基準測試的提升凸顯了模型能力的增強。在評估真實終端環境中複雜任務完成的Terminal-Bench 3.0上,得分從4.6飆升至28.3。在專注於長期軟體工程與持續程式碼修改的DeepSWE v1.1中,效能從46.2提升至66.9。在涵蓋多種專業場景、強調跨工具協作與長期任務的Agents’ Last Exam中,得分從23.8提升至28.5。此外,GLM-5.3在涵蓋44個職業領域、評估高價值知識工作的GDPval-AA v2中取得了1,769分,展現出基於程式設計技能的強大專業任務執行能力。總體而言,該模型在複雜軟體工程、終端操作及更廣泛的現實世界智慧體任務方面取得了顯著進步。

最具說服力的證據來自智譜自研的Z.ai Code Bench評測套件。該套件將模型置於真實的本地開發環境中,在各種推理模式下執行端到端任務,高度模擬使用程式碼智慧體的體驗。結果表明,GLM-5.3在有效性與Token效率之間實現了最佳平衡:在High模式下,其準確率達到31.4%,優於Claude Opus 4.8最大模式的29.5%,而每任務平均僅消耗約50,000個Token,相比之下Opus 4.8需消耗120,000個Token。這表明GLM-5.3能夠以顯著更短的執行路徑完成相同任務。

關於產品可用性,GLM-5.3現已在智譜官方編碼工具ZCode及生產力工具AutoClaw上開放使用,面向所有GLM Coding Plan使用者及訂閱者開放。包括TraeWork、TraeCode、Kousi、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode和OpenCode在內的第三方編碼平臺也已提供早期訪問許可權。API即將上線,所有模型權重將在完成必要的安全增強後於兩週內開源。智譜的策略側重於限制模型的潛在攻擊能力,同時保留其防禦價值。今日13:00,所有GLM Coding Plan使用者的配額已重置,後端使用統計資料顯示所有人的限制已恢復。
Tesollo 在人手機器人研發之際啟動 IPO 發行
Tesollo 正在研發相容任何仿人平臺的高自由度機械手。| 圖片來源:Tesollo機器人機械手創新企業 Tesollo Inc. 在成功完成 B 輪融資以支援全球擴張後,已正式啟動計劃於明年進行的首次公開募股(IPO)準備工作。該公司總部位於韓國仁川,專注於製造核心機器人部件、先進末端執行器以及旨在提升機器人自主性和實現人機無縫協作的系統。“透過我們的 IPO,我們旨在建立全球客戶信賴的企業基礎,並加速我們在海外市場的擴張,”Tesollo 執行長 Kim Young-Jin 表示。“通
由裡德·霍夫曼和馬克·平庫斯聯合創立的新AI實驗室Prentis,正在洽談籌集1億美元資金。
據兩位知情人士透露,專注於計算機使用模型的新興AI研究實驗室Prentis,由連續創業者Ritankar Das與科技行業資深人士Reid Hoffman和Mark Pincus聯合創立,目前正在談判以10億美元的估值籌集1億美元資金。自今年4月推出以來,Prentis一直在訓練模型,使其掌握辦公人員在各種文件和系統中處理的常規工作流程,旨在建立能夠控制計算機以自動化這些任務的AI代理。Prentis計劃開發針對特定客戶需求定製的代理,例如處理保險索賠和自動化關稅退稅例外情況,從而消除人類手
AIR 籌集 5000 萬美元,助力企業稽覈 AI 智慧體使用的技能與附加元件
隨著企業越來越多地允許 AI 智慧體訪問其內部系統,圍繞這些智慧體所依賴的工具——包括技能、外掛、MCP 伺服器以及實現網際網路互動的附加元件——正在形成一個新的軟體供應鏈。AI 安全初創公司 AIR 認為,企業需要一種監控該供應鏈的方法,目前該公司已結束隱身狀態,透過兩輪種子輪融資籌集了 5000 萬美元,以開發必要的產品。AIR 由 Yair Saban(執行長)和 Niv Hoffman(技術長)創立,兩人均為以色列 8200 情報部隊的前成員,專注於進攻性網路安全。AIR 提供





首頁






