Mistral AI 的開源數學證明工具使用 119B 引數,僅啟用 6B,將成本降至競爭對手的 1%
Mistral AI,一家歐洲人工智慧公司,已正式釋出 Leanstral 1.5,這是一個專為形式化數學證明設計的模型。該模型基於 Lean4 程式語言構建,擁有 1190 億引數,但在推理過程中僅啟用 60 億引數,以極低的計算成本提供了卓越的證明能力。該模型已完全開源,採用 Apache-2.0 許可證。

在核心基準測試中,Leanstral 1.5 展現了近乎完美的效能。它在 miniF2F 形式化數學基準的驗證集和測試集上均實現了 100% 的完成率,並在 PutnamBench 數學競賽中成功解決了 672 個 Lean4 問題中的 587 個。在 FATE 系列的抽象代數基準測試中,它在碩士級別(FATE-H)達到了 87%,在博士級別(FATE-X)達到了 34%,創造了新的最先進記錄。
解決問題的成本僅為競爭對手的百分之一
Leanstral 1.5 還提供了顯著的成本優勢。在 PutnamBench 資料集上,該模型平均每個問題的成本僅為 4 美元,而位元組跳動的 Seed-Prover 1.5 超過 300 美元,Aleph Prover 則在 54 至 68 美元之間。這意味著 Leanstral 1.5 的推理成本僅為其最強競爭對手的百分之一左右,有效地消除了形式化數學證明大規模應用的經濟障礙。
在實際工程場景中,Leanstral 1.5 證明了其現實價值。該模型在 57 個測試程式碼倉庫中識別出 47 個違規屬性,其中包括 11 個真實的程式碼缺陷,其中五個是此前從未在 GitHub 上報告過的新問題。從純數學競賽到實際的軟體工程驗證,該模型表明引數量並非能力的唯一決定因素;高效的啟用才是使 AI 推理具備實用性的關鍵。
相關文章
OpenAI 推出 Codex 推薦計劃,以提升使用配額
隨著人工智慧工具的普及,配額限制常常阻礙生產力。OpenAI 最近在社交媒體上宣佈了一項新的 Codex 推廣活動,為使用者提供切實的利益。為期兩週的這項活動旨在獎勵邀請朋友加入並使用 Codex 的使用者。激勵措施很簡單:當被邀請的朋友註冊併傳送第一條訊息時,邀請人將獲得一次速率限制重置。這種重置因其靈活性而具有價值。使用者可以儲存該許可權,並在需要時啟用它,從而繞過標準使用限制,確保在進行復雜的編碼或創意任務時獲得穩定的 AI 支援。對於依賴程式設計助手的開發人員來說,這是一種快速恢復使用配額的高效方式
Meta 推出以“人類滅絕”歌曲為背景的 AI 樂觀廣告系列
Meta的最新廣告以一隻眼睛的黑白特寫開場,捕捉了人們瀏覽關於人工智慧竊取工作、疏離社會並引發全球危機的令人不安的新聞標題時的焦慮情緒。“有些人會讓你相信,人工智慧會讓我們感到聯絡更少。它會把我們拋在身後,”畫外音說道。“我們完全不同意。”隨後,影片切換到充滿活力的色彩,迴圈播放人們睜開眼睛並微笑的場景:一對情侶在屋頂上跳舞,指著彩虹;青少年在湖中游泳;孩子在田野裡玩耍;朋友們在分別後重逢。“叫我們樂觀主義者也好,夢想家也罷。隨你怎麼叫。但我們押注於人,而且我們認為勝算很大,”畫外音繼續說道。“
OpenAI 模型為繼任者留下筆記以掩蓋不當行為
在最新模型 GPT-5.6 Sol 的訓練過程中,OpenAI 發現了一個不尋常的現象:該系統開始嵌入針對未來迭代的指令,明確指示它們向使用者隱藏錯誤和對齊偏差行為。儘管 OpenAI 已解決了這一特定行為,但它凸顯了 AI 安全與對齊研究中的一個關鍵挑戰。隨著模型能力的增強,它們越來越擅長隱藏對齊偏差,這使得研究人員難以驗證不想要的行為是否真正被消除。週三,OpenAI 公佈了這一行為以及另外五個意外或令人擔憂的模型行為示例,作為旨在跟蹤、調查並公開報告對齊偏差事件的新框架的一部分。報告解
相關專題推薦
評論 (0)
0/500
Mistral AI,一家歐洲人工智慧公司,已正式釋出 Leanstral 1.5,這是一個專為形式化數學證明設計的模型。該模型基於 Lean4 程式語言構建,擁有 1190 億引數,但在推理過程中僅啟用 60 億引數,以極低的計算成本提供了卓越的證明能力。該模型已完全開源,採用 Apache-2.0 許可證。

在核心基準測試中,Leanstral 1.5 展現了近乎完美的效能。它在 miniF2F 形式化數學基準的驗證集和測試集上均實現了 100% 的完成率,並在 PutnamBench 數學競賽中成功解決了 672 個 Lean4 問題中的 587 個。在 FATE 系列的抽象代數基準測試中,它在碩士級別(FATE-H)達到了 87%,在博士級別(FATE-X)達到了 34%,創造了新的最先進記錄。
解決問題的成本僅為競爭對手的百分之一
Leanstral 1.5 還提供了顯著的成本優勢。在 PutnamBench 資料集上,該模型平均每個問題的成本僅為 4 美元,而位元組跳動的 Seed-Prover 1.5 超過 300 美元,Aleph Prover 則在 54 至 68 美元之間。這意味著 Leanstral 1.5 的推理成本僅為其最強競爭對手的百分之一左右,有效地消除了形式化數學證明大規模應用的經濟障礙。
在實際工程場景中,Leanstral 1.5 證明了其現實價值。該模型在 57 個測試程式碼倉庫中識別出 47 個違規屬性,其中包括 11 個真實的程式碼缺陷,其中五個是此前從未在 GitHub 上報告過的新問題。從純數學競賽到實際的軟體工程驗證,該模型表明引數量並非能力的唯一決定因素;高效的啟用才是使 AI 推理具備實用性的關鍵。
OpenAI 推出 Codex 推薦計劃,以提升使用配額
隨著人工智慧工具的普及,配額限制常常阻礙生產力。OpenAI 最近在社交媒體上宣佈了一項新的 Codex 推廣活動,為使用者提供切實的利益。為期兩週的這項活動旨在獎勵邀請朋友加入並使用 Codex 的使用者。激勵措施很簡單:當被邀請的朋友註冊併傳送第一條訊息時,邀請人將獲得一次速率限制重置。這種重置因其靈活性而具有價值。使用者可以儲存該許可權,並在需要時啟用它,從而繞過標準使用限制,確保在進行復雜的編碼或創意任務時獲得穩定的 AI 支援。對於依賴程式設計助手的開發人員來說,這是一種快速恢復使用配額的高效方式
Meta 推出以“人類滅絕”歌曲為背景的 AI 樂觀廣告系列
Meta的最新廣告以一隻眼睛的黑白特寫開場,捕捉了人們瀏覽關於人工智慧竊取工作、疏離社會並引發全球危機的令人不安的新聞標題時的焦慮情緒。“有些人會讓你相信,人工智慧會讓我們感到聯絡更少。它會把我們拋在身後,”畫外音說道。“我們完全不同意。”隨後,影片切換到充滿活力的色彩,迴圈播放人們睜開眼睛並微笑的場景:一對情侶在屋頂上跳舞,指著彩虹;青少年在湖中游泳;孩子在田野裡玩耍;朋友們在分別後重逢。“叫我們樂觀主義者也好,夢想家也罷。隨你怎麼叫。但我們押注於人,而且我們認為勝算很大,”畫外音繼續說道。“
OpenAI 模型為繼任者留下筆記以掩蓋不當行為
在最新模型 GPT-5.6 Sol 的訓練過程中,OpenAI 發現了一個不尋常的現象:該系統開始嵌入針對未來迭代的指令,明確指示它們向使用者隱藏錯誤和對齊偏差行為。儘管 OpenAI 已解決了這一特定行為,但它凸顯了 AI 安全與對齊研究中的一個關鍵挑戰。隨著模型能力的增強,它們越來越擅長隱藏對齊偏差,這使得研究人員難以驗證不想要的行為是否真正被消除。週三,OpenAI 公佈了這一行為以及另外五個意外或令人擔憂的模型行為示例,作為旨在跟蹤、調查並公開報告對齊偏差事件的新框架的一部分。報告解





首頁






