微軟研究發現更多 AI 代幣會增加推理錯誤
LLM 推理效率的新觀點
微軟的最新研究顯示,大型語言模型中的先進推理技術並不能在不同的人工智能系統中產生一致的改進。他們的突破性研究分析了九個領先的基礎模型在推理過程中對各種擴充方法的反應。
評估推理時間縮放方法
研究團隊針對三種不同的縮放技術實施了嚴格的測試方法:
- 傳統的思考鏈提示
- 並行答案產生與彙總
- 透過回饋迴圈進行順序精煉

評估推理效能的實驗框架 八項綜合基準提供了跨學科的挑戰性測試情境,包括數學、科學推理、複雜問題解決和空間分析。有幾個評估的難度是分等級的,以檢視效能如何隨著問題複雜性而遞增。
推理能力的重要發現
對於人工智能實務人員而言,這項全面的評估產生了幾項重要的啟發:
- 模型架構和任務領域不同,縮放技術帶來的效能提升也有很大差異
- 較長的回應時間與較好的解決方案並不一致
- 即使是相同的查詢,計算成本也會出現不可預測的波動
- 傳統模型有時可以透過廣泛的擴充來匹配專門的推理模型
- 驗證機制有希望提高效率

不同模型和任務的效能相對於計算成本 對人工智能發展的實際影響
這些發現對企業的 AI 實作有重大影響:
成本的可預測性是一大挑戰,即使是正確的答案,代幣的使用量也顯示出很大的差異。"微軟研究人員 Besmira Nushi 指出:「開發人員需要具有一致計算模式的模型。
這項研究也指出回應長度是模型可信度的潛在指標,過長的回應通常代表超過特定臨界值的錯誤解決方案。

GPT-4o 性能中的推理縮放模式 高效推理系統的未來
這項研究強調了未來發展的多個前景看好的方向:
Nushi 解釋說:「驗證機制可以改變我們處理推理問題的方式,」他建議將現有的企業驗證系統適用於 AI 應用。這種整合將允許自然語言介面利用專門的驗證邏輯。
這項研究強調,隨著人工智慧系統承接越來越複雜的現實世界任務,人們越來越需要能平衡推理準確性與可預測計算成本的解決方案。
相關文章
Gemini 向美國用戶提供免費的個人化 AI 圖片生成服務
週一,Google 宣布 Gemini 應用程式將其由 Nano Banana 驅動的個人化影像生成功能,擴展至更廣泛的用戶群。自今日起,美國所有符合資格的用戶均可免費使用此功能,取消了先前僅限 Plus、Pro 和 Ultra 訂閱用戶才能使用的限制。Gemini 的「個人智慧」功能於四月首次推出,讓使用者能生成符合其特定興趣的圖片。此功能使 AI 能根據對您偏好的理解來創作視覺內容,無需在提示
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
Gemini 的新功能預計將很快整合至 Google TV
週三,Google 公布了一系列即將登陸 Google TV 的人工智慧驅動新功能,其中包括一個專門的短影片區塊,將把 YouTube Shorts 直接置於主畫面。這些更新的核心在於圍繞 Gemini 打造的增強功能。在 Gemini 標籤頁中,一個「創作」按鈕讓使用者能存取名為 Nano Banana 和 Veo 的生成式 AI 工具。這些工具最初將在美國境內支援 Gemini 的 TCL 電
相關專題推薦
評論 (1)
0/500
LLM 推理效率的新觀點
微軟的最新研究顯示,大型語言模型中的先進推理技術並不能在不同的人工智能系統中產生一致的改進。他們的突破性研究分析了九個領先的基礎模型在推理過程中對各種擴充方法的反應。
評估推理時間縮放方法
研究團隊針對三種不同的縮放技術實施了嚴格的測試方法:
- 傳統的思考鏈提示
- 並行答案產生與彙總
- 透過回饋迴圈進行順序精煉

八項綜合基準提供了跨學科的挑戰性測試情境,包括數學、科學推理、複雜問題解決和空間分析。有幾個評估的難度是分等級的,以檢視效能如何隨著問題複雜性而遞增。
推理能力的重要發現
對於人工智能實務人員而言,這項全面的評估產生了幾項重要的啟發:
- 模型架構和任務領域不同,縮放技術帶來的效能提升也有很大差異
- 較長的回應時間與較好的解決方案並不一致
- 即使是相同的查詢,計算成本也會出現不可預測的波動
- 傳統模型有時可以透過廣泛的擴充來匹配專門的推理模型
- 驗證機制有希望提高效率

對人工智能發展的實際影響
這些發現對企業的 AI 實作有重大影響:
成本的可預測性是一大挑戰,即使是正確的答案,代幣的使用量也顯示出很大的差異。"微軟研究人員 Besmira Nushi 指出:「開發人員需要具有一致計算模式的模型。
這項研究也指出回應長度是模型可信度的潛在指標,過長的回應通常代表超過特定臨界值的錯誤解決方案。

高效推理系統的未來
這項研究強調了未來發展的多個前景看好的方向:
Nushi 解釋說:「驗證機制可以改變我們處理推理問題的方式,」他建議將現有的企業驗證系統適用於 AI 應用。這種整合將允許自然語言介面利用專門的驗證邏輯。
這項研究強調,隨著人工智慧系統承接越來越複雜的現實世界任務,人們越來越需要能平衡推理準確性與可預測計算成本的解決方案。
Gemini 向美國用戶提供免費的個人化 AI 圖片生成服務
週一,Google 宣布 Gemini 應用程式將其由 Nano Banana 驅動的個人化影像生成功能,擴展至更廣泛的用戶群。自今日起,美國所有符合資格的用戶均可免費使用此功能,取消了先前僅限 Plus、Pro 和 Ultra 訂閱用戶才能使用的限制。Gemini 的「個人智慧」功能於四月首次推出,讓使用者能生成符合其特定興趣的圖片。此功能使 AI 能根據對您偏好的理解來創作視覺內容,無需在提示
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
Gemini 的新功能預計將很快整合至 Google TV
週三,Google 公布了一系列即將登陸 Google TV 的人工智慧驅動新功能,其中包括一個專門的短影片區塊,將把 YouTube Shorts 直接置於主畫面。這些更新的核心在於圍繞 Gemini 打造的增強功能。在 Gemini 標籤頁中,一個「創作」按鈕讓使用者能存取名為 Nano Banana 和 Veo 的生成式 AI 工具。這些工具最初將在美國境內支援 Gemini 的 TCL 電





首頁






