模型擴充時代結束,演算法獲利成優先考量

在過去十年的大部分時間裡,人工智慧的進步主要來自於規模的擴大。成功來自於更大的資料集、更多的參數和更強大的運算能力,團隊爭相建立更大型的模型。進步是以萬億個參數和 PB 級的訓練資料來衡量的--這個時代我們現在稱之為擴展時代。儘管這種方法驅動了今日大部分的人工智慧能力,但我們已接近一個臨界點,那就是單純地擴大模型已不再是最有效、最智慧或最永續的發展路徑。因此,焦點正從純粹的規模轉移到演算法的突破。本文將探討為何單單擴大規模已經無法滿足需求,以及下一波的人工智慧進展將如何取決於演算法的創新。
模型擴充的回報遞減定律
擴充時代建立在堅實的經驗基礎上。研究人員持續發現,增加模型和資料集的規模會帶來可預測的效能提升 - 這種模式被稱為擴充定律。這些原則成為領導 AI 實驗室的指導策略,並引發了開發更大型系統的競賽。這場競賽催生了大型語言模型和基礎模型,這些模型驅動了當今許多人工智能應用程式。然而,就像任何指數級趨勢一樣,AI 的擴充曲線現在已經開始漸趨平穩。開發更大型模型的成本正在急劇攀升。現在訓練一個最先進的系統所消耗的能源可能相當於一個小城鎮,這引起了重大的環境問題。財務支出已變得如此龐大,以至於只有少數特定的組織才能參與其中。與此同時,我們也目睹了回報遞減的明顯信號。參數數量增加一倍已不再會帶來相稱的能力提升。改進變得循序漸進,主要是改進現有的知識,而不是實現新的功能。每增加一美元和瓦特的投資所獲得的價值正在下降。擴充方法已接近其實用與經濟的極限。
新領域:算法效率
縮放定律的限制促使研究人員轉向演算法效率。現在的重點不再是單純依賴運算強度,而是設計更有效運用資源的智慧型演算法。最近的發展突顯了這一轉變的前景。舉例來說,Transformer 架構由其注意力機制所驅動,多年來一直在人工智慧領域佔據主導地位。然而,這個機制有一個基本的限制:它的運算需求會隨著序列長度快速增加。Mamba 等狀態空間模型 (State Space Models, SSM) 正成為引人注目的替代方案。透過促進更有選擇性的推理,SSM 可以達到媲美大型 Transformer 的效能,同時運作速度更快,記憶體使用量也大幅減少。
演算法效率的另一個例子是專家混合 (MoE) 模型的出現。MoE 系統不需要為每個輸入動用整個龐大的網路,而是僅將任務導向最相關的小型專門網路子集,或稱為 「專家」。儘管整個模型可能包含數十億個參數,但每次計算只會利用一小部分。將其想像成擁有一個龐大的圖書館,但只檢查幾本必要的書來回答問題,而不是每次都閱讀館內的每一卷書。其結果是,一個巨型模型的知識容量,與一個更小模型的運作效率。
結合這些概念的另一個例子是 DeepSeek-V3,這是一個使用多頭潛在注意力 (MLA) 擴充的專家混合模型。MLA 透過壓縮 key-value 狀態來改進傳統注意力,讓模型能夠有效率地處理長序列 - 類似 SSM - 同時維持 Transformers 的優點。DeepSeek-V3 總共擁有 2360 億個參數,但每個任務只啟動一小部分,因此在編碼和邏輯推理等領域取得領先的效能,同時比同等規模的大型驅動模型更實用、更不佔用資源。
這些並非只是個別案例。它們標誌著更智慧、更有效率的設計正朝著更廣泛的方向邁進。研究人員現在專注於如何在不影響效能的前提下,讓模型更快速、更緊湊、對資料的依賴更少。
為什麼這種轉變很重要
從以規模為優先轉變為強調演算法創新,對人工智慧領域有著深遠的影響。首先,它使 AI 開發民主化。突破不再僅僅取決於能否使用最強大的超級電腦。現在,一個小規模、熟練的研究團隊就能設計出優於用更多預算創造的模型的新穎設計。這使得創新從資源的競爭轉變為想法和專業知識的競爭。因此,大學、新創企業和獨立實驗室可以扮演更重要的角色,挑戰大型科技公司的主導地位。
其次,它使人工智能在現實世界的應用更加實用。在研究論文中,一個擁有 5000 億個參數的模型看起來可能令人印象深刻,但其龐大的規模卻使其部署起來既困難又昂貴。相比之下,Mamba 或 Mixture of Experts 模型等高效替代方案可在標準硬體(包括邊緣裝置)上運作。這種實用性對於將人工智能整合到日常工具(如醫療診斷系統或手機上的即時翻譯功能)至關重要。
第三,它解決了永續性的問題。建立和操作大型 AI 模型所需的能源正成為嚴重的環境問題。透過著重效率,我們可以大幅減少與 AI 開發相關的碳足跡。
下一步是什麼?智慧設計時代
我們正在進入智能設計時代。核心問題正在從「我們可以建立多龐大的模型?」轉變為「我們如何設計一個本質上更智慧、更有效率的模型?
這種演進將激發幾個核心研究領域的創新。預期人工智慧模型架構會有進展。新興模型,包括之前提到的狀態空間模型,可以重新定義神經網路處理資訊的方式。例如,受動力系統啟發的架構已經在實驗環境中展現了更強的能力。另一個關鍵領域是訓練技術,讓模型能以更少的範例進行有效學習。少點學習 (few-shot) 和零點學習 (zero-shot) 的進展讓人工智能更具資料效率,而激活導向 (activation steering) 等方法可在不重新訓練的情況下增強行為能力。訓練後的改進與合成資料的產生也大幅降低了訓練需求,有時甚至可降低 10,000 倍。
我們也會發現人們對混合模型的興趣與日俱增,例如神經代謝式人工智能(neuro-symbolic AI)。結合神經網路的模式識別與符號系統的邏輯嚴謹性,神經符號人工智能在 2025 年正逐漸受到重視,它提供了更好的可解釋性並降低了對資料的依賴性。顯著的例子包括 AlphaGeometry 2 與 AlphaProof,這兩項技術協助 Google DeepMind 在 2025 年國際數學奧林匹克 (IMO) 中獲得金牌。我們的目標是創造出不僅能從統計學上預測下一個字,還能以更像人類的方式理解和推理世界的系統。
底線
縮放時代是不可或缺的,它為人工智能帶來了非凡的進步。它突破了可實現的界限,並創造了我們今天使用的基礎技術。然而,就像任何成熟的技術一樣,最初的策略終究會達到極限。下一個重大突破不會來自於在現有堆疊上增加更多的層次。相反,它們將來自於重新想像堆疊本身。
未來屬於那些開拓新演算法、架構和機器學習核心科學的人。在這個未來,智慧的衡量標準不是參數的數量,而是設計的精密度。對更智慧演算法的追求才剛剛開始。這一轉變為更具包容性、對環境更負責任以及真正智慧的人工智能鋪平了道路。
相關文章
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
相關專題推薦
評論 (1)
0/500

在過去十年的大部分時間裡,人工智慧的進步主要來自於規模的擴大。成功來自於更大的資料集、更多的參數和更強大的運算能力,團隊爭相建立更大型的模型。進步是以萬億個參數和 PB 級的訓練資料來衡量的--這個時代我們現在稱之為擴展時代。儘管這種方法驅動了今日大部分的人工智慧能力,但我們已接近一個臨界點,那就是單純地擴大模型已不再是最有效、最智慧或最永續的發展路徑。因此,焦點正從純粹的規模轉移到演算法的突破。本文將探討為何單單擴大規模已經無法滿足需求,以及下一波的人工智慧進展將如何取決於演算法的創新。
模型擴充的回報遞減定律
擴充時代建立在堅實的經驗基礎上。研究人員持續發現,增加模型和資料集的規模會帶來可預測的效能提升 - 這種模式被稱為擴充定律。這些原則成為領導 AI 實驗室的指導策略,並引發了開發更大型系統的競賽。這場競賽催生了大型語言模型和基礎模型,這些模型驅動了當今許多人工智能應用程式。然而,就像任何指數級趨勢一樣,AI 的擴充曲線現在已經開始漸趨平穩。開發更大型模型的成本正在急劇攀升。現在訓練一個最先進的系統所消耗的能源可能相當於一個小城鎮,這引起了重大的環境問題。財務支出已變得如此龐大,以至於只有少數特定的組織才能參與其中。與此同時,我們也目睹了回報遞減的明顯信號。參數數量增加一倍已不再會帶來相稱的能力提升。改進變得循序漸進,主要是改進現有的知識,而不是實現新的功能。每增加一美元和瓦特的投資所獲得的價值正在下降。擴充方法已接近其實用與經濟的極限。
新領域:算法效率
縮放定律的限制促使研究人員轉向演算法效率。現在的重點不再是單純依賴運算強度,而是設計更有效運用資源的智慧型演算法。最近的發展突顯了這一轉變的前景。舉例來說,Transformer 架構由其注意力機制所驅動,多年來一直在人工智慧領域佔據主導地位。然而,這個機制有一個基本的限制:它的運算需求會隨著序列長度快速增加。Mamba 等狀態空間模型 (State Space Models, SSM) 正成為引人注目的替代方案。透過促進更有選擇性的推理,SSM 可以達到媲美大型 Transformer 的效能,同時運作速度更快,記憶體使用量也大幅減少。
演算法效率的另一個例子是專家混合 (MoE) 模型的出現。MoE 系統不需要為每個輸入動用整個龐大的網路,而是僅將任務導向最相關的小型專門網路子集,或稱為 「專家」。儘管整個模型可能包含數十億個參數,但每次計算只會利用一小部分。將其想像成擁有一個龐大的圖書館,但只檢查幾本必要的書來回答問題,而不是每次都閱讀館內的每一卷書。其結果是,一個巨型模型的知識容量,與一個更小模型的運作效率。
結合這些概念的另一個例子是 DeepSeek-V3,這是一個使用多頭潛在注意力 (MLA) 擴充的專家混合模型。MLA 透過壓縮 key-value 狀態來改進傳統注意力,讓模型能夠有效率地處理長序列 - 類似 SSM - 同時維持 Transformers 的優點。DeepSeek-V3 總共擁有 2360 億個參數,但每個任務只啟動一小部分,因此在編碼和邏輯推理等領域取得領先的效能,同時比同等規模的大型驅動模型更實用、更不佔用資源。
這些並非只是個別案例。它們標誌著更智慧、更有效率的設計正朝著更廣泛的方向邁進。研究人員現在專注於如何在不影響效能的前提下,讓模型更快速、更緊湊、對資料的依賴更少。
為什麼這種轉變很重要
從以規模為優先轉變為強調演算法創新,對人工智慧領域有著深遠的影響。首先,它使 AI 開發民主化。突破不再僅僅取決於能否使用最強大的超級電腦。現在,一個小規模、熟練的研究團隊就能設計出優於用更多預算創造的模型的新穎設計。這使得創新從資源的競爭轉變為想法和專業知識的競爭。因此,大學、新創企業和獨立實驗室可以扮演更重要的角色,挑戰大型科技公司的主導地位。
其次,它使人工智能在現實世界的應用更加實用。在研究論文中,一個擁有 5000 億個參數的模型看起來可能令人印象深刻,但其龐大的規模卻使其部署起來既困難又昂貴。相比之下,Mamba 或 Mixture of Experts 模型等高效替代方案可在標準硬體(包括邊緣裝置)上運作。這種實用性對於將人工智能整合到日常工具(如醫療診斷系統或手機上的即時翻譯功能)至關重要。
第三,它解決了永續性的問題。建立和操作大型 AI 模型所需的能源正成為嚴重的環境問題。透過著重效率,我們可以大幅減少與 AI 開發相關的碳足跡。
下一步是什麼?智慧設計時代
我們正在進入智能設計時代。核心問題正在從「我們可以建立多龐大的模型?」轉變為「我們如何設計一個本質上更智慧、更有效率的模型?
這種演進將激發幾個核心研究領域的創新。預期人工智慧模型架構會有進展。新興模型,包括之前提到的狀態空間模型,可以重新定義神經網路處理資訊的方式。例如,受動力系統啟發的架構已經在實驗環境中展現了更強的能力。另一個關鍵領域是訓練技術,讓模型能以更少的範例進行有效學習。少點學習 (few-shot) 和零點學習 (zero-shot) 的進展讓人工智能更具資料效率,而激活導向 (activation steering) 等方法可在不重新訓練的情況下增強行為能力。訓練後的改進與合成資料的產生也大幅降低了訓練需求,有時甚至可降低 10,000 倍。
我們也會發現人們對混合模型的興趣與日俱增,例如神經代謝式人工智能(neuro-symbolic AI)。結合神經網路的模式識別與符號系統的邏輯嚴謹性,神經符號人工智能在 2025 年正逐漸受到重視,它提供了更好的可解釋性並降低了對資料的依賴性。顯著的例子包括 AlphaGeometry 2 與 AlphaProof,這兩項技術協助 Google DeepMind 在 2025 年國際數學奧林匹克 (IMO) 中獲得金牌。我們的目標是創造出不僅能從統計學上預測下一個字,還能以更像人類的方式理解和推理世界的系統。
底線
縮放時代是不可或缺的,它為人工智能帶來了非凡的進步。它突破了可實現的界限,並創造了我們今天使用的基礎技術。然而,就像任何成熟的技術一樣,最初的策略終究會達到極限。下一個重大突破不會來自於在現有堆疊上增加更多的層次。相反,它們將來自於重新想像堆疊本身。
未來屬於那些開拓新演算法、架構和機器學習核心科學的人。在這個未來,智慧的衡量標準不是參數的數量,而是設計的精密度。對更智慧演算法的追求才剛剛開始。這一轉變為更具包容性、對環境更負責任以及真正智慧的人工智能鋪平了道路。
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強





首頁






