選項
首頁
新聞
Google 的 GEPA 可提升 LLM 效能,繞過昂貴的強化學習需求

Google 的 GEPA 可提升 LLM 效能,繞過昂貴的強化學習需求

2025-12-27
153

來自加州大學柏克萊分校、史丹福大學和 Databricks 的研究人員推出了一種名為 GEPA 的新人工智慧最佳化方法,與傳統的強化學習技術相比,GEPA 在調整大型語言模型以適應專門任務方面有顯著的改進。

GEPA 不採用傳統的學習方法,而是透過簡單的數字分數驅動數以千計的試誤嘗試。相反,它使用 LLM 的內部語言能力來分析其表現、識別錯誤並逐步改進其指令。除了達到比既有方法更高的精確度之外,GEPA 的效率也高得多,只需減少 35 倍的試運行就能達到優異的結果。

對於開發複雜 AI 代理和工作流程的公司而言,這項突破意味著更快的開發速度、大幅降低的運算成本,以及更強大、更可靠的應用程式。

優化現代人工智能系統的高成本

現代企業級 AI 應用程式很少依賴單次呼叫 LLM。它們通常是「複合 AI 系統」- 結合多個 LLM 模組、外部工具 (例如資料庫或程式碼解譯器) 以及自訂邏輯的精密工作流程,以執行複雜的任務,例如多步驟研究與資料分析。

這些系統常見的最佳化策略是強化學習,例如在進階推理模型中使用的群組相對政策最佳化 (Group Relative Policy Optimization) 等技術。這些方法將 AI 系統視為黑箱,透過基本的成功指標來評估任務。然後,這個有限的回饋會被用來逐漸調整模型的參數,以達到更好的效能。

RL 的主要限制是其低效率。要從最小的數值分數中有效地學習,RL 通常需要數萬甚至數十萬次的試運行。對於任何涉及高成本工具呼叫或專屬模型的真實世界企業應用程式而言,此過程過於緩慢且昂貴。

正如作者之一、加州大學柏克萊分校博士生 Lakshya A Agrawal 所解釋的,這種複雜性對許多組織而言都是一大障礙。"Agrawal 指出:「對於許多團隊來說,RL 因其費用和複雜性而不切實際,他們的預設方法主要是手動提示工程。GEPA 專為使用高效能模型的團隊所設計,這些模型通常無法微調,讓他們可以在不管理專門硬體的情況下提升效能。

研究團隊以這種方式提出挑戰:"我們如何才能從每個成本高昂的試驗中提取最大的學習信號,以便在緊湊的數據或預算限制下有效地適應複雜的模組化人工智能系統?

透過語言學習的優化器

GEPA 架構 資料來源:arXiv

GEPA 以詳細的自然語言回饋取代稀疏的獎勵信號來解決這個挑戰。它充分利用了人工智能系統的整個執行 - 其推理步驟、工具呼叫和錯誤訊息 - 可以表示為文本,供 LLM 處理的事實。這個方法建立在三個核心原則上。

第一個原則是「基因提示進化」,GEPA 將提示集視為基因庫,反覆修改以產生新的、可能改良的版本。這個突變過程由第二個原則引導:「以自然語言反饋作反省」。在多次試運行之後,GEPA 向 LLM 呈現完整的執行歷史和結果。LLM 然後分析這些資訊來診斷問題,並起草更精確、更強化的提示。例如,它可能會檢查編譯器錯誤,並決定提示必須指定特定的函式庫版本,而不只是收到代碼生成的低分。

第三個原則是「以帕累托為基礎的選擇」,促進智慧型探索。GEPA 不會只專注於單一得分最高的提示,因為這樣做有可能會得到次優解決方案。它可以識別出哪些提示在不同的測試案例中表現優異,從而編制出一份領先的候選名單。透過從各種成功的策略中抽樣,GEPA 可以探索更廣闊的解決方案空間,並且更有可能發現在各種輸入中表現優異的提示。

專注於單一頂尖候選人可能會讓模型陷於局部最小值,而帕累托選擇則會探索更多的選項以找到最佳解決方案 資料來源:arXiv

整個過程的成功取決於研究人員所謂的「反饋工程」。Agrawal 強調,關鍵在於捕捉系統已經產生但經常忽略的豐富文字細節。"傳統的管道通常會將這些資訊濃縮為單一的數字獎勵,隱藏了特定結果背後的原因,」他解釋道。"GEPA 的核心方法是結構化回饋,不僅揭示最終結果,還揭示中間步驟和純文本中的錯誤 - 與人類專家分析系統行為所使用的證據相同。

例如,對於文件擷取系統而言,這將包括列出哪些文件被正確擷取,哪些被遺漏,而非僅報告最終的準確度分數。

實踐中的 GEPA

研究團隊在四個不同的任務中評估了 GEPA,從多跳問題回答到隱私保護查詢。他們測試了開放源碼和專有模型,並將 GEPA 與基於 RL 的 GRPO 和先進的提示最佳化器 MIPROv2 進行了比較。

在所有的評估中,GEPA 的表現明顯優於 GRPO,最多可提升 19% 的分數,同時使用的試運行次數減少了 35 倍。Agrawal 用一個具體的例子說明了這種效率:"他說:「我們使用 GEPA 優化一個答題系統只花了約 3 小時,而 GRPO 則花了 24 小時,開發時間縮短了 8 倍,同時性能提升了 20%。「針對相同的測試情境,基於 RL 的最佳化花費了約 300 美元的 GPU 計算費用,而 GEPA 只花費不到 20 美元就獲得了更好的結果--在我們的實驗中,成本降低了 15 倍」。

GEPA 在關鍵性能指標上優於其他基準方法 資料來源:arXiv

除了原始指標之外,研究人員觀察到 GEPA 優化過的系統在處理新的、未見過的資料時更可靠,「泛化差距」更小就表示了這一點。Agrawal 認為,這種穩健性的提升源自於 GEPA 從更豐富的回饋中學習。「GEPA 較小的泛化差距可能來自於它對每個結果使用詳細的自然語言回饋,說明哪些成功、哪些失敗以及原因,而不是依賴於單一的數字分數,」他說。"他說:「這能鼓勵系統根據對成功的全面理解來制定指令和策略,而不是簡單地記憶訓練資料中的模式。對於企業來說,這種增強的可靠性可以轉化為在面向客戶的場景中更加強大且適應性更強的人工智能應用。

一個關鍵的實際優勢是,GEPA 的最終指令比 MIPROv2 等優化器產生的提示短達 9.2 倍,而 MIPROv2 通常包含大量示例。對於以 API 為基礎的模型而言,較短的提示可減少延遲並降低成本,使最終應用程式在生產中運行的速度更快、更經濟。

論文也探討了 GEPA 作為「推理時間」搜尋策略的前景應用,將人工智能從單步答案產生器轉換為迭代問題解決器。Agrawal 描述了與公司開發管道整合的可能性,在此過程中,GEPA 可以自動建立並精細化系統的多個最佳化版本,測試其效能,並將最佳變體提交工程審查。"Agrawal 補充:「這將優化轉化為一個持續、自動化的過程,快速產生的解決方案往往能達到或超越專家人工調整的品質。在 CUDA 代碼產生的測試中,此方法將 20% 的任務效能提升至專家級,而使用 GPT-4o 等模型的單次嘗試只有 0%。

作者將 GEPA 視為邁向 AI 開發新範式的奠基性一步。然而,除了培育更類似人類的 AI 之外,其最直接的影響可能在於創造高效能系統的民主化。

"Agrawal 總結道:「我們預期 GEPA 將促進 AI 系統建構的正面轉變,讓那些擁有深厚領域專業知識,但可能缺乏時間或意願去掌握複雜 RL 技術的終端使用者,也能進行最佳化。"Agrawal 總結道:「它賦予了擁有精確、特定任務知識的利害關係人權力。

相關文章
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護 蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護 彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧 內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧 報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展 OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展 針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
相關專題推薦
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
評論 (0)
0/500
OR