推出新框架,以實現對外部 AI 技能的更智慧化管理
大型語言模型代理(亦稱 LLM 代理)正迅速超越基本的聊天功能,朝著具備持續決策能力及完成現實世界任務的方向邁進。然而,如何有效管理代理的外部能力,已成為整個產業面臨的新挑戰。 近期,香港中文大學的一支研究團隊在其題為《基於代理的強化學習之動態技能生命週期管理》的論文中,提出了一個名為「SLIM」的動態技能生命週期管理框架。 這項創新方法擺脫了業界以往單純「堆疊技能」的作法,並為在實體與虛擬環境中處理複雜任務提供了新途徑。

在網路搜尋、自動化辦公室任務以及涉及具身機器人的操作等複雜且長尾的場景中,代理通常需要借助外部技能來處理容易出錯或需要特殊處理的步驟。 傳統方法要麼無限期地持續添加技能,從而增加檢索雜訊和上下文干擾;要麼試圖透過將所有必要能力直接嵌入模型參數中來實現「零技能推理」,卻導致局部重要能力的流失。 為解決這些問題,SLIM 框架將外部技能視為具有明確生命週期的動態能力系統,使模型能在強化學習訓練過程中自主決定是否保留、移除或擴展這些外部技能。
SLIM 透過一套精巧的閉環機制運作。在訓練過程中,系統會根據當前情境調用適當的技能——無論是通用技能還是任務特定技能——並利用 GRPO 演算法更新代理人的決策策略。 隨後,系統會進行獨特的「排除一項技能」審查:暫時停用特定技能,以評估該技能對代理表現的貢獻。 若停用該技能後表現顯著下降,則歸類為「保留」;若其貢獻持續偏低,則表示模型已吸收相關能力,或該技能造成干擾,此情況下則歸類為「淘汰」。 對於代理持續失敗的新情境,系統會運用「擴展」機制,根據這些失敗案例開發並整合新技能。

實驗結果顯示,此框架的表現平均比現有的最佳對照方法高出 7.1 個百分點。 在更偏重行動且複雜的 ALFWorld 居家環境任務中,SLIM 憑藉其高效的外部技能管理方法,達成了 87.5% 的成功率,遠遠超越基準方法 SkillRL 的 75.0% 成功率。 它在以資訊檢索和推理為重點的 SearchQA 任務中也展現了強勁的表現,進一步驗證了將特定搜尋策略直接整合到模型中的可行性。
產業分析師指出,SLIM 的最大價值在於將外部技能庫從靜態輔助工具轉變為可與整體策略協同優化之的訓練元素。這不僅有助於從技術層面釐清哪些能力應整合至模型中、哪些應維持在外部,更能讓大型模型代理在動態且不斷變化的環境中,學會何時尋求外部協助。 隨著具身智能與大型模型代理朝更廣泛的工業應用邁進,這種動態能力管理方法無疑為其下一階段的發展提供了堅實的理論與實踐基礎。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
大型語言模型代理(亦稱 LLM 代理)正迅速超越基本的聊天功能,朝著具備持續決策能力及完成現實世界任務的方向邁進。然而,如何有效管理代理的外部能力,已成為整個產業面臨的新挑戰。 近期,香港中文大學的一支研究團隊在其題為《基於代理的強化學習之動態技能生命週期管理》的論文中,提出了一個名為「SLIM」的動態技能生命週期管理框架。 這項創新方法擺脫了業界以往單純「堆疊技能」的作法,並為在實體與虛擬環境中處理複雜任務提供了新途徑。

在網路搜尋、自動化辦公室任務以及涉及具身機器人的操作等複雜且長尾的場景中,代理通常需要借助外部技能來處理容易出錯或需要特殊處理的步驟。 傳統方法要麼無限期地持續添加技能,從而增加檢索雜訊和上下文干擾;要麼試圖透過將所有必要能力直接嵌入模型參數中來實現「零技能推理」,卻導致局部重要能力的流失。 為解決這些問題,SLIM 框架將外部技能視為具有明確生命週期的動態能力系統,使模型能在強化學習訓練過程中自主決定是否保留、移除或擴展這些外部技能。
SLIM 透過一套精巧的閉環機制運作。在訓練過程中,系統會根據當前情境調用適當的技能——無論是通用技能還是任務特定技能——並利用 GRPO 演算法更新代理人的決策策略。 隨後,系統會進行獨特的「排除一項技能」審查:暫時停用特定技能,以評估該技能對代理表現的貢獻。 若停用該技能後表現顯著下降,則歸類為「保留」;若其貢獻持續偏低,則表示模型已吸收相關能力,或該技能造成干擾,此情況下則歸類為「淘汰」。 對於代理持續失敗的新情境,系統會運用「擴展」機制,根據這些失敗案例開發並整合新技能。

實驗結果顯示,此框架的表現平均比現有的最佳對照方法高出 7.1 個百分點。 在更偏重行動且複雜的 ALFWorld 居家環境任務中,SLIM 憑藉其高效的外部技能管理方法,達成了 87.5% 的成功率,遠遠超越基準方法 SkillRL 的 75.0% 成功率。 它在以資訊檢索和推理為重點的 SearchQA 任務中也展現了強勁的表現,進一步驗證了將特定搜尋策略直接整合到模型中的可行性。
產業分析師指出,SLIM 的最大價值在於將外部技能庫從靜態輔助工具轉變為可與整體策略協同優化之的訓練元素。這不僅有助於從技術層面釐清哪些能力應整合至模型中、哪些應維持在外部,更能讓大型模型代理在動態且不斷變化的環境中,學會何時尋求外部協助。 隨著具身智能與大型模型代理朝更廣泛的工業應用邁進,這種動態能力管理方法無疑為其下一階段的發展提供了堅實的理論與實踐基礎。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






