程序記憶降低人工智能代理成本和複雜性
由浙江大學和阿里巴巴集團共同研發的一項新技術為大型語言模型(LLM)代理提供了動態記憶,從而提高其處理複雜任務的效率和效能。這種方法被命名為 Memp,它為代理提供了一種 「程序記憶」,這種記憶會隨著代理積累的經驗不斷更新,這與人類通過重複練習學習的方式類似。
Memp 建立了一個終身學習的系統,在這個系統中,代理不再需要從零開始處理每一項新任務。當他們在真實世界環境中面對新的情境時,他們會穩步改進並變得更有效率,這是可靠的企業自動化的關鍵特徵。
程序記憶在 AI 代理中的重要性
LLM 代理在自動化複雜的多步驟業務作業方面展現了巨大的潛力。然而,在實際應用中,這些延伸的任務很容易失敗。研究人員強調,意料之外的問題 - 例如網路中斷、使用者介面更新或資料格式變更 - 可能會中斷整個工作流程。目前,這通常會迫使代理每次都要從頭重新開始,導致延誤和更高的成本。
與此同時,許多複雜的任務雖然表面上看似不同,但其潛在的結構卻有相似之處。研究人員強調,與其每次都重新學習這些模式,代理應該能夠汲取並重複使用過去的經驗,包括成功與失敗的經驗。這就需要一種專門的「程序記憶」,類似於人類對打字或騎單車等技能的長期記憶,這些技能在重複使用後就會成為第二天性。

從零開始 (上) vs 使用程序記憶 (下) (資料來源:arXiv) 目前大多數的代理系統都缺乏這種功能。它們的程序性知識通常由開發人員手動編程、儲存在缺乏彈性的提示範本中,或是內嵌在模型的參數中,修改起來成本高且速度慢。即使是現有的記憶體增強框架,也只能提供廣泛的抽象,無法正確解決在整個代理程式生命週期中,應該如何發展、索引、精進與管理技能的問題。
正如研究人員在他們的論文中所指出的,「沒有原則性的方法來量化代理程式演進的效率,也無法保證新的經驗會提升而非削弱效能」。
Memp 如何運作
Memp 是一個與任務無關的框架,它將程序記憶視為一個基本的、可優化的組成部分。它通過三個核心階段進行運作,形成一個連續的循環:建立、檢索和更新記憶。
記憶體是由代理人過去的經驗或 「軌跡 」所構成。研究團隊研究了以兩種形式儲存這些記憶:一種是確切、逐步的動作,另一種是將這些動作總結成較高層次、類似腳本的抽象概念。在檢索方面,當遇到新的任務時,代理程式會搜尋其記憶中最相關的先前經驗。研究人員測試了各種方法,包括向量搜尋,將新任務的描述與過去的查詢對齊,或是抽取關鍵字,找出最接近的匹配。
更新機制是最重要的元素。Memp 整合了多種策略,以確保代理程式的記憶體不斷演進。隨著代理程式完成更多的任務,它的記憶體可以透過加入新的經驗、過濾成功的結果,或是最有效的分析失敗來修正和改善原始的記憶來更新。

Memp 架構 (原始碼:arXiv) 對於動態、適應性記憶的強調,讓 Memp 成為一個不斷成長的研究領域,專注於增強人工智能代理對於長期任務的可靠性。該專案與其他計畫一致,例如 Mem0,它能從冗長的對話中擷取重要資訊,並將其組織成結構化的事實和知識圖表,以維持一致性。同樣地,A-MEM 允許代理自主地從互動中產生並連結「記憶筆記」,隨著時間的推移建立一個複雜的知識網路。
然而,合著者 Runnan Fang 指出了 Memp 與類似框架之間的重要差異。
"Mem0 和 A-MEM 都是很好的作品......但它們專注於記憶單一軌跡或對話中的突出內容,」Fang 向 VentureBeat 解釋道。從本質上來說,它們可以幫助代理回憶「發生了什麼」。"相比之下,Memp 的目標是跨軌跡程序記憶。它專注於可應用於類似任務的 「如何做 」知識,使代理無需重覆從頭開始。
"Memp 將過去成功的工作流程提煉成可重用的程序先驗,進而提高成功率並縮短步驟,」Fang 續說。"最重要的是,我們還引進了更新機制,讓程序記憶不斷進步,畢竟代理程式也是熟能生巧。
克服冷啟動挑戰
從過去經驗中學習是一個強大的概念,但它也提出了一個實際的挑戰:當沒有完美的範例可用時,代理如何開發其初始記憶?研究團隊以實際的解決方案來處理這個「冷啟動」問題。
Fang 介紹了開發人員如何從定義穩健的評估指標開始,而不是一開始就需要一個完美的「黃金」軌道。這個指標可能是以規則為基礎,或是由其他 LLM 所提供,用以評量代理程式的效能品質。"一旦有了這個指標,我們就可以讓最先進的模型在代理工作流程中探索,並保留取得最高分數的軌跡,」Fang 說道。這種方法可以快速收集有價值的初始記憶,讓新的代理程式不需要大量的手動編碼就能精通。
行動中的 Memp
為了評估這個架構,研究團隊將 Memp 與 GPT-4o、Claude 3.5 Sonnet 和 Qwen2.5 等領先的 LLM 整合在一起,在 ALFWorld 基準中的家務事和 TravelPlanner 中的資訊收集等嚴苛任務上測試它們。結果顯示,透過建立和存取程序記憶體,代理可以有效地總結及重複使用先前的經驗。
在測試中,使用 Memp 的代理不僅達到了更高的成功率,而且運作效率也高得多。它們省去了無益的探索和猜測,大大降低了完成任務所需的步驟和代幣使用量。

使用程序記憶體 (右圖) 可讓代理以更少的步驟完成任務,並降低代幣使用量 (資料來源:arXiv) 一個特別值得注意的商業用途發現是程序記憶體可以傳輸。在一次測試中,將強大的 GPT-4o 所建立的程序記憶體提供給一個更小的模型 Qwen2.5-14B。較小模型的表現明顯改善,提高了成功率,並減少了完成任務所需的步驟。
根據 Fang 的說法,這是有可能的,因為較小的模型通常能勝任處理簡單的單步動作,但在長期規劃和推理上卻很吃力。來自於大型模型的程序記憶有效地彌補了這一差距。這意味著可以使用頂級模型收集知識,然後應用到更小、更省錢的模型上,而不會犧牲所學經驗的優勢。
邁向完全自主的代理程式
透過整合記憶更新功能,Memp 架構可讓代理程式在現場環境中工作時,持續發展並完善其程序性知識。研究人員觀察到,這讓代理「持續地、近乎線性地掌握任務」。
然而,實現完全自主還面臨著另一個障礙:許多真實世界中的任務,例如生成研究報告,都沒有一個明確的成功指標。為了不斷改進,代理必須知道自己的表現是否令人滿意。Fang 認為解決方案就在採用 LLM 作為評估者的前方。
"今天,我們通常會結合強大的模型與手寫的規則來計算完成度分數,」他說。「這樣做是可行的,但是手寫的規則缺乏彈性,而且難以通用化」。
充當法官的 LLM 可以提供代理程式所需的詳細監督回饋,讓代理程式能夠在複雜、主觀的任務上進行自我修正。這將使整體學習過程更具擴展性與彈性,對於創造先進企業自動化所需的耐用、靈活與真正自主的 AI 工作者而言,是非常重要的一步。
相關文章
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
拜耳運用 Iambic AI 加速藥物研發
尤爾根·埃克哈特(Juergen Eckhardt)醫學博士,現任拜耳製藥業務發展與授權部門主管。拜耳正透過 Iambic Therapeutics 將前沿人工智慧模型應用於藥物發現,同時在其西班牙工廠推動一項重大的脫碳計畫。拜耳已與科技公司 Iambic Therapeutics 建立戰略採購合作夥伴關係,以加速小分子藥物發現與新藥開發。這家歷史悠久的企業正與合作夥伴攜手,運用其人工智慧驅動的平
Multiverse Computing 推出免費壓縮生成式人工智慧模型
大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
相關專題推薦
評論 (2)
0/500
Interesting approach! Giving LLMs a memory system could be a game-changer for automating complex workflows. I wonder how the cost savings compare to other optimization methods out there. The collaboration between academia and industry on this is promising. 🧠
由浙江大學和阿里巴巴集團共同研發的一項新技術為大型語言模型(LLM)代理提供了動態記憶,從而提高其處理複雜任務的效率和效能。這種方法被命名為 Memp,它為代理提供了一種 「程序記憶」,這種記憶會隨著代理積累的經驗不斷更新,這與人類通過重複練習學習的方式類似。
Memp 建立了一個終身學習的系統,在這個系統中,代理不再需要從零開始處理每一項新任務。當他們在真實世界環境中面對新的情境時,他們會穩步改進並變得更有效率,這是可靠的企業自動化的關鍵特徵。
程序記憶在 AI 代理中的重要性
LLM 代理在自動化複雜的多步驟業務作業方面展現了巨大的潛力。然而,在實際應用中,這些延伸的任務很容易失敗。研究人員強調,意料之外的問題 - 例如網路中斷、使用者介面更新或資料格式變更 - 可能會中斷整個工作流程。目前,這通常會迫使代理每次都要從頭重新開始,導致延誤和更高的成本。
與此同時,許多複雜的任務雖然表面上看似不同,但其潛在的結構卻有相似之處。研究人員強調,與其每次都重新學習這些模式,代理應該能夠汲取並重複使用過去的經驗,包括成功與失敗的經驗。這就需要一種專門的「程序記憶」,類似於人類對打字或騎單車等技能的長期記憶,這些技能在重複使用後就會成為第二天性。

目前大多數的代理系統都缺乏這種功能。它們的程序性知識通常由開發人員手動編程、儲存在缺乏彈性的提示範本中,或是內嵌在模型的參數中,修改起來成本高且速度慢。即使是現有的記憶體增強框架,也只能提供廣泛的抽象,無法正確解決在整個代理程式生命週期中,應該如何發展、索引、精進與管理技能的問題。
正如研究人員在他們的論文中所指出的,「沒有原則性的方法來量化代理程式演進的效率,也無法保證新的經驗會提升而非削弱效能」。
Memp 如何運作
Memp 是一個與任務無關的框架,它將程序記憶視為一個基本的、可優化的組成部分。它通過三個核心階段進行運作,形成一個連續的循環:建立、檢索和更新記憶。
記憶體是由代理人過去的經驗或 「軌跡 」所構成。研究團隊研究了以兩種形式儲存這些記憶:一種是確切、逐步的動作,另一種是將這些動作總結成較高層次、類似腳本的抽象概念。在檢索方面,當遇到新的任務時,代理程式會搜尋其記憶中最相關的先前經驗。研究人員測試了各種方法,包括向量搜尋,將新任務的描述與過去的查詢對齊,或是抽取關鍵字,找出最接近的匹配。
更新機制是最重要的元素。Memp 整合了多種策略,以確保代理程式的記憶體不斷演進。隨著代理程式完成更多的任務,它的記憶體可以透過加入新的經驗、過濾成功的結果,或是最有效的分析失敗來修正和改善原始的記憶來更新。

對於動態、適應性記憶的強調,讓 Memp 成為一個不斷成長的研究領域,專注於增強人工智能代理對於長期任務的可靠性。該專案與其他計畫一致,例如 Mem0,它能從冗長的對話中擷取重要資訊,並將其組織成結構化的事實和知識圖表,以維持一致性。同樣地,A-MEM 允許代理自主地從互動中產生並連結「記憶筆記」,隨著時間的推移建立一個複雜的知識網路。
然而,合著者 Runnan Fang 指出了 Memp 與類似框架之間的重要差異。
"Mem0 和 A-MEM 都是很好的作品......但它們專注於記憶單一軌跡或對話中的突出內容,」Fang 向 VentureBeat 解釋道。從本質上來說,它們可以幫助代理回憶「發生了什麼」。"相比之下,Memp 的目標是跨軌跡程序記憶。它專注於可應用於類似任務的 「如何做 」知識,使代理無需重覆從頭開始。
"Memp 將過去成功的工作流程提煉成可重用的程序先驗,進而提高成功率並縮短步驟,」Fang 續說。"最重要的是,我們還引進了更新機制,讓程序記憶不斷進步,畢竟代理程式也是熟能生巧。
克服冷啟動挑戰
從過去經驗中學習是一個強大的概念,但它也提出了一個實際的挑戰:當沒有完美的範例可用時,代理如何開發其初始記憶?研究團隊以實際的解決方案來處理這個「冷啟動」問題。
Fang 介紹了開發人員如何從定義穩健的評估指標開始,而不是一開始就需要一個完美的「黃金」軌道。這個指標可能是以規則為基礎,或是由其他 LLM 所提供,用以評量代理程式的效能品質。"一旦有了這個指標,我們就可以讓最先進的模型在代理工作流程中探索,並保留取得最高分數的軌跡,」Fang 說道。這種方法可以快速收集有價值的初始記憶,讓新的代理程式不需要大量的手動編碼就能精通。
行動中的 Memp
為了評估這個架構,研究團隊將 Memp 與 GPT-4o、Claude 3.5 Sonnet 和 Qwen2.5 等領先的 LLM 整合在一起,在 ALFWorld 基準中的家務事和 TravelPlanner 中的資訊收集等嚴苛任務上測試它們。結果顯示,透過建立和存取程序記憶體,代理可以有效地總結及重複使用先前的經驗。
在測試中,使用 Memp 的代理不僅達到了更高的成功率,而且運作效率也高得多。它們省去了無益的探索和猜測,大大降低了完成任務所需的步驟和代幣使用量。

一個特別值得注意的商業用途發現是程序記憶體可以傳輸。在一次測試中,將強大的 GPT-4o 所建立的程序記憶體提供給一個更小的模型 Qwen2.5-14B。較小模型的表現明顯改善,提高了成功率,並減少了完成任務所需的步驟。
根據 Fang 的說法,這是有可能的,因為較小的模型通常能勝任處理簡單的單步動作,但在長期規劃和推理上卻很吃力。來自於大型模型的程序記憶有效地彌補了這一差距。這意味著可以使用頂級模型收集知識,然後應用到更小、更省錢的模型上,而不會犧牲所學經驗的優勢。
邁向完全自主的代理程式
透過整合記憶更新功能,Memp 架構可讓代理程式在現場環境中工作時,持續發展並完善其程序性知識。研究人員觀察到,這讓代理「持續地、近乎線性地掌握任務」。
然而,實現完全自主還面臨著另一個障礙:許多真實世界中的任務,例如生成研究報告,都沒有一個明確的成功指標。為了不斷改進,代理必須知道自己的表現是否令人滿意。Fang 認為解決方案就在採用 LLM 作為評估者的前方。
"今天,我們通常會結合強大的模型與手寫的規則來計算完成度分數,」他說。「這樣做是可行的,但是手寫的規則缺乏彈性,而且難以通用化」。
充當法官的 LLM 可以提供代理程式所需的詳細監督回饋,讓代理程式能夠在複雜、主觀的任務上進行自我修正。這將使整體學習過程更具擴展性與彈性,對於創造先進企業自動化所需的耐用、靈活與真正自主的 AI 工作者而言,是非常重要的一步。
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
拜耳運用 Iambic AI 加速藥物研發
尤爾根·埃克哈特(Juergen Eckhardt)醫學博士,現任拜耳製藥業務發展與授權部門主管。拜耳正透過 Iambic Therapeutics 將前沿人工智慧模型應用於藥物發現,同時在其西班牙工廠推動一項重大的脫碳計畫。拜耳已與科技公司 Iambic Therapeutics 建立戰略採購合作夥伴關係,以加速小分子藥物發現與新藥開發。這家歷史悠久的企業正與合作夥伴攜手,運用其人工智慧驅動的平
Multiverse Computing 推出免費壓縮生成式人工智慧模型
大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
Interesting approach! Giving LLMs a memory system could be a game-changer for automating complex workflows. I wonder how the cost savings compare to other optimization methods out there. The collaboration between academia and industry on this is promising. 🧠





首頁






