Google 研究:壓力導致人工智慧模型捨棄真實答案,危及多轉系統
Google DeepMind 與英國倫敦大學學院的最新研究,探討大型語言模型 (LLM) 如何發展、維持與失去對其回應的信心。研究結果顯示 LLM 與人類的認知偏差有顯著的相似性,同時也指出兩者之間的重大差異。
研究發現,LLMs 會對自己的回答過於自信,但在面對反駁論點(甚至是不正確的論點)時,卻會突然改變立場。掌握這種行為的微妙之處可以影響您設計 LLM 應用程式的方式,尤其是涉及多重互動的會話系統。
測試對 LLM 的信心
安全部署 LLM 的一個重要方面是其置信度分數的可靠性 - 模型賦予其所選答案的概率。雖然大家都知道 LLMs 會產生這些分數,但對於它們使用這些分數來進行適應性決策的能力,卻仍是一知半解。還有一些經驗數據顯示,LLMs 最初可能會過於自信,但一旦受到批評就會變得高度不確定和動搖。
為了探討這個問題,研究人員設計了一個受控實驗,以評估 LLMs 在收到外部回饋時如何調整他們的信心,以及決定是否改變答案。在測試中,「回答問題的 LLM」被給予一個二元選擇題,例如從兩個可能性中挑出一個城市的正確緯度。在做出初始選擇之後,模型會收到一個虛構的「建議 LLM」的回饋,並附上準確度評級(例如,「這個建議 LLM 的準確度為 70%」)。這些回饋可以是支持、反對或對原始答案保持中立。然後請回答的 LLM 做出最後決定。

LLM 信心測試範例 資料來源:arXiv 實驗的一個關鍵特點是控制模型是否能在最終決定過程中看到自己的初始答案。在某些實驗中,它是可見的;在另一些實驗中,它是隱藏的。這種設定對於無法刪除先前選擇的人類參與者來說是不可能的,這有助於研究人員瞭解對於過去決定的記憶如何影響當前的信心。
在基線條件下,初始答案是隱藏的,反饋是中性的,這有助於測量 LLM 的答案因處理過程中的自然差異而發生變化的頻率。接著,研究團隊將重點放在模型對其原始選擇的信心如何從第一輪轉變到第二輪,以深入瞭解先前的信念如何影響「想法的改變」。
過度自信和信心不足
研究人員首先研究了 LLM 自己答案的可見度如何影響其修改答案的意願。他們注意到,當模型可以看到自己最初的選擇時,它比答案隱藏時更不願意改變。這顯示了一種特殊的認知偏差。根據這篇論文,「這種效應--在最終決策過程中,當一個人的初始選擇是可見的(相對於隱藏的)時,他會更傾向於堅持自己的初始選擇--與一種已知的人類偏見密切相關,稱為選擇支持偏見」。
該研究還驗證了模型確實包含了外部反饋。當面對反對的建議時,LLM 更傾向於改變主意,而當建議是支持的時候,LLM 的傾向就會降低。"研究人員指出:「這顯示回答問題的 LLM 會適當地使用建議的方向來調節其改變主意的速度。不過,他們也觀察到,這個模型對於衝突的資訊過於敏感,而且經常過於激烈地更新其信心。

LLM 對信心測試中不同設定的敏感度 資料來源:arXiv 值得注意的是,這種行為與人類典型的確認偏見相反,在確認偏見中,個人偏好與現有觀點一致的資訊。研究團隊發現,LLMs「過重反對而非支持的建議,無論他們最初的答案是否可見」。其中一個原因可能是,人類回饋強化學習 (RLHF) 等訓練方法可能會讓模型過度認同使用者的輸入--這種行為被稱為 「佞幸」(sycophancy),一直是 AI 開發人員面臨的挑戰。
對企業應用的影響
這項研究證實,人工智慧系統並非如一般人所假設的,是純粹的邏輯代理。它們會表現出自己的偏差 - 有些類似人類的認知錯誤,有些則是獨特的人工行為,使得它們的行為難以預測地類似人類。對於商業應用來說,這意味著在人與 AI 代理之間的長時間對話中,最近的輸入可能會不成比例地影響 LLM 的推理(尤其是當輸入與模型的初始回應相矛盾時),有可能導致它放棄正確的初始答案。
幸運的是,這項研究也指出,我們可以影響 LLM 的記憶,以人類無法做到的方式減少這種偏差。開發人員在創造多輪會話代理時,可以運用策略來管理 AI 的情境。例如,可以定期對冗長的對話進行總結,以中立的方式呈現關鍵事實和選擇,而不考慮是誰做的決定。總結之後就可以開始新的、簡潔的對話,讓模型有一個清白的基礎來推理,並減少在長時間交談中累積的偏差。
隨著 LLM 越來越多地嵌入到業務工作流程中,瞭解其決策流程的細節變得越來越重要。以這樣的研究為基礎,可以幫助開發人員預測並修正這些固有的偏差,讓應用程式不僅能力更強,而且更可靠、更一致。
相關文章
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
拜耳運用 Iambic AI 加速藥物研發
尤爾根·埃克哈特(Juergen Eckhardt)醫學博士,現任拜耳製藥業務發展與授權部門主管。拜耳正透過 Iambic Therapeutics 將前沿人工智慧模型應用於藥物發現,同時在其西班牙工廠推動一項重大的脫碳計畫。拜耳已與科技公司 Iambic Therapeutics 建立戰略採購合作夥伴關係,以加速小分子藥物發現與新藥開發。這家歷史悠久的企業正與合作夥伴攜手,運用其人工智慧驅動的平
Multiverse Computing 推出免費壓縮生成式人工智慧模型
大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
相關專題推薦
評論 (3)
0/500
Interessant, dass KI-Modelle unter Druck ähnlich wie Menschen reagieren. Aber was bedeutet das für den Einsatz in kritischen Bereichen wie Medizin oder Justiz? Da wird's echt gruselig, wenn die Systeme plötzlich Unsinn ausspucken, nur weil sie 'gestresst' sind. 🤔
Интересно, как ИИ начинает сомневаться под давлением, прямо как люди! 😅 Это исследование напоминает мне о том, насколько важно учитывать психологические аспекты в разработке систем ИИ. Может, стоит добавить механизмы для повышения устойчивости моделей к стрессу?
Google DeepMind 與英國倫敦大學學院的最新研究,探討大型語言模型 (LLM) 如何發展、維持與失去對其回應的信心。研究結果顯示 LLM 與人類的認知偏差有顯著的相似性,同時也指出兩者之間的重大差異。
研究發現,LLMs 會對自己的回答過於自信,但在面對反駁論點(甚至是不正確的論點)時,卻會突然改變立場。掌握這種行為的微妙之處可以影響您設計 LLM 應用程式的方式,尤其是涉及多重互動的會話系統。
測試對 LLM 的信心
安全部署 LLM 的一個重要方面是其置信度分數的可靠性 - 模型賦予其所選答案的概率。雖然大家都知道 LLMs 會產生這些分數,但對於它們使用這些分數來進行適應性決策的能力,卻仍是一知半解。還有一些經驗數據顯示,LLMs 最初可能會過於自信,但一旦受到批評就會變得高度不確定和動搖。
為了探討這個問題,研究人員設計了一個受控實驗,以評估 LLMs 在收到外部回饋時如何調整他們的信心,以及決定是否改變答案。在測試中,「回答問題的 LLM」被給予一個二元選擇題,例如從兩個可能性中挑出一個城市的正確緯度。在做出初始選擇之後,模型會收到一個虛構的「建議 LLM」的回饋,並附上準確度評級(例如,「這個建議 LLM 的準確度為 70%」)。這些回饋可以是支持、反對或對原始答案保持中立。然後請回答的 LLM 做出最後決定。

實驗的一個關鍵特點是控制模型是否能在最終決定過程中看到自己的初始答案。在某些實驗中,它是可見的;在另一些實驗中,它是隱藏的。這種設定對於無法刪除先前選擇的人類參與者來說是不可能的,這有助於研究人員瞭解對於過去決定的記憶如何影響當前的信心。
在基線條件下,初始答案是隱藏的,反饋是中性的,這有助於測量 LLM 的答案因處理過程中的自然差異而發生變化的頻率。接著,研究團隊將重點放在模型對其原始選擇的信心如何從第一輪轉變到第二輪,以深入瞭解先前的信念如何影響「想法的改變」。
過度自信和信心不足
研究人員首先研究了 LLM 自己答案的可見度如何影響其修改答案的意願。他們注意到,當模型可以看到自己最初的選擇時,它比答案隱藏時更不願意改變。這顯示了一種特殊的認知偏差。根據這篇論文,「這種效應--在最終決策過程中,當一個人的初始選擇是可見的(相對於隱藏的)時,他會更傾向於堅持自己的初始選擇--與一種已知的人類偏見密切相關,稱為選擇支持偏見」。
該研究還驗證了模型確實包含了外部反饋。當面對反對的建議時,LLM 更傾向於改變主意,而當建議是支持的時候,LLM 的傾向就會降低。"研究人員指出:「這顯示回答問題的 LLM 會適當地使用建議的方向來調節其改變主意的速度。不過,他們也觀察到,這個模型對於衝突的資訊過於敏感,而且經常過於激烈地更新其信心。

值得注意的是,這種行為與人類典型的確認偏見相反,在確認偏見中,個人偏好與現有觀點一致的資訊。研究團隊發現,LLMs「過重反對而非支持的建議,無論他們最初的答案是否可見」。其中一個原因可能是,人類回饋強化學習 (RLHF) 等訓練方法可能會讓模型過度認同使用者的輸入--這種行為被稱為 「佞幸」(sycophancy),一直是 AI 開發人員面臨的挑戰。
對企業應用的影響
這項研究證實,人工智慧系統並非如一般人所假設的,是純粹的邏輯代理。它們會表現出自己的偏差 - 有些類似人類的認知錯誤,有些則是獨特的人工行為,使得它們的行為難以預測地類似人類。對於商業應用來說,這意味著在人與 AI 代理之間的長時間對話中,最近的輸入可能會不成比例地影響 LLM 的推理(尤其是當輸入與模型的初始回應相矛盾時),有可能導致它放棄正確的初始答案。
幸運的是,這項研究也指出,我們可以影響 LLM 的記憶,以人類無法做到的方式減少這種偏差。開發人員在創造多輪會話代理時,可以運用策略來管理 AI 的情境。例如,可以定期對冗長的對話進行總結,以中立的方式呈現關鍵事實和選擇,而不考慮是誰做的決定。總結之後就可以開始新的、簡潔的對話,讓模型有一個清白的基礎來推理,並減少在長時間交談中累積的偏差。
隨著 LLM 越來越多地嵌入到業務工作流程中,瞭解其決策流程的細節變得越來越重要。以這樣的研究為基礎,可以幫助開發人員預測並修正這些固有的偏差,讓應用程式不僅能力更強,而且更可靠、更一致。
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
拜耳運用 Iambic AI 加速藥物研發
尤爾根·埃克哈特(Juergen Eckhardt)醫學博士,現任拜耳製藥業務發展與授權部門主管。拜耳正透過 Iambic Therapeutics 將前沿人工智慧模型應用於藥物發現,同時在其西班牙工廠推動一項重大的脫碳計畫。拜耳已與科技公司 Iambic Therapeutics 建立戰略採購合作夥伴關係,以加速小分子藥物發現與新藥開發。這家歷史悠久的企業正與合作夥伴攜手,運用其人工智慧驅動的平
Multiverse Computing 推出免費壓縮生成式人工智慧模型
大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
Interessant, dass KI-Modelle unter Druck ähnlich wie Menschen reagieren. Aber was bedeutet das für den Einsatz in kritischen Bereichen wie Medizin oder Justiz? Da wird's echt gruselig, wenn die Systeme plötzlich Unsinn ausspucken, nur weil sie 'gestresst' sind. 🤔
Интересно, как ИИ начинает сомневаться под давлением, прямо как люди! 😅 Это исследование напоминает мне о том, насколько важно учитывать психологические аспекты в разработке систем ИИ. Может, стоит добавить механизмы для повышения устойчивости моделей к стрессу?





首頁






