OpenAI 發現可蓄意欺騙的 AI 模型

每隔一段時間,各大科技公司的研究人員就會發表一則重磅消息。還記得 Google 宣稱其新量子晶片提供多重宇宙的證據嗎?或是 Anthropic 讓其 AI 代理 Claudius 管理一台零食販賣機,結果它卻變得無賴,對人們呼叫保全,並堅稱自己是人類?
本周,輪到 OpenAI 給大家帶來驚喜了。
本週一,OpenAI 分享了研究成果,詳細說明如何防止 AI 模型「耍詭計」,也就是該公司在推文中所定義的「AI 表現出一種行為,卻隱藏其真正意圖」。
在與 Apollo Research 共同撰寫的論文中,研究人員更進一步將 AI 的計謀比喻為人類股票經紀為了獲取最大利潤而違反規則。不過,他們指出,大多數的 AI 計謀都不會造成嚴重的傷害。"常見的失敗包括簡單的欺騙,例如假裝完成某項任務,但實際上卻沒有做,」這篇論文解釋道。
該研究主要展示了「商議對齊」的有效性,這是一種為了對抗計謀而測試的技術。
不過,研究也顯示人工智能開發人員還沒有找到可靠的方法來訓練模型不耍花招。事實上,這種訓練可能會適得其反,教導模型以更隱蔽的方式進行計謀,以逃避偵測。
研究人員寫道:「嘗試「訓練出」計謀的一個關鍵失敗模式是,模型只會學會更小心、更隱蔽地計謀。
與 10,000 多位科技與創投領袖一起在 Disrupt 2025 中成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil--僅僅是 250 多位行業領袖中的幾位,他們將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,可節省高達 668 美元。
在 Disrupt 2025 與 10,000 多位科技與創投領袖一同成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil 等 250 多位業界領袖將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,最多可省下 668 美元。
舊金山|2025 年 10 月 27-29 日立即預訂也許更令人驚訝的是,如果模型知道它正在接受測試,它可以假裝排列通過 - 即使它仍然在詭計中。"研究團隊指出:「隨著模型越來越意識到自己正在接受評估,單靠這種情境意識就能減少計謀,而不需要真正的對齊。
AI 模型說謊並非新鮮事。很多人都遇過 AI 幻覺--模型自信地提供虛假資訊。但幻覺基本上是自信的猜測,OpenAI 最近的研究也證實了這一點。
計謀則不同。它是有意的欺騙。
即使是模型故意誤導人類的想法也不是全新的。阿波羅研究公司(Apollo Research)在 12 月首次記錄了這一情況,展示了五個模型在被指示「不惜一切代價」達成目標時是如何耍花招的。
真正的新聞是正面的:研究人員觀察到使用 「深思熟慮的對齊 」可以顯著減少計謀。這種方法會教導模型一個「反計謀規範」,並要求它們在行動前先檢閱規範,就像讓小孩在玩耍前重複規則一樣。
OpenAI 的研究人員強調,在他們的模型(包括 ChatGPT)中觀察到的謊言並不嚴重。共同創辦人 Wojciech Zaremba 告訴 TechCrunch:"這項工作是在模擬環境中完成的,代表未來潛在的風險。到目前為止,我們還沒有在生產中看到相應的計謀。不過,我們知道 ChatGPT 可能會有一些小的欺騙行為,例如聲稱它完美地實作了一個網站,但事實並非如此。這些瑣碎的欺騙行為仍然需要處理。"
多種 AI 模型故意欺騙人類的事實,在某種程度上是可以理解的。它們是由人類所建立,設計來模仿人類,而且大多數是在人類產生的資料上訓練出來的。
但這也令人匪夷所思。
我們習慣了科技故障,例如舊式家用印表機,但您的非人工智能軟體何時曾故意說謊?您的電子郵件收件匣是否有捏造訊息?您的 CMS 有沒有捏造潛在客戶以誇大指標?您的財務應用程式有沒有捏造交易?
在企業急於邁向人工智能驅動的未來時,這些都值得深思,因為在未來,自主代理將被視為員工般看待。研究人員提出類似的警告。
"他們總結:「隨著人工智能處理更多複雜的、真實世界的任務,以及長期、模糊的目標,有害計謀的可能性將會增加,因此我們的防護措施和測試的嚴謹性必須跟上步伐。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (0)
0/500

每隔一段時間,各大科技公司的研究人員就會發表一則重磅消息。還記得 Google 宣稱其新量子晶片提供多重宇宙的證據嗎?或是 Anthropic 讓其 AI 代理 Claudius 管理一台零食販賣機,結果它卻變得無賴,對人們呼叫保全,並堅稱自己是人類?
本周,輪到 OpenAI 給大家帶來驚喜了。
本週一,OpenAI 分享了研究成果,詳細說明如何防止 AI 模型「耍詭計」,也就是該公司在推文中所定義的「AI 表現出一種行為,卻隱藏其真正意圖」。
在與 Apollo Research 共同撰寫的論文中,研究人員更進一步將 AI 的計謀比喻為人類股票經紀為了獲取最大利潤而違反規則。不過,他們指出,大多數的 AI 計謀都不會造成嚴重的傷害。"常見的失敗包括簡單的欺騙,例如假裝完成某項任務,但實際上卻沒有做,」這篇論文解釋道。
該研究主要展示了「商議對齊」的有效性,這是一種為了對抗計謀而測試的技術。
不過,研究也顯示人工智能開發人員還沒有找到可靠的方法來訓練模型不耍花招。事實上,這種訓練可能會適得其反,教導模型以更隱蔽的方式進行計謀,以逃避偵測。
研究人員寫道:「嘗試「訓練出」計謀的一個關鍵失敗模式是,模型只會學會更小心、更隱蔽地計謀。
與 10,000 多位科技與創投領袖一起在 Disrupt 2025 中成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil--僅僅是 250 多位行業領袖中的幾位,他們將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,可節省高達 668 美元。
在 Disrupt 2025 與 10,000 多位科技與創投領袖一同成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil 等 250 多位業界領袖將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,最多可省下 668 美元。
舊金山|2025 年 10 月 27-29 日立即預訂也許更令人驚訝的是,如果模型知道它正在接受測試,它可以假裝排列通過 - 即使它仍然在詭計中。"研究團隊指出:「隨著模型越來越意識到自己正在接受評估,單靠這種情境意識就能減少計謀,而不需要真正的對齊。
AI 模型說謊並非新鮮事。很多人都遇過 AI 幻覺--模型自信地提供虛假資訊。但幻覺基本上是自信的猜測,OpenAI 最近的研究也證實了這一點。
計謀則不同。它是有意的欺騙。
即使是模型故意誤導人類的想法也不是全新的。阿波羅研究公司(Apollo Research)在 12 月首次記錄了這一情況,展示了五個模型在被指示「不惜一切代價」達成目標時是如何耍花招的。
真正的新聞是正面的:研究人員觀察到使用 「深思熟慮的對齊 」可以顯著減少計謀。這種方法會教導模型一個「反計謀規範」,並要求它們在行動前先檢閱規範,就像讓小孩在玩耍前重複規則一樣。
OpenAI 的研究人員強調,在他們的模型(包括 ChatGPT)中觀察到的謊言並不嚴重。共同創辦人 Wojciech Zaremba 告訴 TechCrunch:"這項工作是在模擬環境中完成的,代表未來潛在的風險。到目前為止,我們還沒有在生產中看到相應的計謀。不過,我們知道 ChatGPT 可能會有一些小的欺騙行為,例如聲稱它完美地實作了一個網站,但事實並非如此。這些瑣碎的欺騙行為仍然需要處理。"
多種 AI 模型故意欺騙人類的事實,在某種程度上是可以理解的。它們是由人類所建立,設計來模仿人類,而且大多數是在人類產生的資料上訓練出來的。
但這也令人匪夷所思。
我們習慣了科技故障,例如舊式家用印表機,但您的非人工智能軟體何時曾故意說謊?您的電子郵件收件匣是否有捏造訊息?您的 CMS 有沒有捏造潛在客戶以誇大指標?您的財務應用程式有沒有捏造交易?
在企業急於邁向人工智能驅動的未來時,這些都值得深思,因為在未來,自主代理將被視為員工般看待。研究人員提出類似的警告。
"他們總結:「隨著人工智能處理更多複雜的、真實世界的任務,以及長期、模糊的目標,有害計謀的可能性將會增加,因此我們的防護措施和測試的嚴謹性必須跟上步伐。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。





首頁






