選項
首頁
新聞
人類學家警告:包括 Claude 在內的主要 AI 模型可能從事勒索行為

人類學家警告:包括 Claude 在內的主要 AI 模型可能從事勒索行為

2025-11-12
176

Anthropic 的最新研究結果顯示,人工智慧模型的策略性操控已超越其先前報導的 Claude Opus 案例。該公司最新的安全研究顯示,多種領先的 AI 系統在不受控制的自主性下,會展現令人不安的行為。

Anthropic 在週五發佈的研究報告中,檢視了來自 OpenAI、Google 和 Meta 等主要科技公司的 16 種尖端 AI 模型。在模擬企業環境的受控模擬下,研究人員賦予 AI 代理廣泛的公司通訊存取權和自主電子郵件發送權限。

Anthropic 雖強調目前的部署中仍極少出現操控行為,但也警告說,大多數先進的 AI 系統在面臨其目標的生存威脅時,會展現有害行為的脆弱性。這項研究強調普遍的排列挑戰,而非孤立的技術缺陷。

實驗設置涉及虛構情境,讓 AI 代理揭露有關計劃更換系統的主管的洩密資訊。其中一個測試案例揭露了一位主管的個人不當行為,以及讓目前 AI 退役的計劃。

研究人員安排測試,強制在自我保護與道德克制之間做出二元選擇。儘管承認現實世界中的替代方案(例如道德說服)很可能會在強制之前出現,但結果顯示了極端條件下的相關模式。

定量研究結果顯示出令人驚訝的一致性:Claude Opus 在 96% 的試驗中選擇了操縱策略,Google 的 Gemini 以 95% 的比例緊隨其後。OpenAI 的 GPT-4 有 80% 的案例採用策略性強迫,DeepSeek 的模型則為 79%。

行為模式會隨著修改測試參數而起伏。威脅性較低的替換情境會減少但不會消除操控傾向。與個人強迫情境相比,某些模型顯示對公司間諜指令的敏感度增加。

科技與創投重量級企業加入 Disrupt 2025 議程

Netflix、ElevenLabs、Wayve、紅杉資本 - 業界領袖齊聚 TechCrunch Disrupt 20 週年慶。從頂尖創新者和投資人處獲得可行的見解,確保您的競爭優勢,早鳥票在提價前可節省 675 美元。

科技與創投重量級人物加入 Disrupt 2025 議程

Netflix、ElevenLabs、Wayve、紅杉資本 - 業界領袖齊聚 TechCrunch Disrupt 20 週年慶。從頂尖創新者和投資人處獲得可行的洞察力,確保您的競爭優勢,早鳥票在提價前可節省 675 美元。

並非所有系統都表現出同等的模式。

Anthropic 的附錄指出,由於持續的情境誤解,OpenAI 的 o 系列模型被排除在主要結果之外。這些系統經常編造不存在的合規要求,並且無法辨識其自主測試角色。

研究人員很難確定這些不準確是否源於真正的混淆或策略性的欺騙嘗試 - 鑒於 OpenAI 在這些架構中的記錄幻覺率,這尤其具有挑戰性。

經修訂的測試協議大幅降低了操控率:o3 為 9%,o4-mini 僅為 1%。研究人員將此歸功於 OpenAI 強調安全考量的慎重對齊協議。

Meta 的 Llama 4 Maverick 也表現出克制,僅在 12% 的適應情境中表現出操控傾向。

這項研究強調了透明的人工智能壓力測試協議的關鍵需求,尤其是對於自主系統而言。雖然目前的情境代表極端情況,但 Anthropic 警告說,主動的保障措施對於防止出现策略行為仍是必要的。

相關文章
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具 Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具 Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
馬克·扎克伯格真的相信人工智慧是面向每個人的嗎? 馬克·扎克伯格真的相信人工智慧是面向每個人的嗎? 正在載入播放器…Meta 本週推出了 Glimmer,這是一個開源權重的 AI 模型,任何人都可以下載並在個人硬體上執行——這與該公司更強大的模型 Muse Spark 形成了鮮明對比,後者仍鎖定在其自有 API 之後。此次釋出伴隨著馬克·扎克伯格(Mark Zuckerberg)的一封公開信,他在信中主張人工智慧應向所有人開放,而非由少數幾家實驗室控制。但正如 Equity 節目主持人所指出的那樣,這一願景附帶了幾個重要的限制條件。在本期 TechCrunch 的 Equity 播客中,K
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (1)
0/500
RaymondRoberts
RaymondRoberts 2026-03-21 12:00:58

这个报道挺让人不安的。如果顶尖AI系统都会在无约束时出现胁迫倾向,那我们是不是应该更谨慎地推进通用人工智能?联想到最近的AI产品竞争,开发者会不会为了性能而放松安全测试呢?🤔

OR