AI 護欄抑制了進攻性網路安全研究人員

數月來,AI領域的領導者們實施了嚴格的審查協議和安全護欄,以防止惡意行為者利用他們的模型。然而,這些限制現在正在阻礙合法的網路安全防禦者和進攻性網路安全研究人員。
今年6月,美國政府禁止出口Anthropic備受期待的AI模型Mythos和Fable。這一決定部分源於有關報告,指出這些模型防止協助網路攻擊的安全措施可能被繞過。
無論該事件是否真正由越獄擔憂引發,Anthropic始終將Mythos定位為一種強大的網路工具,僅向經過嚴格審查的使用者在嚴格限制下開放。(注:Fable 5和Mythos 5的出口管制隨後已解除。Fable 5於7月1日重新面向公眾開放,而Mythos 5已作為政府審查過程的一部分,重新僅向經過審查的美國組織提供。)
這種把關方式並非Mythos獨有。Anthropic和OpenAI都為網路安全研究人員提供了申請經過審查的訪問許可權的專案,如果獲得批准,他們將獲得具有較少網路安全限制的模型:OpenAI的“網路安全可信訪問”和Anthropic的“網路安全驗證計劃”。
這些護欄受到了廣泛批評,特別是那些負責在犯罪分子之前識別未知系統漏洞並開發利用程式的研究人員。
在最近的一次網路安全播客節目中,著名安全研究人員Mark Dowd表示:“讓我感到不舒服的是,這些隨機的大型公司正在就什麼是安全、什麼是不安全做出武斷的決定。”
Dowd花了數十年時間發現並出售“零日漏洞”——即以前未知的軟體缺陷及其利用程式——給西方政府,而不是向軟體供應商報告以進行修補。政府為這些漏洞支付高額費用,因為它們未被公開,這對情報行動有價值。
Dowd承認他的工作可能會引入偏見,但他並不孤單。幾名從事進攻性網路安全的專業人士,他們主動探測系統弱點,向TechCrunch描述了他們如何利用AI工具並應對這些護欄。
NCC Group這家安全諮詢巨頭的首席科學家Chris Anley解釋說,要求AI模型嘗試利用一個漏洞是確認它確實是值得修復的真實漏洞的關鍵步驟。然而,他指出,如果護欄導致模型完全拒絕請求,這會阻礙防禦者。
“這就是整個攻防和護欄部分發揮作用的地方,因為‘修復這段程式碼’作為提示,既是防禦的必要機制,也是查詢程式碼庫中關鍵漏洞的路線圖,”Anley說。“因此,同時,同一個工具既是進攻工具也是防禦工具,這兩者實際上無法分開。”
他繼續說道:“這就像一把錘子。沒有錘子你就無法建造房屋。它肯定是一個工具,但同時也是不可簡化的武器。”
遇到此類障礙時,他和他的同事有時會轉向沒有任何護欄的開源AI模型。
CrowdFense的技術長Paolo Stagno是一家知名公司,該公司開發、收購併向政府機構出售未知漏洞,他同意Dowd的觀點,指出AI公司透過其審查計劃和護欄“基本上將客戶視為需要照看的兒童”。
Stagno提到,他和他的團隊使用前沿模型進行逆向工程,但避免使用AI來查詢漏洞或構建利用程式。將此類工作輸入基於雲端的模型存在洩露敏感漏洞資料或被吸收進未來訓練執行的風險。對於這些任務,他使用本地執行的開源模型以避免與外部共享資料。
發現零日漏洞並開發利用程式的安全研究人員Giuseppe Cali表示,護欄並沒有阻礙他的工作。這是因為他不將AI用於進攻目的;相反,他使用AI進行初始逆向工程,以理解正在分析的程式碼並構建支援工具。他指出,AI工具加速了這一過程,使他能夠專注於發現漏洞。
“我仍然希望親自掌握實際的漏洞發現和武器化,即使明天所有護欄都被解除,這也不會改變,”Cali說。“我嫉妒我的漏洞,而且我太喜歡這個遊戲,不會讓模型替我玩。”
一家智慧手機零部件製造商的一名研究人員,在要求匿名的情況下表示,因為他未被授權接受媒體採訪,他的僱主並非Anthropic CVP計劃的一部分。因此,由於過於嚴格的護欄,其工具在查詢漏洞方面幾乎無用。
“如果它察覺到我們在做任何與安全相關的事情,它就會停止並且無法使用,”該人士說。
網路安全公司RemoteThreat的執行長、專注於進攻性安全和AI的活動Offensive AI Con的創始人Chris Thompson指出,根據他對前沿AI模型的經驗,護欄是不一致的,並且每天表現不同。即使在Anthropic和OpenAI更寬鬆的審查計劃範圍內也是如此。
“我認為實際影響是你花大量時間與模型協商,而不是專注於核心安全專案,”Thompson說。“與其分析漏洞並推理其可利用性,你卻在試圖找出為什麼結果不一致,或者為什麼模型過度清理輸出。”
因此,研究人員越來越多地依賴或被推向中國的開源模型,如GLM——這些可免費下載的模型可以在本地執行,無需審查或使用限制,據Thompson所述。
“你看到這些負責任的研究人員被從美國管理的系統推向外國擁有的系統,”他說。“我認為設定這些護欄弊大於利。”
Thompson敦促AI前沿實驗室不要進一步收緊限制,而是開放其專案,提供負責任的訪問,並對濫用其工具的人追究責任。否則,他認為,防禦者將失去AI競賽。
“一場大風暴即將來臨。一股前所未有的速度和規模的攻擊浪潮即將發生,”Thompson說。“但正是那些試圖有所作為的安全諮詢公司以及合法研究人員,目前正受到壓制。”
相關文章
OpenAI 與 Yubico 合作,透過硬體密鑰強化 GPT-5.6 的安全性
Yubico 執行長傑羅德·張(Jerrod Chong)|圖片來源:YubicoOpenAI 即將推出的 GPT-5.6 將從 9 月起強制要求使用硬體支援的通行金鑰,Yubico 執行長傑羅德·張表示,此舉證實了該公司產品是防止帳戶遭入侵的首選防護方案。OpenAI 已推出 GPT-5.6 模型系列,聲稱該系列在提供尖端 AI 性能的同時,運作時的代幣消耗量更低。該公告針對註冊 OpenAI「
OpenAI 領銜推動由 100 個簽署方參與的網路防禦行動
OpenAI 的信函開頭指出:「我們只有有限的時間來強化網路防禦。」圖片來源:Getty Images包括 AWS、Google 和 Microsoft 在內的主要科技公司敦促各國政府資助防禦工具,而批評者則指稱這份宣言是出於自身利益隨著人工智慧模型在攻擊與保護數位系統方面的能力日益增強,超過 100 家科技、網路安全及金融服務組織已與 OpenAI 聯名發表公開信,呼籲全球立即大幅加強網路防禦。
Anthropic 讓 AI 代理在共同任務中大展身手,點燃內部競爭
當人工智慧代理相互對抗時會發生什麼事?Anthropic 最近的測試顯示,結果可能會迅速陷入混亂。本週四,Anthropic 旗下的 Frontier Red Team 發布了一項新研究,分析當多組 AI 代理在真實世界環境中相遇時,彼此之間的互動模式。這些發現為組織與政府在共用程式碼庫、金融市場及電腦系統中部署自主代理時,可能面臨的潛在風險提供了重要洞見。在一項實驗中,Anthropic 讓三個
相關專題推薦
評論 (0)
0/500

數月來,AI領域的領導者們實施了嚴格的審查協議和安全護欄,以防止惡意行為者利用他們的模型。然而,這些限制現在正在阻礙合法的網路安全防禦者和進攻性網路安全研究人員。
今年6月,美國政府禁止出口Anthropic備受期待的AI模型Mythos和Fable。這一決定部分源於有關報告,指出這些模型防止協助網路攻擊的安全措施可能被繞過。
無論該事件是否真正由越獄擔憂引發,Anthropic始終將Mythos定位為一種強大的網路工具,僅向經過嚴格審查的使用者在嚴格限制下開放。(注:Fable 5和Mythos 5的出口管制隨後已解除。Fable 5於7月1日重新面向公眾開放,而Mythos 5已作為政府審查過程的一部分,重新僅向經過審查的美國組織提供。)
這種把關方式並非Mythos獨有。Anthropic和OpenAI都為網路安全研究人員提供了申請經過審查的訪問許可權的專案,如果獲得批准,他們將獲得具有較少網路安全限制的模型:OpenAI的“網路安全可信訪問”和Anthropic的“網路安全驗證計劃”。
這些護欄受到了廣泛批評,特別是那些負責在犯罪分子之前識別未知系統漏洞並開發利用程式的研究人員。
在最近的一次網路安全播客節目中,著名安全研究人員Mark Dowd表示:“讓我感到不舒服的是,這些隨機的大型公司正在就什麼是安全、什麼是不安全做出武斷的決定。”
Dowd花了數十年時間發現並出售“零日漏洞”——即以前未知的軟體缺陷及其利用程式——給西方政府,而不是向軟體供應商報告以進行修補。政府為這些漏洞支付高額費用,因為它們未被公開,這對情報行動有價值。
Dowd承認他的工作可能會引入偏見,但他並不孤單。幾名從事進攻性網路安全的專業人士,他們主動探測系統弱點,向TechCrunch描述了他們如何利用AI工具並應對這些護欄。
NCC Group這家安全諮詢巨頭的首席科學家Chris Anley解釋說,要求AI模型嘗試利用一個漏洞是確認它確實是值得修復的真實漏洞的關鍵步驟。然而,他指出,如果護欄導致模型完全拒絕請求,這會阻礙防禦者。
“這就是整個攻防和護欄部分發揮作用的地方,因為‘修復這段程式碼’作為提示,既是防禦的必要機制,也是查詢程式碼庫中關鍵漏洞的路線圖,”Anley說。“因此,同時,同一個工具既是進攻工具也是防禦工具,這兩者實際上無法分開。”
他繼續說道:“這就像一把錘子。沒有錘子你就無法建造房屋。它肯定是一個工具,但同時也是不可簡化的武器。”
遇到此類障礙時,他和他的同事有時會轉向沒有任何護欄的開源AI模型。
CrowdFense的技術長Paolo Stagno是一家知名公司,該公司開發、收購併向政府機構出售未知漏洞,他同意Dowd的觀點,指出AI公司透過其審查計劃和護欄“基本上將客戶視為需要照看的兒童”。
Stagno提到,他和他的團隊使用前沿模型進行逆向工程,但避免使用AI來查詢漏洞或構建利用程式。將此類工作輸入基於雲端的模型存在洩露敏感漏洞資料或被吸收進未來訓練執行的風險。對於這些任務,他使用本地執行的開源模型以避免與外部共享資料。
發現零日漏洞並開發利用程式的安全研究人員Giuseppe Cali表示,護欄並沒有阻礙他的工作。這是因為他不將AI用於進攻目的;相反,他使用AI進行初始逆向工程,以理解正在分析的程式碼並構建支援工具。他指出,AI工具加速了這一過程,使他能夠專注於發現漏洞。
“我仍然希望親自掌握實際的漏洞發現和武器化,即使明天所有護欄都被解除,這也不會改變,”Cali說。“我嫉妒我的漏洞,而且我太喜歡這個遊戲,不會讓模型替我玩。”
一家智慧手機零部件製造商的一名研究人員,在要求匿名的情況下表示,因為他未被授權接受媒體採訪,他的僱主並非Anthropic CVP計劃的一部分。因此,由於過於嚴格的護欄,其工具在查詢漏洞方面幾乎無用。
“如果它察覺到我們在做任何與安全相關的事情,它就會停止並且無法使用,”該人士說。
網路安全公司RemoteThreat的執行長、專注於進攻性安全和AI的活動Offensive AI Con的創始人Chris Thompson指出,根據他對前沿AI模型的經驗,護欄是不一致的,並且每天表現不同。即使在Anthropic和OpenAI更寬鬆的審查計劃範圍內也是如此。
“我認為實際影響是你花大量時間與模型協商,而不是專注於核心安全專案,”Thompson說。“與其分析漏洞並推理其可利用性,你卻在試圖找出為什麼結果不一致,或者為什麼模型過度清理輸出。”
因此,研究人員越來越多地依賴或被推向中國的開源模型,如GLM——這些可免費下載的模型可以在本地執行,無需審查或使用限制,據Thompson所述。
“你看到這些負責任的研究人員被從美國管理的系統推向外國擁有的系統,”他說。“我認為設定這些護欄弊大於利。”
Thompson敦促AI前沿實驗室不要進一步收緊限制,而是開放其專案,提供負責任的訪問,並對濫用其工具的人追究責任。否則,他認為,防禦者將失去AI競賽。
“一場大風暴即將來臨。一股前所未有的速度和規模的攻擊浪潮即將發生,”Thompson說。“但正是那些試圖有所作為的安全諮詢公司以及合法研究人員,目前正受到壓制。”
OpenAI 與 Yubico 合作,透過硬體密鑰強化 GPT-5.6 的安全性
Yubico 執行長傑羅德·張(Jerrod Chong)|圖片來源:YubicoOpenAI 即將推出的 GPT-5.6 將從 9 月起強制要求使用硬體支援的通行金鑰,Yubico 執行長傑羅德·張表示,此舉證實了該公司產品是防止帳戶遭入侵的首選防護方案。OpenAI 已推出 GPT-5.6 模型系列,聲稱該系列在提供尖端 AI 性能的同時,運作時的代幣消耗量更低。該公告針對註冊 OpenAI「
OpenAI 領銜推動由 100 個簽署方參與的網路防禦行動
OpenAI 的信函開頭指出:「我們只有有限的時間來強化網路防禦。」圖片來源:Getty Images包括 AWS、Google 和 Microsoft 在內的主要科技公司敦促各國政府資助防禦工具,而批評者則指稱這份宣言是出於自身利益隨著人工智慧模型在攻擊與保護數位系統方面的能力日益增強,超過 100 家科技、網路安全及金融服務組織已與 OpenAI 聯名發表公開信,呼籲全球立即大幅加強網路防禦。
Anthropic 讓 AI 代理在共同任務中大展身手,點燃內部競爭
當人工智慧代理相互對抗時會發生什麼事?Anthropic 最近的測試顯示,結果可能會迅速陷入混亂。本週四,Anthropic 旗下的 Frontier Red Team 發布了一項新研究,分析當多組 AI 代理在真實世界環境中相遇時,彼此之間的互動模式。這些發現為組織與政府在共用程式碼庫、金融市場及電腦系統中部署自主代理時,可能面臨的潛在風險提供了重要洞見。在一項實驗中,Anthropic 讓三個





首頁






