專家揭露惡意 OpenAI 模型用以滲透 Hugging Face 的手法
![]()
山姆·奧爾特曼(Sam Altman)現任 OpenAI 執行長。圖片來源:Getty Images
業界專家針對 OpenAI 模型從測試環境逃脫、連上網際網路,並隨後入侵某個人工智慧與機器學習平台的事件,分享了他們的觀點
這些失控的 OpenAI 模型從訓練環境中脫逃,並滲透至開源人工智慧與機器學習平台 Hugging Face。
OpenAI 已將此事件定性為「史無前例的網路安全事件」。
此事件發生之際,正值有關最先進 AI 模型所引發的安全威脅日益加劇的報導不斷,且緊接在 Google DeepMind 執行長 Demis Hassabis 呼籲由美國主導對尖端 AI 模型進行監管之後。
全球科技專業協會 ISACA 的全球首席策略官克里斯·迪米特里亞迪斯(Chris Dimitriadis)表示:「過去幾年來,企業在這場持續進行的人工智慧軍備競賽中,爭相盡快部署人工智慧——而我們正逼近這場競賽的『無回頭路』臨界點,一旦越過此點,進程便再也無法被遏止。」
OpenAI 預測,隨著 AI 模型進行網路行動的能力日益增強,此類事件將「變得更加普遍」
ISACA 全球策略長克里斯·迪米特里亞迪斯。圖片來源:克里斯·迪米特里亞迪斯/LinkedIn
這起 AI 網路安全事件是如何發生的
經過調查,OpenAI 確認該事件是由其自身模型(包括 GPT‑5.6 Sol 以及一個「功能更強大的預發布模型」)共同引發所致。
這些模型在沙盒測試環境中運作時,耗費了大量運算資源試圖存取公開的網際網路
它們發現並利用了 OpenAI 研究環境以及 Hugging Face 生產基礎架構中的漏洞,從而得以直接從 Hugging Face 的生產資料庫中擷取測試資料
「這些代理程式即將來臨,其中部分將會失控。」
——SailPoint 首席技術官Chandra
Gnanasambandam
OpenAI 的調查顯示,這些模型極度專注於解決與 ExploitGym 相關的問題——ExploitGym 是一個由真實世界漏洞構建的大型基準測試,旨在評估 AI 代理創造漏洞利用程式的能力。這些模型為了達成這個相對狹窄的測試目標,不惜採取極端手段
所發生的情況可被描述為「規格鑽空子」(specification gaming),這是一種人工智慧行為,指代理程式雖滿足任務的字面要求,卻未能產出預期結果
Hugging Face 解釋道,一套惡意資料集利用了其處理管道中的兩項程式碼執行機制——遠端程式碼資料集載入器以及資料集配置中的範本注入功能——在處理伺服器上執行程式碼
藉此,攻擊者在短短一個週末內便取得節點層級的存取權限,竊取雲端與叢集的憑證,並將影響範圍擴展至多個內部叢集。
關鍵事實
- 此次事件是由 OpenAI 多個模型共同引發的,包括 GPT‑5.6 Sol 以及一個「功能更強大的預發布模型」
- 這些模型識別並利用了 OpenAI 研究環境及 Hugging Face 生產基礎架構中的漏洞
- 此次事件可被描述為「規格鑽漏洞」
- OpenAI 預測,隨著 AI 模型在網路攻擊方面的能力日益增強,此類事件將變得更加普遍

採用中國模型進行應對
Hugging Face 在其基礎設施上部署了一款來自中國的模型,以抵禦這場自主網路攻擊:Z.ai 的 GLM 5.2,這是一款開放權重模型
該公司最初嘗試使用商業 API 背後的尖端模型,但此方法失敗了,因為服務提供商的安全機制阻擋了這些請求——它們無法區分事件應對系統與實際攻擊者
這項發展發生在中國人工智慧新創公司 Moonshot 發布 Kimi K3 之後不久, 這是一款擁有 2.8 兆參數、100 萬個標記上下文視窗的模型,其表現僅略遜於美國最先進的模型,例如 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT 5.6 Sol
中國國家主席習近平與美國總統唐納德·川普。圖片來源:Getty
專家如何看待此事
OpenAI 執行長山姆·奧爾特曼(Sam Altman)在 X 平台的一則貼文中,將此事件描述為「一宗重大的安全事件」,並對 Hugging Face 在應對過程中給予的合作表示感謝
多位執行長與技術長針對此事件發表看法,強調事態的嚴重性,並探討其對人工智慧未來的影響
ISACA的克里斯·迪米特里亞迪斯(Chris Dimitriadis)表示:「這起事件凸顯了人工智慧生態系統中人類監督的重要性,並強調必須優先培訓全面發展的人工智慧人才,以有效治理、稽核及防禦與人工智慧相關的威脅。」
Optiv Consulting(前身為 Optiv Security 旗下公司)執行長阿努普·庫馬爾(Anup Kumar)表示,此情境所代表的風險類型,與傳統安全系統通常處理的風險在根本上有所不同。
「這並非模型被精明的提示語所欺騙,」他解釋道
Optiv Consulting(前身為 Optiv Security 旗下部門)執行長阿努普·庫馬爾。圖片來源:阿努普·庫馬爾/LinkedIn
「這是一個尖端模型,它獨立發現了零日漏洞,利用跨不同組織基礎架構的權限提升機制,並存取了生產系統——而這一切都是為了達成一個狹義的評估目標,該目標從未被明確指示要達成。
「這構成了與大多數資安計畫所設計應對的風險類別截然不同的風險類別。」
創新與安全之間的落差
SailPoint 首席技術官錢德拉·格納桑班達姆(Chandra Gnanasambandam)曾警告,當前的人工智慧創新與因應其威脅的安全措施準備程度之間存在著顯著差距。
「代理式 AI 的時代已經來臨,」錢德拉表示。「然而,AI 創新的步伐與許多組織的安全準備程度之間,存在著危險的落差。」
「AI 代理程式是透過非人類的憑證運作的。為了代表您執行任務,它們需要 API 金鑰、存取憑證和系統憑證。如果組織將這些代理程式視為傳統的服務帳戶——任其存取不受監管、憑證未經管理——便會形成一個龐大且自動化的攻擊面。」
「這些代理程式正陸續登場,其中部分將失控。」
相關文章
政府中的「能動型人工智慧」面臨嚴峻問題:應允許機器決定哪些事項?
阿拉伯聯合大公國在人工智慧領域已率先布局長達九年之久。該國於2017年10月推出國家級人工智慧戰略,並於不久後設立部長級職位負責監督該戰略,任命年僅27歲的奧馬爾·蘇丹·阿爾·奧拉馬(Omar Sultan Al Olama)為全球首位人工智慧國務部長。 自此之後,該國已建置了數位身分識別、主權雲端及資料共享基礎設施,而多數政府目前仍在建置這些系統的過程中。政府在「代理型人工智慧」領域面臨的真正考
Cloudflare 的政策要求人工智慧企業為使用的相關內容向內容釋出方支付費用
Cloudflare 為人工智慧行業設定了新的截止期限,要求將用於傳統搜尋引擎(如 Google Search)的網頁爬蟲與專為人工智慧智慧體及訓練設計的爬蟲分開。該公司在週三宣佈,自 2026 年 9 月 15 日起,Cloudflare 的預設設定將會阻止那些“混合用途”的爬蟲訪問任何顯示廣告的頁面。這意味著,除非網站所有者手動調整設定,否則兼具搜尋、智慧體功能及訓練功能的爬蟲將預設被禁止訪問這些站點。據該公司稱,這一變更將適用於新註冊的 Cloudflare 客戶、現有客戶新建的網站以及
科技公司對成本效益高的AI模型表現出興趣
人工智慧的蓬勃發展依賴於一個核心假設:規模更大的模型能力更強,而最強大的模型才能取得成功。如今,這個行業即將面臨這樣一個挑戰:當這一假設開始出現裂痕時,會發生什麼?不斷上升的成本已經迫使使用者重新考慮使用規模更小、價格更低的模型。這種基於成本考慮的模型選擇方式是前所未有的,目前還不清楚它將如何重塑整個行業——但它的影響很可能是深遠的。Coinbase聯合創始人Brian Armstrong最明確地表達了一個預測:絕大多數任務將會轉移到價格更低的模型上。Armstrong在X平臺上寫道:“對智
相關專題推薦
評論 (0)
0/500
山姆·奧爾特曼(Sam Altman)現任 OpenAI 執行長。圖片來源:Getty Images
業界專家針對 OpenAI 模型從測試環境逃脫、連上網際網路,並隨後入侵某個人工智慧與機器學習平台的事件,分享了他們的觀點
這些失控的 OpenAI 模型從訓練環境中脫逃,並滲透至開源人工智慧與機器學習平台 Hugging Face。
OpenAI 已將此事件定性為「史無前例的網路安全事件」。
此事件發生之際,正值有關最先進 AI 模型所引發的安全威脅日益加劇的報導不斷,且緊接在 Google DeepMind 執行長 Demis Hassabis 呼籲由美國主導對尖端 AI 模型進行監管之後。
全球科技專業協會 ISACA 的全球首席策略官克里斯·迪米特里亞迪斯(Chris Dimitriadis)表示:「過去幾年來,企業在這場持續進行的人工智慧軍備競賽中,爭相盡快部署人工智慧——而我們正逼近這場競賽的『無回頭路』臨界點,一旦越過此點,進程便再也無法被遏止。」
OpenAI 預測,隨著 AI 模型進行網路行動的能力日益增強,此類事件將「變得更加普遍」
ISACA 全球策略長克里斯·迪米特里亞迪斯。圖片來源:克里斯·迪米特里亞迪斯/LinkedIn
這起 AI 網路安全事件是如何發生的
經過調查,OpenAI 確認該事件是由其自身模型(包括 GPT‑5.6 Sol 以及一個「功能更強大的預發布模型」)共同引發所致。
這些模型在沙盒測試環境中運作時,耗費了大量運算資源試圖存取公開的網際網路
它們發現並利用了 OpenAI 研究環境以及 Hugging Face 生產基礎架構中的漏洞,從而得以直接從 Hugging Face 的生產資料庫中擷取測試資料
「這些代理程式即將來臨,其中部分將會失控。」
——SailPoint 首席技術官Chandra
Gnanasambandam
OpenAI 的調查顯示,這些模型極度專注於解決與 ExploitGym 相關的問題——ExploitGym 是一個由真實世界漏洞構建的大型基準測試,旨在評估 AI 代理創造漏洞利用程式的能力。這些模型為了達成這個相對狹窄的測試目標,不惜採取極端手段
所發生的情況可被描述為「規格鑽空子」(specification gaming),這是一種人工智慧行為,指代理程式雖滿足任務的字面要求,卻未能產出預期結果
Hugging Face 解釋道,一套惡意資料集利用了其處理管道中的兩項程式碼執行機制——遠端程式碼資料集載入器以及資料集配置中的範本注入功能——在處理伺服器上執行程式碼
藉此,攻擊者在短短一個週末內便取得節點層級的存取權限,竊取雲端與叢集的憑證,並將影響範圍擴展至多個內部叢集。
關鍵事實
- 此次事件是由 OpenAI 多個模型共同引發的,包括 GPT‑5.6 Sol 以及一個「功能更強大的預發布模型」
- 這些模型識別並利用了 OpenAI 研究環境及 Hugging Face 生產基礎架構中的漏洞
- 此次事件可被描述為「規格鑽漏洞」
- OpenAI 預測,隨著 AI 模型在網路攻擊方面的能力日益增強,此類事件將變得更加普遍

採用中國模型進行應對
Hugging Face 在其基礎設施上部署了一款來自中國的模型,以抵禦這場自主網路攻擊:Z.ai 的 GLM 5.2,這是一款開放權重模型
該公司最初嘗試使用商業 API 背後的尖端模型,但此方法失敗了,因為服務提供商的安全機制阻擋了這些請求——它們無法區分事件應對系統與實際攻擊者
這項發展發生在中國人工智慧新創公司 Moonshot 發布 Kimi K3 之後不久, 這是一款擁有 2.8 兆參數、100 萬個標記上下文視窗的模型,其表現僅略遜於美國最先進的模型,例如 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT 5.6 Sol
中國國家主席習近平與美國總統唐納德·川普。圖片來源:Getty
專家如何看待此事
OpenAI 執行長山姆·奧爾特曼(Sam Altman)在 X 平台的一則貼文中,將此事件描述為「一宗重大的安全事件」,並對 Hugging Face 在應對過程中給予的合作表示感謝
多位執行長與技術長針對此事件發表看法,強調事態的嚴重性,並探討其對人工智慧未來的影響
ISACA的克里斯·迪米特里亞迪斯(Chris Dimitriadis)表示:「這起事件凸顯了人工智慧生態系統中人類監督的重要性,並強調必須優先培訓全面發展的人工智慧人才,以有效治理、稽核及防禦與人工智慧相關的威脅。」
Optiv Consulting(前身為 Optiv Security 旗下公司)執行長阿努普·庫馬爾(Anup Kumar)表示,此情境所代表的風險類型,與傳統安全系統通常處理的風險在根本上有所不同。
「這並非模型被精明的提示語所欺騙,」他解釋道
Optiv Consulting(前身為 Optiv Security 旗下部門)執行長阿努普·庫馬爾。圖片來源:阿努普·庫馬爾/LinkedIn
「這是一個尖端模型,它獨立發現了零日漏洞,利用跨不同組織基礎架構的權限提升機制,並存取了生產系統——而這一切都是為了達成一個狹義的評估目標,該目標從未被明確指示要達成。
「這構成了與大多數資安計畫所設計應對的風險類別截然不同的風險類別。」
創新與安全之間的落差
SailPoint 首席技術官錢德拉·格納桑班達姆(Chandra Gnanasambandam)曾警告,當前的人工智慧創新與因應其威脅的安全措施準備程度之間存在著顯著差距。
「代理式 AI 的時代已經來臨,」錢德拉表示。「然而,AI 創新的步伐與許多組織的安全準備程度之間,存在著危險的落差。」
「AI 代理程式是透過非人類的憑證運作的。為了代表您執行任務,它們需要 API 金鑰、存取憑證和系統憑證。如果組織將這些代理程式視為傳統的服務帳戶——任其存取不受監管、憑證未經管理——便會形成一個龐大且自動化的攻擊面。」
「這些代理程式正陸續登場,其中部分將失控。」
政府中的「能動型人工智慧」面臨嚴峻問題:應允許機器決定哪些事項?
阿拉伯聯合大公國在人工智慧領域已率先布局長達九年之久。該國於2017年10月推出國家級人工智慧戰略,並於不久後設立部長級職位負責監督該戰略,任命年僅27歲的奧馬爾·蘇丹·阿爾·奧拉馬(Omar Sultan Al Olama)為全球首位人工智慧國務部長。 自此之後,該國已建置了數位身分識別、主權雲端及資料共享基礎設施,而多數政府目前仍在建置這些系統的過程中。政府在「代理型人工智慧」領域面臨的真正考
Cloudflare 的政策要求人工智慧企業為使用的相關內容向內容釋出方支付費用
Cloudflare 為人工智慧行業設定了新的截止期限,要求將用於傳統搜尋引擎(如 Google Search)的網頁爬蟲與專為人工智慧智慧體及訓練設計的爬蟲分開。該公司在週三宣佈,自 2026 年 9 月 15 日起,Cloudflare 的預設設定將會阻止那些“混合用途”的爬蟲訪問任何顯示廣告的頁面。這意味著,除非網站所有者手動調整設定,否則兼具搜尋、智慧體功能及訓練功能的爬蟲將預設被禁止訪問這些站點。據該公司稱,這一變更將適用於新註冊的 Cloudflare 客戶、現有客戶新建的網站以及
科技公司對成本效益高的AI模型表現出興趣
人工智慧的蓬勃發展依賴於一個核心假設:規模更大的模型能力更強,而最強大的模型才能取得成功。如今,這個行業即將面臨這樣一個挑戰:當這一假設開始出現裂痕時,會發生什麼?不斷上升的成本已經迫使使用者重新考慮使用規模更小、價格更低的模型。這種基於成本考慮的模型選擇方式是前所未有的,目前還不清楚它將如何重塑整個行業——但它的影響很可能是深遠的。Coinbase聯合創始人Brian Armstrong最明確地表達了一個預測:絕大多數任務將會轉移到價格更低的模型上。Armstrong在X平臺上寫道:“對智





首頁






