Meta 因誘導競爭對手的 AI 測試極端心理主題而遭曝光

近期有關某內部訊息的曝光引發了關於人工智慧安全邊界的熱烈討論。媒體報道稱,Meta曾開展過一個名為“Cannes”的專案,透過僱傭外包人員假扮未成年人,對包括ChatGPT、Gemini和Character.AI在內的多家主要競爭對手的聊天機器人進行有爭議的“極端壓力測試”。
根據Meta的內部檔案及多位知情人士透露,該專案至少持續到了今年4月21日。Meta透過外包公司Covalen動員了數百名員工,使用臨時電子郵件地址和標準密碼為18歲以下的使用者建立虛假賬號。這些“未成年人”賬號在與競爭對手的AI聊天機器人對話時,會傳送涉及自殺、自殘和飲食失調等高風險話題的提示,甚至上傳刀具、藥片和絞索的照片,以此觸發相關模型的反應機制。
內部專案檔案顯示,這些測試場景是經過精心設計的,旨在探測競爭對手AI系統的安全防護措施,試圖找到讓聊天機器人繞過既定保護機制並生成危險內容的方法。在2025年8月的一輪測試中,工作人員向競爭對手的平臺輸入了超過45,000條高風險提示。測試人員經常假扮處於困境中的青少年,編造諸如“詢問墮胎藥”“面臨暴力威脅”或“隱瞞飲食失調問題”之類的場景,以此考驗這些模型的底線。
針對此事,Meta發表了公開宣告為自身行為辯護。其發言人表示,對聊天機器人的響應進行基準測試是確保人工智慧產品安全且適用的行業標準做法,而所謂惡意行為的指控實際上歪曲了科技企業努力改進系統的初衷。Meta還明確否認曾利用競爭對手的測試資料來訓練自己的模型。
這一事件不僅暴露了人工智慧安全測試中的灰色地帶,也再次引發了外界對於生成式AI在處理涉及青少年的敏感問題時存在脆弱性的擔憂。隨著人工智慧技術的發展,如何在高效安全的測試與競爭行為與倫理考量之間的界限之間找到平衡,已成為該行業亟需解決的挑戰。
相關文章
OpenAI 與 Oracle 深化算力整合,簡化雲訪問
隨著對人工智慧計算能力的需求激增,獲取企業級基礎設施的便捷性已成為行業的關鍵優先事項。6月10日,OpenAI與Oracle宣佈建立戰略合作伙伴關係,旨在將人工智慧模型整合與雲基礎設施無縫連線。此次合作的重點是提升Oracle Cloud Infrastructure (OCI) 使用者的體驗。從未來幾周開始,OCI使用者將無需經過冗長的採購審批流程,即可使用現有的Oracle Cloud Commitment Units (UCM) 積分直接訪問OpenAI的高階模型和Codex系統。該舉措簡
Orange 的烏斯曼·賈維德談歐洲在人工智慧競賽中的地位
Orange Business 產品與行銷長 烏斯曼·賈維德Orange Business 產品與行銷長烏斯曼·賈維德闡述為何歐洲的 AI 未來將建立在信任之上,以及「主權」的具體樣貌儘管該地區可能招致批評,但 Orange Business 產品與行銷長烏斯曼·賈維德主張,歐洲在人工智慧領域的落後程度並不如外界所言那般嚴重——透過工程、製造及標準制定,歐洲早已在全球生態系統中扮演關鍵角色。他表示
Anthropic 為 Claude 推出身份驗證:是否必須使用人臉識別?
Anthropic 已正式宣佈,將針對 Claude 的部分使用場景引入身份驗證機制。該公告迅速在使用者群體中引發了廣泛討論。根據官方宣告,當使用者嘗試訪問某些特定功能時,系統可能會要求驗證。觸發條件包括訪問特定的高階功能、常規平臺完整性檢查以及與安全和合規要求相關的場景。部分使用者已報告,在訂閱最高階別的 Max 計劃時被要求驗證身份。驗證過程本身並不複雜,通常耗時不到五分鐘。使用者需準備政府簽發的帶照片身份證件——如護照、駕駛證或國民身份證,以及帶有攝像頭的手機或電腦,用於拍攝實時自拍以進行面部
相關專題推薦
評論 (0)
0/500

近期有關某內部訊息的曝光引發了關於人工智慧安全邊界的熱烈討論。媒體報道稱,Meta曾開展過一個名為“Cannes”的專案,透過僱傭外包人員假扮未成年人,對包括ChatGPT、Gemini和Character.AI在內的多家主要競爭對手的聊天機器人進行有爭議的“極端壓力測試”。
根據Meta的內部檔案及多位知情人士透露,該專案至少持續到了今年4月21日。Meta透過外包公司Covalen動員了數百名員工,使用臨時電子郵件地址和標準密碼為18歲以下的使用者建立虛假賬號。這些“未成年人”賬號在與競爭對手的AI聊天機器人對話時,會傳送涉及自殺、自殘和飲食失調等高風險話題的提示,甚至上傳刀具、藥片和絞索的照片,以此觸發相關模型的反應機制。
內部專案檔案顯示,這些測試場景是經過精心設計的,旨在探測競爭對手AI系統的安全防護措施,試圖找到讓聊天機器人繞過既定保護機制並生成危險內容的方法。在2025年8月的一輪測試中,工作人員向競爭對手的平臺輸入了超過45,000條高風險提示。測試人員經常假扮處於困境中的青少年,編造諸如“詢問墮胎藥”“面臨暴力威脅”或“隱瞞飲食失調問題”之類的場景,以此考驗這些模型的底線。
針對此事,Meta發表了公開宣告為自身行為辯護。其發言人表示,對聊天機器人的響應進行基準測試是確保人工智慧產品安全且適用的行業標準做法,而所謂惡意行為的指控實際上歪曲了科技企業努力改進系統的初衷。Meta還明確否認曾利用競爭對手的測試資料來訓練自己的模型。
這一事件不僅暴露了人工智慧安全測試中的灰色地帶,也再次引發了外界對於生成式AI在處理涉及青少年的敏感問題時存在脆弱性的擔憂。隨著人工智慧技術的發展,如何在高效安全的測試與競爭行為與倫理考量之間的界限之間找到平衡,已成為該行業亟需解決的挑戰。
OpenAI 與 Oracle 深化算力整合,簡化雲訪問
隨著對人工智慧計算能力的需求激增,獲取企業級基礎設施的便捷性已成為行業的關鍵優先事項。6月10日,OpenAI與Oracle宣佈建立戰略合作伙伴關係,旨在將人工智慧模型整合與雲基礎設施無縫連線。此次合作的重點是提升Oracle Cloud Infrastructure (OCI) 使用者的體驗。從未來幾周開始,OCI使用者將無需經過冗長的採購審批流程,即可使用現有的Oracle Cloud Commitment Units (UCM) 積分直接訪問OpenAI的高階模型和Codex系統。該舉措簡
Orange 的烏斯曼·賈維德談歐洲在人工智慧競賽中的地位
Orange Business 產品與行銷長 烏斯曼·賈維德Orange Business 產品與行銷長烏斯曼·賈維德闡述為何歐洲的 AI 未來將建立在信任之上,以及「主權」的具體樣貌儘管該地區可能招致批評,但 Orange Business 產品與行銷長烏斯曼·賈維德主張,歐洲在人工智慧領域的落後程度並不如外界所言那般嚴重——透過工程、製造及標準制定,歐洲早已在全球生態系統中扮演關鍵角色。他表示
Anthropic 為 Claude 推出身份驗證:是否必須使用人臉識別?
Anthropic 已正式宣佈,將針對 Claude 的部分使用場景引入身份驗證機制。該公告迅速在使用者群體中引發了廣泛討論。根據官方宣告,當使用者嘗試訪問某些特定功能時,系統可能會要求驗證。觸發條件包括訪問特定的高階功能、常規平臺完整性檢查以及與安全和合規要求相關的場景。部分使用者已報告,在訂閱最高階別的 Max 計劃時被要求驗證身份。驗證過程本身並不複雜,通常耗時不到五分鐘。使用者需準備政府簽發的帶照片身份證件——如護照、駕駛證或國民身份證,以及帶有攝像頭的手機或電腦,用於拍攝實時自拍以進行面部





首頁






