OpenAI 推出支援 128K 上下文的隱私過濾器,具備八種識別模式
OpenAI 推出了 隱私過濾器(Privacy Filter),這是一款最先進的個人身份資訊(PII)匿名化模型。該工具現已在 Hugging Face 和 GitHub 上以 Apache 2.0 許可證 開放,為開發者提供了一種本地化、高度可定製的解決方案,以實現強大的隱私保護。
超越基於規則匹配的先進語義理解
與傳統的基於規則的工具不同,隱私過濾器利用深層語言理解能力,根據上下文準確識別非結構化文字中的敏感資料。這種方法在最大程度保留公共內容實用性的同時,有效地隱藏了私人資訊。

輕量級 MoE 架構,實現卓越效率
該模型的技術設計兼顧了靈活性與效能:
混合專家(MoE)設計: 總引數量為 15 億,但每次推理僅啟用約 5000 萬 個引數。這種高效性使得該模型能夠在資源受限的邊緣裝置上流暢執行,包括膝上型電腦和網頁瀏覽器。
擴充套件上下文支援: 該模型擁有 128,000 Token 的上下文視窗,採用雙向 Token 分類架構結合受限維特比演算法,確保在處理長文件時的準確性和連貫性。
高精度識別: 在更新的 PII-Masking-300k 基準測試中,該模型取得了 97.43% 的 F1 分數,召回率高達 98.08%。
全面的隱私分類系統
隱私過濾器能夠準確識別並標記八類核心敏感資訊:
基本身份資訊: 姓名、地址、電子郵件地址和電話號碼。
線上資產: URL 連結。
財務安全: 賬戶詳情,包括銀行和信用卡號碼。
機密憑證: 密碼和 API 金鑰。
時效性資訊: 日期資訊。
應用場景:雲大語言模型的“本地防火牆”
OpenAI 將該工具定位為 預過濾層。透過在將文字傳送至基於雲的大語言模型之前,在本地進行 PII 檢測和匿名化處理,這種“資料留在裝置上”的策略顯著降低了使用者無意中向 AI 服務暴露私人資訊的風險。
相關文章
NewCore 籌集 6600 萬美元,為 AI 代理配備身份,使其逐步承擔員工角色
網路安全初創公司 NewCore 正式結束低調運營期,於週一宣佈獲得 6600 萬美元融資。該公司旨在解決一個許多組織在整合 AI 智慧體時將面臨的嚴峻挑戰:如何大規模地對這些數字員工進行身份認證、治理和控制。本輪種子輪融資由專注於網路安全的風險投資公司 Cyberstarts 領投,Index Ventures 和 Evolution Equity Partners 等機構跟投。融資完成後,NewCore 的估值達到 3 億美元。各組織越來越將 AI 智慧體視為職場中的活躍參與者,而非僅僅
微軟與 Mistral 簽署價值數十億美元的歐洲人工智慧合作協議
此次合作的核心是一項價值數十億美元的協議,旨在強化全歐洲的人工智慧基礎設施。圖片來源:微軟微軟與法國領先的人工智慧公司 Mistral 共同宣布了一項價值數十億美元的合作夥伴關係,旨在強化歐洲的人工智慧生態系。微軟與法國先進大型語言模型開發商 Mistral 宣布達成一項新協議,旨在擴展歐洲境內的人工智慧基礎設施。這項協議標誌著雙方現有合作關係的重大擴展,同時也將使 Mistral 的人工智慧模型
微軟高管稱AI資料抓取是“歷史上最大的勞動盜竊”,未經刪減的檔案顯示
紐約時報針對OpenAI和微軟提起的為期三年的版權訴訟中解密的檔案顯示,一家公司承認AI抓取構成盜竊,並對媒體機構構成嚴重威脅。根據訴訟檔案,微軟的一位高管私下將公司的AI訓練方法稱為“盜竊”,而OpenAI的領導層承認,其模型對訓練它們的出版商和記者構成了“生存威脅”。新解密的記錄還詳細說明了這些公司如何繞過付費牆而不被察覺地訪問和利用這些內容,透過大規模抓取構建訓練資料集,並故意從資料中刪除版權宣告。需要注意的是,這些新資訊大多來自《紐約時報》自身的法律簡報,而非仍處於保密狀態的原始證
相關專題推薦
評論 (0)
0/500
OpenAI 推出了 隱私過濾器(Privacy Filter),這是一款最先進的個人身份資訊(PII)匿名化模型。該工具現已在 Hugging Face 和 GitHub 上以 Apache 2.0 許可證 開放,為開發者提供了一種本地化、高度可定製的解決方案,以實現強大的隱私保護。
超越基於規則匹配的先進語義理解
與傳統的基於規則的工具不同,隱私過濾器利用深層語言理解能力,根據上下文準確識別非結構化文字中的敏感資料。這種方法在最大程度保留公共內容實用性的同時,有效地隱藏了私人資訊。

輕量級 MoE 架構,實現卓越效率
該模型的技術設計兼顧了靈活性與效能:
混合專家(MoE)設計: 總引數量為 15 億,但每次推理僅啟用約 5000 萬 個引數。這種高效性使得該模型能夠在資源受限的邊緣裝置上流暢執行,包括膝上型電腦和網頁瀏覽器。
擴充套件上下文支援: 該模型擁有 128,000 Token 的上下文視窗,採用雙向 Token 分類架構結合受限維特比演算法,確保在處理長文件時的準確性和連貫性。
高精度識別: 在更新的 PII-Masking-300k 基準測試中,該模型取得了 97.43% 的 F1 分數,召回率高達 98.08%。
全面的隱私分類系統
隱私過濾器能夠準確識別並標記八類核心敏感資訊:
基本身份資訊: 姓名、地址、電子郵件地址和電話號碼。
線上資產: URL 連結。
財務安全: 賬戶詳情,包括銀行和信用卡號碼。
機密憑證: 密碼和 API 金鑰。
時效性資訊: 日期資訊。
應用場景:雲大語言模型的“本地防火牆”
OpenAI 將該工具定位為 預過濾層。透過在將文字傳送至基於雲的大語言模型之前,在本地進行 PII 檢測和匿名化處理,這種“資料留在裝置上”的策略顯著降低了使用者無意中向 AI 服務暴露私人資訊的風險。
NewCore 籌集 6600 萬美元,為 AI 代理配備身份,使其逐步承擔員工角色
網路安全初創公司 NewCore 正式結束低調運營期,於週一宣佈獲得 6600 萬美元融資。該公司旨在解決一個許多組織在整合 AI 智慧體時將面臨的嚴峻挑戰:如何大規模地對這些數字員工進行身份認證、治理和控制。本輪種子輪融資由專注於網路安全的風險投資公司 Cyberstarts 領投,Index Ventures 和 Evolution Equity Partners 等機構跟投。融資完成後,NewCore 的估值達到 3 億美元。各組織越來越將 AI 智慧體視為職場中的活躍參與者,而非僅僅
微軟與 Mistral 簽署價值數十億美元的歐洲人工智慧合作協議
此次合作的核心是一項價值數十億美元的協議,旨在強化全歐洲的人工智慧基礎設施。圖片來源:微軟微軟與法國領先的人工智慧公司 Mistral 共同宣布了一項價值數十億美元的合作夥伴關係,旨在強化歐洲的人工智慧生態系。微軟與法國先進大型語言模型開發商 Mistral 宣布達成一項新協議,旨在擴展歐洲境內的人工智慧基礎設施。這項協議標誌著雙方現有合作關係的重大擴展,同時也將使 Mistral 的人工智慧模型
微軟高管稱AI資料抓取是“歷史上最大的勞動盜竊”,未經刪減的檔案顯示
紐約時報針對OpenAI和微軟提起的為期三年的版權訴訟中解密的檔案顯示,一家公司承認AI抓取構成盜竊,並對媒體機構構成嚴重威脅。根據訴訟檔案,微軟的一位高管私下將公司的AI訓練方法稱為“盜竊”,而OpenAI的領導層承認,其模型對訓練它們的出版商和記者構成了“生存威脅”。新解密的記錄還詳細說明了這些公司如何繞過付費牆而不被察覺地訪問和利用這些內容,透過大規模抓取構建訓練資料集,並故意從資料中刪除版權宣告。需要注意的是,這些新資訊大多來自《紐約時報》自身的法律簡報,而非仍處於保密狀態的原始證





首頁






