OpenAI 在開發過程中整合了用於保障青少年安全的開源工具

週二,OpenAI 宣布推出一套提示語,旨在協助開發者讓其應用程式對青少年更安全。該人工智慧實驗室表示,這些青少年安全政策與其開放權重安全模型 gpt-oss-safeguard 相容。
開發者無需從頭開始研究如何提升青少年的人工智慧安全,而是可以利用這些提示來強化其應用程式。這些提示針對的關注點包括:血腥暴力與色情內容、有害的身體形象理想與行為、高風險活動與挑戰、浪漫或暴力的角色扮演情境,以及受年齡限制的產品與服務。
這些安全政策以提示詞形式設計,確保其不僅能與 GPT-OSS-Safeguard 模型無縫整合,更能輕鬆應用於其他模型,儘管在 OpenAI 的自有生態系統中效果可能最為顯著。
OpenAI 表示,其與 AI 安全組織 Common Sense Media 及 everyone.ai 合作開發了這些提示語。
「這些基於提示詞的政策有助於在整個生態系統中建立有意義的安全基準。由於它們是開源的,因此可以隨著時間推移進行調整和增強,」Common Sense Media 的 AI 與數位評估主管 Robbie Torney 在一份聲明中表示。
OpenAI 在其部落格中指出,開發者(包括經驗豐富的團隊)經常難以將安全目標轉化為精確且可執行的規則。
「這可能導致防護漏洞、執法不一致,或過濾範圍過於寬泛,」該公司解釋道。「清晰且定義明確的政策,是有效安全系統的關鍵基礎。」
OpenAI 承認,這些政策並非解決 AI 安全複雜挑戰的完整方案。然而,它們是在先前努力的基礎上建立的,包括家長控制和年齡預測等產品層級的防護措施。去年,OpenAI 更新了其大型語言模型指南(稱為 Model Spec),以規範其 AI 模型應如何與 18 歲以下使用者互動。
然而,OpenAI 自身也並非毫無瑕疵。該公司正面臨多起訴訟,原告皆為因過度使用 ChatGPT 而自殺身亡者的家屬。這類有害的互動往往發生在用戶繞過聊天機器人的安全防護機制之後,且沒有任何模型的防護措施是完全無懈可擊的。儘管如此,這些新政策仍代表著向前邁進的一步,特別是在協助獨立開發者方面。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (1)
0/500

週二,OpenAI 宣布推出一套提示語,旨在協助開發者讓其應用程式對青少年更安全。該人工智慧實驗室表示,這些青少年安全政策與其開放權重安全模型 gpt-oss-safeguard 相容。
開發者無需從頭開始研究如何提升青少年的人工智慧安全,而是可以利用這些提示來強化其應用程式。這些提示針對的關注點包括:血腥暴力與色情內容、有害的身體形象理想與行為、高風險活動與挑戰、浪漫或暴力的角色扮演情境,以及受年齡限制的產品與服務。
這些安全政策以提示詞形式設計,確保其不僅能與 GPT-OSS-Safeguard 模型無縫整合,更能輕鬆應用於其他模型,儘管在 OpenAI 的自有生態系統中效果可能最為顯著。
OpenAI 表示,其與 AI 安全組織 Common Sense Media 及 everyone.ai 合作開發了這些提示語。
「這些基於提示詞的政策有助於在整個生態系統中建立有意義的安全基準。由於它們是開源的,因此可以隨著時間推移進行調整和增強,」Common Sense Media 的 AI 與數位評估主管 Robbie Torney 在一份聲明中表示。
OpenAI 在其部落格中指出,開發者(包括經驗豐富的團隊)經常難以將安全目標轉化為精確且可執行的規則。
「這可能導致防護漏洞、執法不一致,或過濾範圍過於寬泛,」該公司解釋道。「清晰且定義明確的政策,是有效安全系統的關鍵基礎。」
OpenAI 承認,這些政策並非解決 AI 安全複雜挑戰的完整方案。然而,它們是在先前努力的基礎上建立的,包括家長控制和年齡預測等產品層級的防護措施。去年,OpenAI 更新了其大型語言模型指南(稱為 Model Spec),以規範其 AI 模型應如何與 18 歲以下使用者互動。
然而,OpenAI 自身也並非毫無瑕疵。該公司正面臨多起訴訟,原告皆為因過度使用 ChatGPT 而自殺身亡者的家屬。這類有害的互動往往發生在用戶繞過聊天機器人的安全防護機制之後,且沒有任何模型的防護措施是完全無懈可擊的。儘管如此,這些新政策仍代表著向前邁進的一步,特別是在協助獨立開發者方面。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。





首頁






