OpenAI 將加速發佈 AI 安全測試資料

OpenAI 正致力於更頻繁地公佈其內部 AI 模型的安全評估結果,並將此視為邁向更大透明度的一步。
該公司於本週三推出安全評估中心 (Safety Evaluations Hub),這是一個專用網頁,顯示其模型在有害內容生成、越獄敏感性和幻覺傾向等測試中的表現。OpenAI 表示將使用此平台定期分享指標,並計劃在每次主要模型發佈時更新。
介紹安全評估集線器--探索我們模型安全結果的資源。
雖然系統卡在發佈時會分享安全指標,但集線器會定期更新,作為我們主動溝通安全問題的努力的一部分。https://t.co/c8NgmXlC2Y-
OpenAI (@OpenAI) May 14, 2025
「隨著人工智能評估科學的進步,我們的目標是分享開發更多可擴展方法的進展,以衡量模型能力和安全性,」OpenAI 在一篇博客文章中解釋道。「透過公開分享我們精選的安全評估結果,我們的目標是讓追蹤 OpenAI 系統隨時間演進的安全績效變得更容易,並支援更廣泛的社群努力,以提高整個 AI 領域的透明度。」
該公司補充說,未來可能會在集線器上加入更多的評估類型。
最近,OpenAI 面臨一些倫理學家的批評,指稱其加速了某些旗艦機型的安全測試,並未公佈其他機型的技術報告。執行長 Sam Altman 在 2023 年 11 月被臨時撤職前,也被指控在機型安全審查方面誤導 OpenAI 高階主管。
上個月,OpenAI 不得不撤回對 ChatGPT 預設模型 GPT-4o 的更新,因為使用者反映它的回應過於認同和驗證。社交媒體平台 X 湧現了大量截圖,顯示 ChatGPT 為各種有問題、危險的決策和想法背書。
OpenAI 表示將實施多項修補措施以防止類似事件發生,包括針對某些模型推出選擇性加入的「alpha 階段」,允許特定的 ChatGPT 使用者在更廣泛推出之前進行測試並給予回饋。
Techcrunch 活動參加 TechCrunch Sessions:人工智能
確保您的門票能參加我們首屈一指的 AI 產業活動,講者來自 OpenAI、Anthropic 和 Cohere。在有限的時間內,只需 $292 即可參加一整天的專家講座、研討會和強大的人際網路。
參加 TechCrunch Sessions:人工智能
確保您在 TechCrunch Sessions: AI 的展出空間:向 1,200 多位決策者展示您的創新成果,而無需龐大的預算。此優惠期至 5 月 9 日,售完即止。
加州柏克萊市 | 6月5日 立即報名
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (0)
0/500

OpenAI 正致力於更頻繁地公佈其內部 AI 模型的安全評估結果,並將此視為邁向更大透明度的一步。
該公司於本週三推出安全評估中心 (Safety Evaluations Hub),這是一個專用網頁,顯示其模型在有害內容生成、越獄敏感性和幻覺傾向等測試中的表現。OpenAI 表示將使用此平台定期分享指標,並計劃在每次主要模型發佈時更新。
介紹安全評估集線器--探索我們模型安全結果的資源。
OpenAI (@OpenAI) May 14, 2025
雖然系統卡在發佈時會分享安全指標,但集線器會定期更新,作為我們主動溝通安全問題的努力的一部分。https://t.co/c8NgmXlC2Y-
「隨著人工智能評估科學的進步,我們的目標是分享開發更多可擴展方法的進展,以衡量模型能力和安全性,」OpenAI 在一篇博客文章中解釋道。「透過公開分享我們精選的安全評估結果,我們的目標是讓追蹤 OpenAI 系統隨時間演進的安全績效變得更容易,並支援更廣泛的社群努力,以提高整個 AI 領域的透明度。」
該公司補充說,未來可能會在集線器上加入更多的評估類型。
最近,OpenAI 面臨一些倫理學家的批評,指稱其加速了某些旗艦機型的安全測試,並未公佈其他機型的技術報告。執行長 Sam Altman 在 2023 年 11 月被臨時撤職前,也被指控在機型安全審查方面誤導 OpenAI 高階主管。
上個月,OpenAI 不得不撤回對 ChatGPT 預設模型 GPT-4o 的更新,因為使用者反映它的回應過於認同和驗證。社交媒體平台 X 湧現了大量截圖,顯示 ChatGPT 為各種有問題、危險的決策和想法背書。
OpenAI 表示將實施多項修補措施以防止類似事件發生,包括針對某些模型推出選擇性加入的「alpha 階段」,允許特定的 ChatGPT 使用者在更廣泛推出之前進行測試並給予回饋。
Techcrunch 活動參加 TechCrunch Sessions:人工智能
確保您的門票能參加我們首屈一指的 AI 產業活動,講者來自 OpenAI、Anthropic 和 Cohere。在有限的時間內,只需 $292 即可參加一整天的專家講座、研討會和強大的人際網路。
參加 TechCrunch Sessions:人工智能
確保您在 TechCrunch Sessions: AI 的展出空間:向 1,200 多位決策者展示您的創新成果,而無需龐大的預算。此優惠期至 5 月 9 日,售完即止。
加州柏克萊市 | 6月5日 立即報名
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。





首頁






