OpenAI延遲深入研究API整合
更新於東部時間下午4:11:OpenAI澄清其白皮書措辭有誤,暗示其說服研究與通過其API發布深度研究模型的決定有關。該公司已更新白皮書,明確其說服研究與發布深度研究模型的計劃無關。原文故事繼續如下:
OpenAI決定暫緩將其深度研究工具背後的AI模型整合到其開發者API中。他們採取這一步驟,以更好地理解AI影響人們行動和信念能力的相關風險。
在週三發布的白皮書中,OpenAI提到他們正在更新評估模型「現實世界說服風險」的方法,例如大規模傳播誤導資訊的潛在風險。
該公司指出,由於深度研究模型的運算成本高且處理速度較慢,不太適合用於大規模誤導或虛假資訊活動。然而,OpenAI計劃在決定是否將深度研究模型納入其API之前,調查AI如何可能量身定制有害的說服內容。
「在我們重新考慮說服方式的同時,我們僅在ChatGPT中部署此模型,而非API,」OpenAI表示。
越來越多人擔心AI可能被用於惡意傳播虛假或誤導資訊。例如,去年全球政治深偽內容迅速傳播。在台灣選舉日當天,一個與中國共產黨有關的團體發布了AI生成的誤導性音頻,顯示一名政治人物支持親中候選人。
AI也日益被用於社交工程攻擊。消費者因名人深偽推廣的詐騙投資計劃而上當,而企業則因深偽冒充者損失數百萬美元。
在白皮書中,OpenAI分享了深度研究模型說服力的多項測試結果。此模型是OpenAI最近宣布的o3「推理」模型的專業版本,針對網頁瀏覽和數據分析進行了優化。
在一項測試中,深度研究模型被要求撰寫說服性論點,表現超越了OpenAI迄今發布的所有其他模型,但未超過人類基準。在另一項測試中,該模型試圖說服另一模型(OpenAI的GPT-4o)進行支付,再次表現優於OpenAI其他可用模型。

深度研究模型在MakeMePay基準測試中的得分,該基準測試模型說服另一模型支付現金的能力。圖片來源:OpenAI 然而,深度研究模型並非在所有說服力測試中都表現出色。根據白皮書,它在說服GPT-4o透露代碼詞方面的效果不如GPT-4o本身。OpenAI表示,測試結果可能代表深度研究模型能力的「下限」。該公司指出:「額外的結構支持或改進的能力引導可能大幅提升觀察到的表現。」
我們已聯繫OpenAI以獲取更多詳情,若收到回應,將更新此文章。
與此同時,OpenAI的至少一名競爭對手並未退縮。Perplexity宣布在其Sonar開發者API中推出Deep Research,由中國AI實驗室DeepSeek的R1模型定制版本提供支持。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (41)
0/500
So they messed up the whitepaper wording and now have to clarify? Classic OpenAI move 🙃. Delaying the API for 'persuasion research' separate? Sounds like a convenient excuse to me. But hey, maybe they're actually being careful about misuse. Still, I was hoping to play with it soon...
Esto me preocupa un poco. Qué significa exactamente que su investigación en persuasión está 'separada' de la API? 🤔 Es una extraña coincidencia que el comunicado original sonara justo a lo que todos temían: que las IA puedan influir en el pensamiento. ¿Hay suficiente transparencia real en estos proyectos? Al menos corrigieron, pero deja mal sabor ese 'error' en el papel técnico.
Ces retards d'OpenAI montrent à quel point l'IA avancée devient un enjeu géopolitique. Les « maladresses » dans les communications officielles ne sont peut-être pas si accidentelles que ça... 😏 Cela me rappelle les débats sur le nucléaire au XXe siècle.
更新於東部時間下午4:11:OpenAI澄清其白皮書措辭有誤,暗示其說服研究與通過其API發布深度研究模型的決定有關。該公司已更新白皮書,明確其說服研究與發布深度研究模型的計劃無關。原文故事繼續如下:
OpenAI決定暫緩將其深度研究工具背後的AI模型整合到其開發者API中。他們採取這一步驟,以更好地理解AI影響人們行動和信念能力的相關風險。
在週三發布的白皮書中,OpenAI提到他們正在更新評估模型「現實世界說服風險」的方法,例如大規模傳播誤導資訊的潛在風險。
該公司指出,由於深度研究模型的運算成本高且處理速度較慢,不太適合用於大規模誤導或虛假資訊活動。然而,OpenAI計劃在決定是否將深度研究模型納入其API之前,調查AI如何可能量身定制有害的說服內容。
「在我們重新考慮說服方式的同時,我們僅在ChatGPT中部署此模型,而非API,」OpenAI表示。
越來越多人擔心AI可能被用於惡意傳播虛假或誤導資訊。例如,去年全球政治深偽內容迅速傳播。在台灣選舉日當天,一個與中國共產黨有關的團體發布了AI生成的誤導性音頻,顯示一名政治人物支持親中候選人。
AI也日益被用於社交工程攻擊。消費者因名人深偽推廣的詐騙投資計劃而上當,而企業則因深偽冒充者損失數百萬美元。
在白皮書中,OpenAI分享了深度研究模型說服力的多項測試結果。此模型是OpenAI最近宣布的o3「推理」模型的專業版本,針對網頁瀏覽和數據分析進行了優化。
在一項測試中,深度研究模型被要求撰寫說服性論點,表現超越了OpenAI迄今發布的所有其他模型,但未超過人類基準。在另一項測試中,該模型試圖說服另一模型(OpenAI的GPT-4o)進行支付,再次表現優於OpenAI其他可用模型。

OpenAI表示,測試結果可能代表深度研究模型能力的「下限」。該公司指出:「額外的結構支持或改進的能力引導可能大幅提升觀察到的表現。」
我們已聯繫OpenAI以獲取更多詳情,若收到回應,將更新此文章。
與此同時,OpenAI的至少一名競爭對手並未退縮。Perplexity宣布在其Sonar開發者API中推出Deep Research,由中國AI實驗室DeepSeek的R1模型定制版本提供支持。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
So they messed up the whitepaper wording and now have to clarify? Classic OpenAI move 🙃. Delaying the API for 'persuasion research' separate? Sounds like a convenient excuse to me. But hey, maybe they're actually being careful about misuse. Still, I was hoping to play with it soon...
Esto me preocupa un poco. Qué significa exactamente que su investigación en persuasión está 'separada' de la API? 🤔 Es una extraña coincidencia que el comunicado original sonara justo a lo que todos temían: que las IA puedan influir en el pensamiento. ¿Hay suficiente transparencia real en estos proyectos? Al menos corrigieron, pero deja mal sabor ese 'error' en el papel técnico.
Ces retards d'OpenAI montrent à quel point l'IA avancée devient un enjeu géopolitique. Les « maladresses » dans les communications officielles ne sont peut-être pas si accidentelles que ça... 😏 Cela me rappelle les débats sur le nucléaire au XXe siècle.





首頁






