研究主管呼籲科技界追蹤人工智慧推理過程

來自 OpenAI、Google DeepMind、Anthropic 以及眾多公司和非營利組織的 AI 研究人員,在週二發表的一份立場書中,主張深入探索監控 AI 推理模型的所謂思考過程。
人工智能推理模型(如 OpenAI 的 o3 和 DeepSeek 的 R1)的一個特點是使用思維鏈(或稱 CoT),這是一個外部化過程,人工智能模型在此過程中系統性地解決問題,就像人類使用刮紙解決複雜的數學方程式一樣。推理模型是驅動 AI 代理的基本要素,本文作者認為,監控 CoT 可能會成為一種重要的方法,讓能力越來越強、範圍越來越廣的 AI 代理受到控制。
"研究人員在論文中指出:「CoT 監控為尖端 AI 的安全規範提供了寶貴的強化,提供了一扇獨特的窗戶,讓人得以瞭解 AI 代理如何做出決策。"然而,我們無法確定這種能見度是否會持續下去。我們敦促研究界和前沿 AI 開發人員最大限度地發揮 CoT 可監控性的優勢,並研究如何保護它。"
這份立場書敦促領先的 AI 開發人員調查是什麼讓 CoT 具備「可監控性」--具體來說,是哪些因素增強或減弱了 AI 模型如何真正產生答案的透明度。作者指出,雖然 CoT 監控是了解 AI 推理模型的一個很有前途的方法,但它仍然很脆弱,他們提醒不要做任何可能降低其透明度或可靠性的改變。
此外,作者還呼籲 AI 開發人員持續追蹤 CoT 可監控性,並探討如何最終將此方法實作為安全措施。
這份論文的主要簽署人包括 OpenAI 的首席研究官 Mark Chen、Safe Superintelligence 執行長 Ilya Sutskever、諾貝爾獎得主 Geoffrey Hinton、Google DeepMind 共同創辦人 Shane Legg、xAI 安全顧問 Dan Hendrycks,以及 Thinking Machines 共同創辦人 John Schulman。主要作者包括來自英國人工智慧安全研究所 (UK AI Security Institute) 和阿波羅研究中心 (Apollo Research) 的代表,以及來自 METR、亞馬遜 (Amazon)、Meta 和加州大學柏克萊分校 (UC Berkeley) 的其他署名者。
這份論文代表許多人工智慧產業的頂尖領導者為加速人工智慧安全研究的共同努力。目前科技公司之間競爭激烈,促使 Meta 以數百萬美元的條件,從 OpenAI、Google DeepMind 和 Anthropic 招募頂尖研究人員。其中最炙手可熱的研究人員是那些專門研究 AI 代理和推理模型的研究人員。
Techcrunch 活動現在直播!TechCrunch 所有階段
更聰明地建立。擴充更快。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
TechCrunch All Stage 入場證可節省 450 美元
更聰明地建立。更快擴張。深入聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等公司的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
馬薩諸塞州波士頓7月15日立即報名"我們正處於一個關鍵時刻,我們擁有這種新的連鎖思考能力。它看起來非常有用,但如果不受到重點關注,它可能在幾年內就會消失,」參與論文的 OpenAI 研究員 Bowen Baker 在接受 TechCrunch 訪問時表示。「在我看来,发布这样一份立场文件是一种在为时已晚之前推动更多研究和关注这一主题的方式。」
OpenAI 在 2024 年 9 月首次發布了其初始 AI 推理模型 o1 的預覽。在之後的幾個月中,科技產業迅速推出了具有類似能力的競爭模型,其中一些來自 Google DeepMind、xAI 和 Anthropic 的模型展示了更先進的基準性能。
儘管如此,人們對於 AI 推理模型如何運作的瞭解仍然有限。雖然 AI 實驗室過去一年來在提升 AI 效能方面已取得重大進展,但這不一定會讓人們對其決策過程有更清楚的了解。
Anthropic 一直是瞭解 AI 模型如何運作的先驅 - 這個領域被稱為可解讀性(interpretability)。今年年初,首席執行官 Dario Amodei 承諾在 2027 年前揭開 AI 模型的「黑箱」,並增加對可解釋性的投資。他還鼓勵 OpenAI 和 Google DeepMind 進一步研究這個領域。
Anthropic 的早期研究顯示,CoTs 可能並非這些模型如何產生答案的完全可靠指標。與此同時,OpenAI 的研究人員也表示,CoT 監控最終可能成為追蹤 AI 模型一致性與安全性的可靠方法。
像這樣的立場書,目的在於提高人們對 CoT 監控等新興研究領域的認知,並吸引更多人的注意。OpenAI、Google DeepMind 和 Anthropic 等公司已經在這個領域進行研究,但這份出版物可能有助於刺激更多的資金和調查。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (1)
0/500

來自 OpenAI、Google DeepMind、Anthropic 以及眾多公司和非營利組織的 AI 研究人員,在週二發表的一份立場書中,主張深入探索監控 AI 推理模型的所謂思考過程。
人工智能推理模型(如 OpenAI 的 o3 和 DeepSeek 的 R1)的一個特點是使用思維鏈(或稱 CoT),這是一個外部化過程,人工智能模型在此過程中系統性地解決問題,就像人類使用刮紙解決複雜的數學方程式一樣。推理模型是驅動 AI 代理的基本要素,本文作者認為,監控 CoT 可能會成為一種重要的方法,讓能力越來越強、範圍越來越廣的 AI 代理受到控制。
"研究人員在論文中指出:「CoT 監控為尖端 AI 的安全規範提供了寶貴的強化,提供了一扇獨特的窗戶,讓人得以瞭解 AI 代理如何做出決策。"然而,我們無法確定這種能見度是否會持續下去。我們敦促研究界和前沿 AI 開發人員最大限度地發揮 CoT 可監控性的優勢,並研究如何保護它。"
這份立場書敦促領先的 AI 開發人員調查是什麼讓 CoT 具備「可監控性」--具體來說,是哪些因素增強或減弱了 AI 模型如何真正產生答案的透明度。作者指出,雖然 CoT 監控是了解 AI 推理模型的一個很有前途的方法,但它仍然很脆弱,他們提醒不要做任何可能降低其透明度或可靠性的改變。
此外,作者還呼籲 AI 開發人員持續追蹤 CoT 可監控性,並探討如何最終將此方法實作為安全措施。
這份論文的主要簽署人包括 OpenAI 的首席研究官 Mark Chen、Safe Superintelligence 執行長 Ilya Sutskever、諾貝爾獎得主 Geoffrey Hinton、Google DeepMind 共同創辦人 Shane Legg、xAI 安全顧問 Dan Hendrycks,以及 Thinking Machines 共同創辦人 John Schulman。主要作者包括來自英國人工智慧安全研究所 (UK AI Security Institute) 和阿波羅研究中心 (Apollo Research) 的代表,以及來自 METR、亞馬遜 (Amazon)、Meta 和加州大學柏克萊分校 (UC Berkeley) 的其他署名者。
這份論文代表許多人工智慧產業的頂尖領導者為加速人工智慧安全研究的共同努力。目前科技公司之間競爭激烈,促使 Meta 以數百萬美元的條件,從 OpenAI、Google DeepMind 和 Anthropic 招募頂尖研究人員。其中最炙手可熱的研究人員是那些專門研究 AI 代理和推理模型的研究人員。
Techcrunch 活動現在直播!TechCrunch 所有階段
更聰明地建立。擴充更快。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
TechCrunch All Stage 入場證可節省 450 美元
更聰明地建立。更快擴張。深入聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等公司的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。
馬薩諸塞州波士頓7月15日立即報名"我們正處於一個關鍵時刻,我們擁有這種新的連鎖思考能力。它看起來非常有用,但如果不受到重點關注,它可能在幾年內就會消失,」參與論文的 OpenAI 研究員 Bowen Baker 在接受 TechCrunch 訪問時表示。「在我看来,发布这样一份立场文件是一种在为时已晚之前推动更多研究和关注这一主题的方式。」
OpenAI 在 2024 年 9 月首次發布了其初始 AI 推理模型 o1 的預覽。在之後的幾個月中,科技產業迅速推出了具有類似能力的競爭模型,其中一些來自 Google DeepMind、xAI 和 Anthropic 的模型展示了更先進的基準性能。
儘管如此,人們對於 AI 推理模型如何運作的瞭解仍然有限。雖然 AI 實驗室過去一年來在提升 AI 效能方面已取得重大進展,但這不一定會讓人們對其決策過程有更清楚的了解。
Anthropic 一直是瞭解 AI 模型如何運作的先驅 - 這個領域被稱為可解讀性(interpretability)。今年年初,首席執行官 Dario Amodei 承諾在 2027 年前揭開 AI 模型的「黑箱」,並增加對可解釋性的投資。他還鼓勵 OpenAI 和 Google DeepMind 進一步研究這個領域。
Anthropic 的早期研究顯示,CoTs 可能並非這些模型如何產生答案的完全可靠指標。與此同時,OpenAI 的研究人員也表示,CoT 監控最終可能成為追蹤 AI 模型一致性與安全性的可靠方法。
像這樣的立場書,目的在於提高人們對 CoT 監控等新興研究領域的認知,並吸引更多人的注意。OpenAI、Google DeepMind 和 Anthropic 等公司已經在這個領域進行研究,但這份出版物可能有助於刺激更多的資金和調查。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。





首頁






