選項
首頁
新聞
研究主管呼籲科技界追蹤人工智慧推理過程

研究主管呼籲科技界追蹤人工智慧推理過程

2025-11-17
78

研究主管呼籲科技界追蹤人工智慧推理過程

來自 OpenAI、Google DeepMind、Anthropic 以及眾多公司和非營利組織的 AI 研究人員,在週二發表的一份立場書中,主張深入探索監控 AI 推理模型的所謂思考過程。

人工智能推理模型(如 OpenAI 的 o3 和 DeepSeek 的 R1)的一個特點是使用思維鏈(或稱 CoT),這是一個外部化過程,人工智能模型在此過程中系統性地解決問題,就像人類使用刮紙解決複雜的數學方程式一樣。推理模型是驅動 AI 代理的基本要素,本文作者認為,監控 CoT 可能會成為一種重要的方法,讓能力越來越強、範圍越來越廣的 AI 代理受到控制。

"研究人員在論文中指出:「CoT 監控為尖端 AI 的安全規範提供了寶貴的強化,提供了一扇獨特的窗戶,讓人得以瞭解 AI 代理如何做出決策。"然而,我們無法確定這種能見度是否會持續下去。我們敦促研究界和前沿 AI 開發人員最大限度地發揮 CoT 可監控性的優勢,並研究如何保護它。"

這份立場書敦促領先的 AI 開發人員調查是什麼讓 CoT 具備「可監控性」--具體來說,是哪些因素增強或減弱了 AI 模型如何真正產生答案的透明度。作者指出,雖然 CoT 監控是了解 AI 推理模型的一個很有前途的方法,但它仍然很脆弱,他們提醒不要做任何可能降低其透明度或可靠性的改變。

此外,作者還呼籲 AI 開發人員持續追蹤 CoT 可監控性,並探討如何最終將此方法實作為安全措施。

這份論文的主要簽署人包括 OpenAI 的首席研究官 Mark Chen、Safe Superintelligence 執行長 Ilya Sutskever、諾貝爾獎得主 Geoffrey Hinton、Google DeepMind 共同創辦人 Shane Legg、xAI 安全顧問 Dan Hendrycks,以及 Thinking Machines 共同創辦人 John Schulman。主要作者包括來自英國人工智慧安全研究所 (UK AI Security Institute) 和阿波羅研究中心 (Apollo Research) 的代表,以及來自 METR、亞馬遜 (Amazon)、Meta 和加州大學柏克萊分校 (UC Berkeley) 的其他署名者。

這份論文代表許多人工智慧產業的頂尖領導者為加速人工智慧安全研究的共同努力。目前科技公司之間競爭激烈,促使 Meta 以數百萬美元的條件,從 OpenAI、Google DeepMind 和 Anthropic 招募頂尖研究人員。其中最炙手可熱的研究人員是那些專門研究 AI 代理和推理模型的研究人員。

Techcrunch 活動

現在直播!TechCrunch 所有階段

更聰明地建立。擴充更快。更深入地聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。

TechCrunch All Stage 入場證可節省 450 美元

更聰明地建立。更快擴張。深入聯繫。與來自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等公司的創新者一起,參與充滿實用策略、沉浸式研討會和有意義的人際網路的一天。

馬薩諸塞州波士頓7月15日立即報名

"我們正處於一個關鍵時刻,我們擁有這種新的連鎖思考能力。它看起來非常有用,但如果不受到重點關注,它可能在幾年內就會消失,」參與論文的 OpenAI 研究員 Bowen Baker 在接受 TechCrunch 訪問時表示。「在我看来,发布这样一份立场文件是一种在为时已晚之前推动更多研究和关注这一主题的方式。」

OpenAI 在 2024 年 9 月首次發布了其初始 AI 推理模型 o1 的預覽。在之後的幾個月中,科技產業迅速推出了具有類似能力的競爭模型,其中一些來自 Google DeepMind、xAI 和 Anthropic 的模型展示了更先進的基準性能。

儘管如此,人們對於 AI 推理模型如何運作的瞭解仍然有限。雖然 AI 實驗室過去一年來在提升 AI 效能方面已取得重大進展,但這不一定會讓人們對其決策過程有更清楚的了解。

Anthropic 一直是瞭解 AI 模型如何運作的先驅 - 這個領域被稱為可解讀性(interpretability)。今年年初,首席執行官 Dario Amodei 承諾在 2027 年前揭開 AI 模型的「黑箱」,並增加對可解釋性的投資。他還鼓勵 OpenAI 和 Google DeepMind 進一步研究這個領域。

Anthropic 的早期研究顯示,CoTs 可能並非這些模型如何產生答案的完全可靠指標。與此同時,OpenAI 的研究人員也表示,CoT 監控最終可能成為追蹤 AI 模型一致性與安全性的可靠方法。

像這樣的立場書,目的在於提高人們對 CoT 監控等新興研究領域的認知,並吸引更多人的注意。OpenAI、Google DeepMind 和 Anthropic 等公司已經在這個領域進行研究,但這份出版物可能有助於刺激更多的資金和調查。

相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率 NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率 正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
寫作 適用於長篇寫作的 AI 文章大綱工具
適用於長篇寫作的 AI 文章大綱工具

2026 年最新、最受好評的長文寫作 AI 大綱工具!這份精選清單收錄了強大且具顛覆性的工具,能透過實際測試生成精準、結構化的大綱,大幅提升寫作效率。XIX.AI 正是這份菁英名單中的一員。 獲取免費版與付費版的比較指南,助您挑選最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
評論 (1)
0/500
KevinPerez
KevinPerez 2026-02-28 10:00:44

Interesting! Making AI's 'thoughts' transparent could help build trust, but who gets to decide what's considered a 'reasonable' reasoning process? Feels like a crucial step, though the implementation details will be the real challenge. Hope it leads to practical tools, not just more guidelines. 🤔

OR