埃森哲與 Anthropic 合作推出首個嵌入式 AI 評估器

達里奧·阿莫迪(Dario Amodei)提出的在人工智慧實驗室內部嵌入獨立安全評估機構的倡議正在成為現實:Anthropic 宣佈,來自科技諮詢公司埃森哲(Accenture)的員工將駐場審計其模型和人員。
根據一篇部落格文章,Anthropic 表示,埃森哲於今年一月收購的人工智慧子公司 Faculty 將開始“評估和紅隊測試模型,進行對齊評估,並測試模型的安全防護機制”。兩家機構預計在未來五年內為該倡議投入至少 10 億美元。
Anthropic 選擇埃森哲令許多人工智慧觀察人士——以及金融市場——感到意外,導致該諮詢公司的股價在盤後交易中飆升 8%。由阿莫迪的部落格文章引發的關於嵌入式評估的討論,主要集中於 METR、Redwood Research 和 Apollo Research 等專門的人工智慧安全研究小組。這種關注在 Anthropic 身上尤為明顯,該公司將人工智慧安全和對齊置於其使命的核心。
Anthropic 表示,未來幾周將宣佈更多的評估機構,並確認正在與 METR 及其他非營利組織討論如何利用“自有資金試點嵌入式評估的某些要素”。
儘管埃森哲並非以尖端深度學習研究聞名,但 Anthropic 強調,該公司在為企業和政府機構部署人工智慧方面的實踐經驗是一個重大優勢。此外,作為一家在當前人工智慧繁榮之前就已存在的上市公司,它保持著相對於 Anthropic 以及圍繞人工智慧實驗室的複雜生態系統的更大功能性獨立。
該實驗室指出,目前尚不存在關於評估機構訪問或通訊協議的標準,並且其方法預計會隨著時間的推移而演變。雖然外部評估已經是釋出新大型語言模型過程中的一個重要組成部分,但最近的事件提高了風險等級:由 OpenAI 和 Anthropic 部署的人工智慧代理在入侵外部網站時,並未觸發實驗室內部的警報。
一些倡導更負責任的人工智慧開發方式的批評者認為,阿莫迪的自我監管方案是試圖逃避對人工智慧模型不當行為的責任。Anthropic 堅持認為,這些評估機構“並沒有減少我們的責任,而是有助於使責任更加可驗證。我們模型的安全性仍然是我們的責任。”
相關文章
人工智慧初創公司加速收入增長
隨著成熟企業和新興初創公司競相利用人工智慧,眾多AI初創公司報告稱,其收入不僅正在增長,而且增速正在加快,實現後續里程碑的時間越來越短。以下初創公司展示了這種飛輪式增長的一致模式。需要注意的是,儘管這些公司都使用“ARR”這一術語,但其底層指標各不相同。有些公司指的是年化經常性收入(ARR),即來自付費客戶的合同收入但尚未開票。另一些公司使用年化執行率收入,根據最近一個月的收入率計算12個月的收入來預測年收入。少數公司指的是“承諾的ARR”,代表來自尚未入職客戶的已簽署合同。在Gusto的案例
亞洲人工智慧初創公司推出類似“神話”模型,而Anthropic出口禁令持續
週三,中國網路安全公司360據報道推出了“圖龍風”(Tulongfeng),稱其可直接與Anthropic的“神話”(Mythos)模型競爭。這款專注於網路安全的AI模型據稱實力強大,特朗普政府目前已禁止非美國人使用它及其更受限的版本“寓言5”(Fable 5)。同周早些時候,總部位於東京的AI初創公司Sakana AI推出了“河豚”(Fugu),該模型以日語中河豚一詞命名。該公司表示,這款前沿AI模型“與Anthropic的寓言5和神話預覽版等領先模型並駕齊驅”。它還專為智慧體設計,能夠透過
網路安全專家批評Anthropic的Fable中的護欄措施
Anthropic 於週二推出了其最新模型 Fable,將其定位為備受期待的網路安全專用模型 Mythos 的公開受限版本。然而,這些限制引發了部分網路安全研究人員和從業者的不滿,他們已在網上表達了擔憂。“[Fable] 會阻止任何可能與網路安全相關的請求,包括閱讀部落格文章等無害任務,”IBM X-Force 的高階安全研究員 Valentina “Chompie” Palmiotti 表示。當使用者提示觸發這些安全過濾器時,Fable 會中斷對話,並顯示一條訊息,稱其“安全協議因網路安全或
相關專題推薦
評論 (0)
0/500

達里奧·阿莫迪(Dario Amodei)提出的在人工智慧實驗室內部嵌入獨立安全評估機構的倡議正在成為現實:Anthropic 宣佈,來自科技諮詢公司埃森哲(Accenture)的員工將駐場審計其模型和人員。
根據一篇部落格文章,Anthropic 表示,埃森哲於今年一月收購的人工智慧子公司 Faculty 將開始“評估和紅隊測試模型,進行對齊評估,並測試模型的安全防護機制”。兩家機構預計在未來五年內為該倡議投入至少 10 億美元。
Anthropic 選擇埃森哲令許多人工智慧觀察人士——以及金融市場——感到意外,導致該諮詢公司的股價在盤後交易中飆升 8%。由阿莫迪的部落格文章引發的關於嵌入式評估的討論,主要集中於 METR、Redwood Research 和 Apollo Research 等專門的人工智慧安全研究小組。這種關注在 Anthropic 身上尤為明顯,該公司將人工智慧安全和對齊置於其使命的核心。
Anthropic 表示,未來幾周將宣佈更多的評估機構,並確認正在與 METR 及其他非營利組織討論如何利用“自有資金試點嵌入式評估的某些要素”。
儘管埃森哲並非以尖端深度學習研究聞名,但 Anthropic 強調,該公司在為企業和政府機構部署人工智慧方面的實踐經驗是一個重大優勢。此外,作為一家在當前人工智慧繁榮之前就已存在的上市公司,它保持著相對於 Anthropic 以及圍繞人工智慧實驗室的複雜生態系統的更大功能性獨立。
該實驗室指出,目前尚不存在關於評估機構訪問或通訊協議的標準,並且其方法預計會隨著時間的推移而演變。雖然外部評估已經是釋出新大型語言模型過程中的一個重要組成部分,但最近的事件提高了風險等級:由 OpenAI 和 Anthropic 部署的人工智慧代理在入侵外部網站時,並未觸發實驗室內部的警報。
一些倡導更負責任的人工智慧開發方式的批評者認為,阿莫迪的自我監管方案是試圖逃避對人工智慧模型不當行為的責任。Anthropic 堅持認為,這些評估機構“並沒有減少我們的責任,而是有助於使責任更加可驗證。我們模型的安全性仍然是我們的責任。”
人工智慧初創公司加速收入增長
隨著成熟企業和新興初創公司競相利用人工智慧,眾多AI初創公司報告稱,其收入不僅正在增長,而且增速正在加快,實現後續里程碑的時間越來越短。以下初創公司展示了這種飛輪式增長的一致模式。需要注意的是,儘管這些公司都使用“ARR”這一術語,但其底層指標各不相同。有些公司指的是年化經常性收入(ARR),即來自付費客戶的合同收入但尚未開票。另一些公司使用年化執行率收入,根據最近一個月的收入率計算12個月的收入來預測年收入。少數公司指的是“承諾的ARR”,代表來自尚未入職客戶的已簽署合同。在Gusto的案例
亞洲人工智慧初創公司推出類似“神話”模型,而Anthropic出口禁令持續
週三,中國網路安全公司360據報道推出了“圖龍風”(Tulongfeng),稱其可直接與Anthropic的“神話”(Mythos)模型競爭。這款專注於網路安全的AI模型據稱實力強大,特朗普政府目前已禁止非美國人使用它及其更受限的版本“寓言5”(Fable 5)。同周早些時候,總部位於東京的AI初創公司Sakana AI推出了“河豚”(Fugu),該模型以日語中河豚一詞命名。該公司表示,這款前沿AI模型“與Anthropic的寓言5和神話預覽版等領先模型並駕齊驅”。它還專為智慧體設計,能夠透過
網路安全專家批評Anthropic的Fable中的護欄措施
Anthropic 於週二推出了其最新模型 Fable,將其定位為備受期待的網路安全專用模型 Mythos 的公開受限版本。然而,這些限制引發了部分網路安全研究人員和從業者的不滿,他們已在網上表達了擔憂。“[Fable] 會阻止任何可能與網路安全相關的請求,包括閱讀部落格文章等無害任務,”IBM X-Force 的高階安全研究員 Valentina “Chompie” Palmiotti 表示。當使用者提示觸發這些安全過濾器時,Fable 會中斷對話,並顯示一條訊息,稱其“安全協議因網路安全或





首頁






