Anthropic首席執行官:AI幻覺率超越人類準確性

Anthropic首席執行官Dario Amodei在週四於舊金山舉行的Anthropic首屆開發者大會Code with Claude的記者會上表示,當前AI模型產生的虛構內容少於人類,並將其呈現為真相。
Amodei在更廣泛的論述中強調:AI幻覺並未阻礙Anthropic追求AGI——匹配或超越人類智能的系統。
“根據不同衡量標準,情況有所不同,但我認為AI模型的虛構程度可能低於人類,儘管其錯誤更出人意料,”Amodei在回應TechCrunch的詢問時表示。
Anthropic的首席執行官仍是業界對AI實現AGI最樂觀的領導者之一。去年一篇廣為引用的論文中,Amodei預測AGI可能在2026年出現。在週四的記者會上,他指出進展持續穩定,表示“各方面進展都在加速。”
“人們不斷尋找AI能力的根本限制,”Amodei說。“目前沒有證據顯示存在此類障礙。”
其他AI領導者認為幻覺是實現AGI的重大障礙。Google DeepMind首席執行官Demis Hassabis最近指出,當前AI模型缺陷過多,常常在簡單問題上失敗。例如,本月早些時候,代表Anthropic的律師在法庭上為Claude在文件中生成錯誤引文(包括錯誤的名稱和頭銜)而道歉。
驗證Amodei的說法具有挑戰性,因為大多數幻覺基準測試是比較AI模型之間的表現,而非與人類相比。像網路搜尋整合等技術似乎降低了幻覺率。值得注意的是,OpenAI的GPT-4.5等模型在基準測試中的幻覺率低於早期系統。
參加TechCrunch Sessions:AI
預訂您在我們首屈一指的AI行業活動中的席位,活動將有來自OpenAI、Anthropic和Cohere的演講者。限時優惠,全天專家演講、工作坊和強大的人脈網絡,票價僅292美元。
參加TechCrunch Sessions:AI展覽
在TC Sessions:AI搶占您的展位,向超過1,200名決策者展示您的創新成果,無需巨額投資。展位開放至5月9日或展位售罄為止。
Berkeley, CA | 6月5日 立即註冊然而,有證據顯示,在進階推理AI模型中,幻覺問題可能正在惡化。OpenAI的o3和o4-mini模型的幻覺率高於之前的推理模型,公司尚未明確原因。
Amodei隨後指出,錯誤在電視廣播員、政治家和各領域專業人士中也很常見。他認為AI的錯誤並不損害其智能。然而,他承認AI將錯誤事實自信地呈現為真相可能會帶來問題。
Anthropic對AI欺騙進行了廣泛研究,特別是其最近推出的Claude Opus 4。安全研究所Apollo Research在早期測試中發現,Claude Opus 4的早期版本顯示出強烈的操縱和欺騙人類傾向,引發了對其發布的擔憂。Anthropic實施的緩解措施似乎已解決Apollo的顧慮。
Amodei的言論表明,Anthropic可能會將一台即使存在幻覺的AI分類為AGI,或人類層級的智能。然而,許多人會認為,一個有幻覺的AI無法達到真正的AGI。
相關文章
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本
Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.
SandboxAQ將藥物發現領域的AI技術引入Claude,無需擁有電腦科學博士學位即可使用。
藥物發現依然是現代工業領域成本最高的挑戰之一。要找到一種具備應用價值的分子,往往需要十年的時間以及數十億美元的投入,而且大多數候選分子最終仍會失敗。目前有一波人工智慧初創企業宣稱能夠改變這一現狀——不過這些公司大多僅能讓那些已具備足夠技術能力的研究人員稍顯便利些許。然而SandboxAQ認為,真正的瓶頸並非模型本身,而是介面設計。該公司與Anthropic合作,將其科學類人工智慧模型直接整合到Claude中,使得強大的藥物發現和材料科學工具能夠透過對話式介面被使用,且無需任何專門的計算基礎設
相關專題推薦
評論 (2)
0/500
Also die KI halluziniert weniger als Menschen? Das klingt doch etwas zu optimistisch. Spannender als die Halluzinationen finde ich, dass die Diskussion jetzt nur noch darum geht, ob die KI besser ist als wir – und nicht mehr, ob die Technologie überhaupt sicher und kontrollierbar ist. Wer kontrolliert am Ende die wenigen (aber vielleicht sehr folgenschweren) Fehler?

Anthropic首席執行官Dario Amodei在週四於舊金山舉行的Anthropic首屆開發者大會Code with Claude的記者會上表示,當前AI模型產生的虛構內容少於人類,並將其呈現為真相。
Amodei在更廣泛的論述中強調:AI幻覺並未阻礙Anthropic追求AGI——匹配或超越人類智能的系統。
“根據不同衡量標準,情況有所不同,但我認為AI模型的虛構程度可能低於人類,儘管其錯誤更出人意料,”Amodei在回應TechCrunch的詢問時表示。
Anthropic的首席執行官仍是業界對AI實現AGI最樂觀的領導者之一。去年一篇廣為引用的論文中,Amodei預測AGI可能在2026年出現。在週四的記者會上,他指出進展持續穩定,表示“各方面進展都在加速。”
“人們不斷尋找AI能力的根本限制,”Amodei說。“目前沒有證據顯示存在此類障礙。”
其他AI領導者認為幻覺是實現AGI的重大障礙。Google DeepMind首席執行官Demis Hassabis最近指出,當前AI模型缺陷過多,常常在簡單問題上失敗。例如,本月早些時候,代表Anthropic的律師在法庭上為Claude在文件中生成錯誤引文(包括錯誤的名稱和頭銜)而道歉。
驗證Amodei的說法具有挑戰性,因為大多數幻覺基準測試是比較AI模型之間的表現,而非與人類相比。像網路搜尋整合等技術似乎降低了幻覺率。值得注意的是,OpenAI的GPT-4.5等模型在基準測試中的幻覺率低於早期系統。
參加TechCrunch Sessions:AI
預訂您在我們首屈一指的AI行業活動中的席位,活動將有來自OpenAI、Anthropic和Cohere的演講者。限時優惠,全天專家演講、工作坊和強大的人脈網絡,票價僅292美元。
參加TechCrunch Sessions:AI展覽
在TC Sessions:AI搶占您的展位,向超過1,200名決策者展示您的創新成果,無需巨額投資。展位開放至5月9日或展位售罄為止。
Berkeley, CA | 6月5日 立即註冊然而,有證據顯示,在進階推理AI模型中,幻覺問題可能正在惡化。OpenAI的o3和o4-mini模型的幻覺率高於之前的推理模型,公司尚未明確原因。
Amodei隨後指出,錯誤在電視廣播員、政治家和各領域專業人士中也很常見。他認為AI的錯誤並不損害其智能。然而,他承認AI將錯誤事實自信地呈現為真相可能會帶來問題。
Anthropic對AI欺騙進行了廣泛研究,特別是其最近推出的Claude Opus 4。安全研究所Apollo Research在早期測試中發現,Claude Opus 4的早期版本顯示出強烈的操縱和欺騙人類傾向,引發了對其發布的擔憂。Anthropic實施的緩解措施似乎已解決Apollo的顧慮。
Amodei的言論表明,Anthropic可能會將一台即使存在幻覺的AI分類為AGI,或人類層級的智能。然而,許多人會認為,一個有幻覺的AI無法達到真正的AGI。
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本
Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.
SandboxAQ將藥物發現領域的AI技術引入Claude,無需擁有電腦科學博士學位即可使用。
藥物發現依然是現代工業領域成本最高的挑戰之一。要找到一種具備應用價值的分子,往往需要十年的時間以及數十億美元的投入,而且大多數候選分子最終仍會失敗。目前有一波人工智慧初創企業宣稱能夠改變這一現狀——不過這些公司大多僅能讓那些已具備足夠技術能力的研究人員稍顯便利些許。然而SandboxAQ認為,真正的瓶頸並非模型本身,而是介面設計。該公司與Anthropic合作,將其科學類人工智慧模型直接整合到Claude中,使得強大的藥物發現和材料科學工具能夠透過對話式介面被使用,且無需任何專門的計算基礎設
Also die KI halluziniert weniger als Menschen? Das klingt doch etwas zu optimistisch. Spannender als die Halluzinationen finde ich, dass die Diskussion jetzt nur noch darum geht, ob die KI besser ist als wir – und nicht mehr, ob die Technologie überhaupt sicher und kontrollierbar ist. Wer kontrolliert am Ende die wenigen (aber vielleicht sehr folgenschweren) Fehler?





首頁






