華盛頓州立大學研究揭露 ChatGPT 在複雜科學判斷中的重大矛盾

華盛頓州立大學(WSU)最近的一項研究顯示,儘管 ChatGPT 回應時顯得信心十足,但其處理複雜科學陳述的方式卻近乎隨機猜測。這項研究不僅凸顯其準確性有限,還指出針對同一問題常會給出相互矛盾的答案。
梅蘇特·奇切克(Mesut Cicek)教授及其團隊從 2021 年以來發表的商業期刊中萃取了 719 項研究假設,並反覆將其提交給該模型進行真實性驗證。
儘管 ChatGPT 的表面準確度看似約為 80%,但在計入隨機猜測因素後,其實際表現僅比 50% 機率的擲硬幣結果高出約 60%。研究人員將此評定為「低 D 級分數」。 該模型在識別虛假陳述方面的表現尤為糟糕,僅能正確判斷16.4%的虛假命題。
研究人員將每個假設提交給模型十次,發現該模型難以維持一致的立場:
答案波動:約 73% 的案例中,該模型在十次重複測試中能維持一致的結論。
極端矛盾:在某些情況下,該模型會在「真」與「假」的答案之間交替變換,甚至出現極端情況——儘管使用完全相同的提示語,但一半結論為真,另一半卻為假。
該研究指出,使用者容易被 AI 流暢且具說服力的語言所誤導,但這並不代表其具備真正的推理能力。
缺乏真正的理解:該模型依賴記憶與模式匹配,有別於人類能真正理解世界及其所言之事。
版本進展有限:測試顯示,更新後的 ChatGPT‑5 mini(於 2025 年進行測試)在此特定任務上的表現與早期版本相仿,並無顯著改善。
基於這些發現,Cicek 建議企業管理者在做出複雜決策時應保持高度的懷疑態度。他們不應將生成式 AI 視為能取代專業判斷的「權威」,且必須手動驗證所有輸出結果。組織應加強培訓,協助員工理解 AI 工具的優勢與局限,避免因盲目信任而產生決策偏見。
這項研究再次提醒我們,儘管人工智慧發展迅速,但該技術在深度邏輯推理與證據評估方面的能力仍有待提升。
相關文章
如何修復核心網頁指標以提升 SEO 排名
頂級 AI 工具:將影片和音訊轉換為文字目錄:簡介Weet.io - 將影片轉換為文字YouTube 字幕與轉錄Figo.com - 最快的影片轉文字轉換工具Black Box - 影片轉文字轉換的截圖功能YouTube 簡短轉錄優點和 ### 缺點的影片轉文字轉換結論常見問題解答 (FAQs)其他資源文章:如何使用十大頂級工具將影片轉換為文字簡介在當今的數字環境中,將影片轉換為文字是內容創作者、作家、學生和專業人士的一項關鍵技能。無論您需要轉錄 YouTube 影片、提取關鍵見解,還是起草指令碼
廣州小鵬人形機器人工廠啟動試生產,目標2026年實現大規模量產
小鵬的人形機器人已在廣州工廠進入小批次試產階段。量產線目前正在進行最後的整合工作,標誌著全面製造倒計時的開始。此前,小鵬集團董事長兼執行長何小鵬兼任機器人業務“CEO”,負責監督並加速其商業化程序。根據機器人業務的內部動員計劃,公司目標是在2026年實現人形機器人的量產。自2027年起,這些機器人將逐步部署在小鵬的線下門店及其他商業場景中,承擔客戶引導和產品講解等服務角色。在技術和產業層面,小鵬機器人業務依託集團在硬體開發、AI大模型、供應鏈管理和市場營銷方面的核心優勢,系統性地將其在汽車業
馬斯克呼籲人工智慧巨頭交叉測試模型並邀請競爭對手批評
在9月15日的All-In峰會上,全球首富埃隆·馬斯克透過影片遠端出席。針對人工智慧,他敦促頂級AI公司在模型公開發布前相互交叉測試,並強調應儘快建立這樣的全球框架。馬斯克認為,為了促進行業自律並加快就AI安全協議達成共識,有必要採取“測試工具包”方法。他提議所有AI開發者使用各自的工具評估競爭對手的模型,共享新的架構以進行嚴格評估,從而識別潛在風險,包括協助開發生物或核武器,以及欺騙性行為。來自Hugging Face安全事件的教訓:高階模型將始終試圖規避限制引用Hugging Face
相關專題推薦
評論 (1)
0/500

華盛頓州立大學(WSU)最近的一項研究顯示,儘管 ChatGPT 回應時顯得信心十足,但其處理複雜科學陳述的方式卻近乎隨機猜測。這項研究不僅凸顯其準確性有限,還指出針對同一問題常會給出相互矛盾的答案。
梅蘇特·奇切克(Mesut Cicek)教授及其團隊從 2021 年以來發表的商業期刊中萃取了 719 項研究假設,並反覆將其提交給該模型進行真實性驗證。
儘管 ChatGPT 的表面準確度看似約為 80%,但在計入隨機猜測因素後,其實際表現僅比 50% 機率的擲硬幣結果高出約 60%。研究人員將此評定為「低 D 級分數」。 該模型在識別虛假陳述方面的表現尤為糟糕,僅能正確判斷16.4%的虛假命題。
研究人員將每個假設提交給模型十次,發現該模型難以維持一致的立場:
答案波動:約 73% 的案例中,該模型在十次重複測試中能維持一致的結論。
極端矛盾:在某些情況下,該模型會在「真」與「假」的答案之間交替變換,甚至出現極端情況——儘管使用完全相同的提示語,但一半結論為真,另一半卻為假。
該研究指出,使用者容易被 AI 流暢且具說服力的語言所誤導,但這並不代表其具備真正的推理能力。
缺乏真正的理解:該模型依賴記憶與模式匹配,有別於人類能真正理解世界及其所言之事。
版本進展有限:測試顯示,更新後的 ChatGPT‑5 mini(於 2025 年進行測試)在此特定任務上的表現與早期版本相仿,並無顯著改善。
基於這些發現,Cicek 建議企業管理者在做出複雜決策時應保持高度的懷疑態度。他們不應將生成式 AI 視為能取代專業判斷的「權威」,且必須手動驗證所有輸出結果。組織應加強培訓,協助員工理解 AI 工具的優勢與局限,避免因盲目信任而產生決策偏見。
這項研究再次提醒我們,儘管人工智慧發展迅速,但該技術在深度邏輯推理與證據評估方面的能力仍有待提升。
如何修復核心網頁指標以提升 SEO 排名
頂級 AI 工具:將影片和音訊轉換為文字目錄:簡介Weet.io - 將影片轉換為文字YouTube 字幕與轉錄Figo.com - 最快的影片轉文字轉換工具Black Box - 影片轉文字轉換的截圖功能YouTube 簡短轉錄優點和 ### 缺點的影片轉文字轉換結論常見問題解答 (FAQs)其他資源文章:如何使用十大頂級工具將影片轉換為文字簡介在當今的數字環境中,將影片轉換為文字是內容創作者、作家、學生和專業人士的一項關鍵技能。無論您需要轉錄 YouTube 影片、提取關鍵見解,還是起草指令碼
廣州小鵬人形機器人工廠啟動試生產,目標2026年實現大規模量產
小鵬的人形機器人已在廣州工廠進入小批次試產階段。量產線目前正在進行最後的整合工作,標誌著全面製造倒計時的開始。此前,小鵬集團董事長兼執行長何小鵬兼任機器人業務“CEO”,負責監督並加速其商業化程序。根據機器人業務的內部動員計劃,公司目標是在2026年實現人形機器人的量產。自2027年起,這些機器人將逐步部署在小鵬的線下門店及其他商業場景中,承擔客戶引導和產品講解等服務角色。在技術和產業層面,小鵬機器人業務依託集團在硬體開發、AI大模型、供應鏈管理和市場營銷方面的核心優勢,系統性地將其在汽車業
馬斯克呼籲人工智慧巨頭交叉測試模型並邀請競爭對手批評
在9月15日的All-In峰會上,全球首富埃隆·馬斯克透過影片遠端出席。針對人工智慧,他敦促頂級AI公司在模型公開發布前相互交叉測試,並強調應儘快建立這樣的全球框架。馬斯克認為,為了促進行業自律並加快就AI安全協議達成共識,有必要採取“測試工具包”方法。他提議所有AI開發者使用各自的工具評估競爭對手的模型,共享新的架構以進行嚴格評估,從而識別潛在風險,包括協助開發生物或核武器,以及欺騙性行為。來自Hugging Face安全事件的教訓:高階模型將始終試圖規避限制引用Hugging Face





首頁






