AI 醫學面臨的深層挑戰:生成式模型仍缺乏獨立的臨床推理能力

麻省總醫院 MESH Incubator 團隊最近的一項研究,評估了生成式人工智慧的臨床推理能力。儘管人工智慧正在醫學領域取得重大進展,但這項研究揭示了在模擬真實世界臨床診斷的邏輯鏈中仍存在持續性的缺口。這項發表於權威期刊《JAMA Network Open》的研究結果清楚表明,當前的主流模型尚不具備執行獨立臨床診斷任務的能力。
該研究選取29個已確立的臨床案例,對包括ChatGPT、DeepSeek、Claude、Gemini及Grok在內的21個大型語言模型進行測試。實驗透過逐步揭示患者症狀、實驗室數據及影像檢查結果,模擬了醫師動態的診斷過程。 數據顯示,當獲得完整資訊時,所有模型在提供正確最終診斷方面的準確度均超過90%。然而,在臨床推理的核心領域——鑑別診斷——超過80%的模型表現不佳,未能系統性地分析並優先排序多種潛在病症。
為量化此差距,研究人員引入了 PrIME-LLM 綜合評估指標,涵蓋從初步評估、檢查選擇到治療規劃的完整流程。各模型的評估分數介於 64% 至 78% 之間,凸顯出人工智慧在擁有完整資訊時更擅長「揭示答案」,而非在資料不完整的情況下進行開放式的邏輯推理。
儘管新版模型在處理複雜數據方面較前代有顯著進步,研究團隊仍強調,當前應將大型語言模型視為輔助工具。若在臨床實踐中未經專業監督便使用,仍存在風險。本研究為人工智慧在醫療保健領域的未來發展提供了理性基準:從簡單的「答案匹配」過渡到複雜的「邏輯推理」,將是醫療大型模型實現專業級應用的關鍵門檻。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500

麻省總醫院 MESH Incubator 團隊最近的一項研究,評估了生成式人工智慧的臨床推理能力。儘管人工智慧正在醫學領域取得重大進展,但這項研究揭示了在模擬真實世界臨床診斷的邏輯鏈中仍存在持續性的缺口。這項發表於權威期刊《JAMA Network Open》的研究結果清楚表明,當前的主流模型尚不具備執行獨立臨床診斷任務的能力。
該研究選取29個已確立的臨床案例,對包括ChatGPT、DeepSeek、Claude、Gemini及Grok在內的21個大型語言模型進行測試。實驗透過逐步揭示患者症狀、實驗室數據及影像檢查結果,模擬了醫師動態的診斷過程。 數據顯示,當獲得完整資訊時,所有模型在提供正確最終診斷方面的準確度均超過90%。然而,在臨床推理的核心領域——鑑別診斷——超過80%的模型表現不佳,未能系統性地分析並優先排序多種潛在病症。
為量化此差距,研究人員引入了 PrIME-LLM 綜合評估指標,涵蓋從初步評估、檢查選擇到治療規劃的完整流程。各模型的評估分數介於 64% 至 78% 之間,凸顯出人工智慧在擁有完整資訊時更擅長「揭示答案」,而非在資料不完整的情況下進行開放式的邏輯推理。
儘管新版模型在處理複雜數據方面較前代有顯著進步,研究團隊仍強調,當前應將大型語言模型視為輔助工具。若在臨床實踐中未經專業監督便使用,仍存在風險。本研究為人工智慧在醫療保健領域的未來發展提供了理性基準:從簡單的「答案匹配」過渡到複雜的「邏輯推理」,將是醫療大型模型實現專業級應用的關鍵門檻。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






