跳至內容
AI 新聞站
返回

哈佛 study 中,AI 提供的急診診斷準確度高過兩名人類醫生

一項新研究探討大型語言模型在各種醫療情境中的表現,包括真實的急診室案例——其中至少有一個模型似乎比人類醫生更準確。這項研究本周發表於《科學》雜誌,由哈佛醫學院與貝斯以色列女執事醫療中心的醫師與電腦科學家組成的研究團隊發表。研究人員表示,他們進行了多種實驗,以測量 OpenAI 的模型與人類醫師的表現比較。其中一項實驗中,研究人員專注於76位進入貝斯以色列急診室的病患,將兩位內科主治醫師所提供的診斷與 OpenAI 的 o1 與 4o 模型所產生的診斷進行比較。這些診斷由另外兩位主治醫師評估,他們並不知道哪些診斷來自人類,哪些來自 AI。研究指出,「在每個診斷關鍵點,o1 的表現與兩位主治醫師以及 4o 模型相差不大或相當,」研究並補充說,差異「尤其是在第一個診斷關鍵點(初始急診分類)時特別明顯,此時關於病患的資訊最少,而做出正確決定的迫切性最高。」在哈佛醫學院關於這項研究的聲明中,研究人員強調他們「完全沒有預處理數據」——AI 模型接收到的資訊與每次診斷時電子病歷中可取得的資訊相同。在這些資訊下,o1 模型在67%的分類案例中提供了「完全或非常接近的診斷」,相較於其中一位醫師在55%的時間內提供正確或接近的診斷,另一位則在50%的時間內達到目標。研究聲明中,哈佛醫學院 AI 實驗室主任兼本研究的主要作者之一 Arjun Manrai 表示:「我們對 AI 模型進行了幾乎所有的測試,結果顯示它超越了先前的模型以及我們的醫師基準。」需要明確的是,這項研究並未聲稱 AI 雖然已經準備好在急診室做出影響生死的決定。相反,研究指出這些發現顯示出「迫切需要前瞻性試驗,以在真實的病人照護環境中評估這些技術。」研究人員也指出,他們僅研究了模型在接收到文字資訊時的表現,並提到「現有的研究顯示,目前的基礎模型在處理非文字輸入時的推理能力較為有限。」貝斯以色列的醫生 Adam Rodman,同時也是本研究的主要作者之一,警告《觀察家》雜誌目前「尚無正式的框架來確保 AI 診斷的責任歸屬」,並指出病人仍然「希望人類來引導他們做出生死攸關的決定,以及面對困難治療決定時的引導。」在一篇關於這項研究的部落格文章中,急診醫師 Kristen Panthagani 表示這是一項「有趣的 AI 研究,導致一些過度誇張的標題」,特別是因為這項研究比較的是 AI 診斷與內科醫師的診斷,而非急診室醫師的診斷。Panthagani 表示:「如果我們要比較 AI 工具與醫師的臨床能力,我們應該從比較實際從事該專科的醫師開始。」她也認為,「我並不驚訝一個大型語言模型可以在神經外科板考中擊敗皮膚科醫師,[但]這並不是一個特別有用的資訊。」她也指出,「作為一位急診室醫生,第一次見到病人時,我的首要目標並不是猜測病人的最終診斷,而是確定病人是否患有會致命的疾病。」本篇與標題已更新,反映這項研究中的診斷來自內科主治醫師,並包含 Kristen Panthagani 的評論。


分享這篇文章:

上一篇
This is fine」創作人表示AI新創公司盜用他的作品
下一篇
AI生成的演員與劇本現 ineligible 參加奧斯卡獎