AI Index Report 2025

AI 在醫學裡不再只是實驗室好奇心的一年

AI 指數 2025 第 5 章由 RAISE Health(史丹佛醫學院與 HAI 的合作計畫)撰寫,追蹤 AI 如何從基準分數走進醫院、蛋白質資料庫,以及諾貝爾獎的得獎理由。臨床知識基準已接近飽和,FDA 核准數垂直起飛,倫理研究文獻則在後頭急起直追。先看數字:

2232023 年 FDA 核准的 AI 醫療器材件數(2015 年為 6 件)
96% — o1 在 MedQA 臨床基準的新最佳成績
1,0312024 年醫學 AI 倫理論文數(2020 年為 288 篇)
5372024 年提及 AI 的臨床試驗數(2014 年為 5 件)
98億參數的 ESM3(單位:十億),以 27.8 億條蛋白質序列訓練
22024 年因 AI 驅動突破而頒發的諾貝爾獎座數

5.1 與 5.2 — 生物學拿到了一件新儀器

2022 與 2023 年是 AI 驅動科學突破的早期階段。2024 年,這些工具終於大到、也開放到足以改變蛋白質科學實際的做法。

最受矚目的發布是 EvolutionaryScale 的 ESM3,以 27.8 億條蛋白質序列訓練、擁有 980 億參數。它最驚人的成果是 esmGFP,一種全新的人工綠色螢光蛋白 — 該公司估計大自然要花上約 5 億年的演化才生得出來,而這是透過人類主導的思維鏈提示生成的。較大的 ESM3 模型能解決的原子配位任務數是小模型的兩倍,而且模型已開源。

模型持續變大

這條趨勢線毫不含糊。ProGen(2020)有 12 億參數、ProtBert 有 4.2 億;ProGen2 與 ProtT5 於 2022 年問世,分別為 64 億與 12 億;ESM2 在 2023 年達到 150 億;ESM3 則在 2024 年衝上 980 億。每一次規模躍升都伴隨蛋白質預測準確度的提升 — 2024 年發布的 ESM C,在 CASP15 結構預測挑戰中拿出更好的成績。

四個值得記住的成果

  • AlphaProteo(Google DeepMind)為包含 VEGF-A(一種與癌症和糖尿病相關的蛋白質)在內的多個標靶,設計出首批蛋白質結合物。它的結合物比現有最佳設計方法強約 10 倍,其中部分估計效力可達 300 倍;對病毒蛋白 BHRF1,其設計的結合物有 88% 在濕實驗室測試中成功結合。
  • AlphaFold 3 把這個系列從蛋白質結構延伸到與 DNA、RNA、配體、抗體的交互作用。在蛋白質—配體對接上,它有 80.5% 的預測落在 2 Å RMSD 以內 — 若事先指定結合口袋則達 93.2%,相較之下 Vina 基準線只有 59.7%。
  • 史丹佛的虛擬 AI 實驗室 — 一個主持人模型、一個科學評論者,加上免疫學、計算生物學與機器學習三位專科代理人 — 自主設計出 92 個針對 SARS-CoV-2 的奈米抗體,其中超過 90% 在驗證中成功結合。
  • Google 的 Connectomics 團隊以突觸解析度重建了一立方毫米的人腦:超過 5,000 片、每片 30 奈米的切片,捕捉到約 57,000 個細胞與 1.5 億個突觸。

底下的資料庫

沒有公開資料,這一切都不成立。自 2021 年以來,主要的蛋白質科學資料庫大幅成長:UniProt 增加 31%、蛋白質資料庫(PDB)增加 23%,AlphaFold 資料庫則暴增 585%。這些基礎設施都很老 — PDB 可追溯到 1971 年,是生物科學界第一個開放取用的數位資源,Pfam 是 1995 年、STRING 是 2000 年、UniProt 是 2002 年 — 但如今推動成長的是 AI 生成的條目。在 2024 年的生物科學發表中,功能預測是最熱門的 AI 蛋白質研究主題,佔論文的 8.4%,其次是結構預測(7.6%)、蛋白質—藥物交互作用(3.0%),以及合成蛋白質設計(0.7%)。

顯微鏡領域走的是同一條曲線。以光學為基礎的顯微鏡基礎模型在 2024 年從 4 個倍增到 8 個;電子與螢光顯微鏡的基礎模型在 2023 年掛零,2024 年則各有 4 個問世。

5.6 — 基礎模型進入其他科學領域

2024 年有數十個科學基礎模型問世,有些是微調過的語言模型,有些則以氣象或原子尺度資料從頭訓練。以下是這一年重要發布的時序。

  1. 2024 年 2 月 6 日

    CrystalLLM — 材料科學

    研究者把 LLaMA-2 70B 在文字編碼的原子尺度資料上微調,用來生成穩定材料,達到領先擴散模型近兩倍的亞穩態率(49% 對 28%),同時維持結構在物理上的合理性。這個做法支援無條件生成、結構補洞與文字引導設計。

  2. 2024 年 2 月 14 日

    LlaSMol — 化學

    為了修補大型語言模型在化學任務上的糟糕表現,研究者建立了 SMolInstruct — 一個涵蓋 14 種任務、超過 300 萬筆樣本的資料集 — 並在上頭微調出一系列模型。以 Mistral 為底的 LlaSMol 大幅超越 GPT-4 與 Claude 3 Opus,而它只調整了 0.58% 的參數。

  3. 2024 年 4 月 23 日

    ORBIT — 地球科學

    橡樹嶺國家實驗室發布 ORBIT,一個 1,130 億參數的視覺 Transformer,是氣候科學史上最大的 AI 模型 — 比先前的模型大 1,000 倍。它以一種新的平行化技術訓練,在 Frontier 超級電腦上測試,持續運算效能達 1.6 exaFLOPS。

  4. 2024 年 5 月 20 日

    Aurora — 地球系統預報

    Aurora 是一個以超過一百萬小時地球系統資料訓練的大型基礎模型,在空氣品質、海浪、氣旋路徑與高解析度天氣預報上都達到最佳水準。它以傳統系統一小部分的運算成本勝過對方,而且只需極少資源就能跨領域微調。

  5. 2024 年 7 月 22 日

    NeuralGCM — 天氣與氣候

    一個把可微分的物理求解器與機器學習元件結合的混合模型。它在短期與中期預報上追平或超越領先的機器學習與物理模型,能跨數十年準確追蹤氣候指標,也能捕捉熱帶氣旋這類現象 — 而且運算成本大幅降低。

  6. 2024 年 8 月 18 日

    PhysBERT — 物理學

    物理文獻對自然語言處理向來是硬骨頭,因為專業術語與複雜概念太多。PhysBERT 是第一個物理專用的文字嵌入模型,以 120 萬篇 arXiv 論文訓練並用監督式資料微調,在資訊檢索等物理任務上勝過通用模型。

  7. 2024 年 9 月 16 日

    FireSat — 野火偵測

    Google 這套衛星野火偵測系統以 AI 分析即時影像與環境資料,能在起火後 20 分鐘內辨識出小至 5 公尺見方的火勢。它與 Earth Fire Alliance 及 Muon Space 共同開發,既改善災害應變,也推進全球野火研究。

  8. 2024 年 10 月

    兩座諾貝爾獎頒給 AI 驅動的研究

    Google DeepMind 的 Demis Hassabis 與 John Jumper 以 AlphaFold 在蛋白質摺疊上的開創性研究獲頒諾貝爾化學獎。John Hopfield 與 Geoffrey Hinton 則以對神經網路的奠基性貢獻獲頒諾貝爾物理獎。這是 AI 相關突破首度在兩個不同的科學領域同時摘下最高榮譽。

  9. 2024 年 12 月 4 日

    GenCast — 15 天天氣預報

    Google DeepMind 這個以擴散模型為基礎的天氣模型,能提供高準確度的 15 天預報,在幾乎所有指標上都勝過 ENS 等傳統系統,而且生成預報只要幾分鐘而非幾小時。應用範圍橫跨災害應變、再生能源與農業。

  10. 2024 年 12 月 9 日

    AlphaQubit 與 Willow — 量子運算

    Google DeepMind 與 Google Quantum AI 發布 AlphaQubit,一個具備最先進量子錯誤偵測能力的 AI 解碼器。緊接著推出的 Willow,是第一個在表面碼閾值以下達成指數級錯誤抑制的量子晶片。Willow 在不到五分鐘內完成一項基準任務,而最快的超級電腦要跑上超過 10 秭年 — 比已知宇宙的年齡還長。

FDA 核准的 AI 醫療器材件數,逐年

FDA 於 1995 年核准第一件 AI 醫療器材,接下來二十年,年核准數都停在個位數。之後曲線垂直起飛:2015 年 6 件,2023 年 223 件。

FDA 核准的 AI 醫療器材件數,逐年2015:6620152017:262620172019:808020192021:12912920212022:16016020222023:2232232023

5.3–5.5 — 比醫師強,但不擅長團隊合作

在臨床知識基準上,AI 基本上已經追上。但在更難的問題上 — 把大型語言模型交給醫師,醫師會不會變強;資料與倫理的基礎建設跟不跟得上 — 2024 年的證據讓人不太自在。

MedQA 於 2020 年推出,從專業醫師執照考試中取出超過 60,000 道臨床題目。OpenAI 的 o1 以 96.0% 創下新的最佳成績,比 2023 年最高分高出 5.8 個百分點,比 2022 年底的水準高出 28.4 個百分點。跟其他通識基準一樣,MedQA 現在看起來已接近飽和 — 報告把這視為該設計更難評測的訊號,而不是臨床能力的證明。

兩場隨機試驗,一個尷尬的發現

  • 在一場 2024 年的單盲隨機試驗中,50 位美國執照醫師處理複雜臨床案例,拿到 GPT-4 加傳統資源的醫師得分 76% — 僅略高於只用傳統資源的 74%。GPT-4 自己作答則得到 92%,比沒有輔助的醫師高出 16 個百分點,而且兩組在時間上都沒有省下什麼。
  • 一場 2024 至 2025 年、由 92 位醫師參與的隨機對照試驗,檢視的是「處置推理」而非診斷:治療決策、風險效益權衡、病人偏好。這次 GPT-4 輔助組確實贏過對照組約 6.5 個百分點 — 但 GPT-4 單獨作答仍與輔助組不相上下,而且被輔助的醫師每個案例花的時間還略長一些。
  • 兩場試驗指向同一件事:模型單獨表現優異,不會自動轉移到人機協作。要補上這道落差,是工作流程、訓練與介面設計的問題,不是模型能力的問題。

AI 真正被部署的地方:文書工作

這一年最明確的實戰勝利是「環境式 AI 抄寫員」 — 系統聆聽醫病對話並草擬病歷。北加州 Kaiser Permanente 在 2023 年底導入,試辦結束前已有數千名臨床人員採用。史丹佛針對一套完全整合、全自動抄寫系統的研究發現,醫師平均採用率 55%,每份病歷約省下 30 秒、每天減少約 20 分鐘的電子病歷時間,醫師自陳的負擔下降 35%、倦怠下降 26%。2024 年投入環境式抄寫技術的資金據報接近 3 億美元。

史丹佛醫療體系也在其 FURM(公平、有用、可靠、可衡量)框架下,全面導入一套 AI 周邊動脈疾病篩檢模型。它預計每年觸及約 1,400 位病人,且無需外部經費即可運作 — 在六個受評估的使用案例中,只有兩個一路走完全程,這是其中之一。

沒人解決的資料瓶頸

超過 80% 通過 FDA 認證的機器學習軟體是用來分析醫學影像的,但訓練資料集其實很小。癌症基因體圖譜(TCGA)是最完整的公開組織病理資料集之一,收錄 11,125 份病人樣本、涵蓋 32 種癌症;而當研究需要基因體或蛋白質體標註時,組織病理模型往往只能用不到 1,000 份樣本訓練。地理分布也很窄:用來訓練臨床機器學習演算法的美國世代研究,大多來自加州(22)、麻州(15)與紐約州(14),多數州則掛零。

跟通用 AI 相比,規模落差非常刺眼。GatorTron 是一個從非結構化病歷中擷取病人資訊的大型臨床語言模型,訓練用了 820 億個 token;Llama 3 則用了 15 兆個 — 將近 182 倍。影像端,RadImageNet 含有 1,600 萬個影像等值 token,DALL-E 約有 60 億個,約為 375 倍。MIMIC-CXR(377,000 張影像)與 CheXpert Plus(約 226,000 張 X 光片)都是重要資源,但跟 ImageNet 約 1,400 萬張影像相比仍然很小。

5.5 — 接著,倫理研究拿到錢了

AI 指數團隊為這一章對數千篇醫學倫理研究做了統合回顧。美國國衛院(NIH)給醫學 AI 倫理計畫的補助案,從 2023 財年的 25 件跳到 2024 財年的 337 件 — 而前三年分別只有 2、3、7 件。總經費是同樣的形狀,從 2023 年的 1,630 萬美元躍升到 2024 年的 2.76 億美元,一年之內成長近 17 倍。無論 2024 年還發生了什麼,這一年醫學 AI 倫理不再是沒錢的旁支話題。

這些文獻實際在談什麼

  • 2024 年最主要的兩個疑慮是偏誤與隱私,其後是公平性、透明度與信任。這個順序自 2020 年以來已經翻轉 — 當時隱私是更突出的主題,偏誤排在後面。
  • 工具的關注度嚴重傾斜。OpenAI 的 GPT 系列在 2024 年被 86 篇醫學 AI 倫理論文討論,高於 2023 年的 42 篇 — 這個關注度比 Google、Meta、Anthropic、Mistral、Cohere、xAI 的模型加起來還高出一個數量級。
  • 評測的興趣同步爆發。PubMed 上搜尋「large language model」自 2019 年起共有 1,566 篇論文,其中光是 2024 年就有 1,210 篇,而 2023 年是 353 篇。2024 年初一份針對自然語言處理在醫療任務表現的系統性回顧收錄了逾 500 篇論文,集中在醫學知識(419 篇)與診斷(178 篇)。

以合成資料繞開隱私問題

正因為真實資料稀少又敏感,2024 年的研究大量倚重合成資料。多項研究驗證它可用於保護隱私的臨床風險預測 — 以 ADSGAN、PATEGAN 與 DPGAN 對英國生物資料庫中的吸菸者建立肺癌風險模型,合成資料的分布與真實資料高度吻合。一篇《自然》研究用生成式影像模型在電腦中最佳化藥物配方,正確預測了口服錠劑中微晶纖維素的滲流閾值。而以合成資料增強、經過微調的分類器,在從病歷擷取健康的社會決定因素上勝過 ChatGPT 系列模型,同時對種族、族裔與性別描述詞的敏感度更低。

實際部署仍要走過少數幾家廠商。截至 2021 年,電子病歷的採用率約為 90%(任一系統)與 80%(認證系統);2023 年美國醫院協會的調查發現,預測模型的使用集中在 Epic、Cerner 與 Meditech 的體系 — 其中 Epic、Cerner 與 CPSI 的醫院多半使用廠商自建的模型。AI 化的醫療資訊系統能否觸及受限於寬頻與基礎設施的偏鄉與弱勢地區,仍是未解的問題。

醫學 AI 倫理論文數,2020–24

醫學 AI 的倫理議題已連續五年逐年升溫,從 2020 年的 288 篇論文成長四倍到 2024 年的 1,031 篇。2024 年被引用最多的疑慮是偏誤與隱私,其次是公平性 — 這跟 2020 年隱私排在偏誤之前的順序恰好相反。

醫學 AI 倫理論文數,2020–242020:28828820202021:39739720212022:52352320222023:67467420232024:103110312024

這一章回答的六個問題

容易被誤讀的幾項發現,附上數字。

AI 在醫學考試拿到 96%,代表它能行醫嗎?
不代表。MedQA 的題目來自專業醫師執照考試,o1 的 96.0% 確實是新紀錄 — 自 2022 年底以來進步 28.4 個百分點。但報告明確指出這個基準已接近飽和,意思是它再也分不出「好」與「極好」的模型。加州大學聖塔克魯茲分校、愛丁堡大學與 NIH 的研究者認為,單一問答基準無法反映真實臨床工作的複雜度,因此改以 19 個醫學資料集測試五個模型,涵蓋概念辨識、摘要、決策支援與醫學計算。幻覺與多語言表現不穩定的問題依然存在。
既然 GPT-4 贏過醫師,為什麼不直接用它就好?
因為在紙上案例贏過醫師,跟在診間裡實際運作是兩回事。在 2024 年的診斷試驗中,GPT-4 單獨作答拿到 92%,沒有輔助的醫師是 74% — 但拿到同一個模型的醫師只達到 76%,而且完成案例的時間沒有改變。瓶頸在整合:工作流程設計、使用者訓練與介面,而不是模型本身的能力。2024 至 2025 年的處置推理試驗確實測到 6.5 個百分點的真實增益,但被輔助的醫師速度較慢,研究者認為那是更深入思考、而非卡頓所致。
「AI 醫療器材」實際涵蓋什麼?
大多是影像。超過 80% 通過 FDA 認證的機器學習軟體是用來分析醫學影像的,而且這個領域仍由二維資料主導 — 胸部 X 光、組織病理切片、眼底攝影 — 這些卷積神經網路與 Transformer 都處理得不錯。往電腦斷層、磁振造影與 3D 組織病理等三維模態延伸的工作正在進行,但受限於資料:英國生物資料庫約 10 萬筆磁振造影、TCIA 約 5 萬件研究,已是最大的公開 3D 資料集,而公開的 3D 組織病理資料集則完全不存在。
醫學基礎模型是真有其事,還是行銷話術?
它們確實大量問世,而且相當專科化。2024 年推出了 Med-Gemini 這類通用多模態模型,也有專科模型:心臟超音波的 EchoCLIP、眼科的 VisionFM、放射科的 CheXagent 與 Merlin,病理科更是異常密集 — CHIEF、Prov-GigaPath、PathChat、TITAN、Virchow 與 UNI 全在同一年出現。它們能否推廣到訓練機構之外仍是未解問題;在本章列出的每一種建模路徑中,領域泛化與跨模態適應性都被列為長期挑戰。
醫學 AI 研究有多少發生在美國以外?
比例正在上升。提及 AI 的臨床試驗從 2014 年的 5 件成長到 2024 年的 537 件,而 2024 年由中國以 105 件領先,美國 97 件、義大利 42 件緊追在後。2020 年以來整體都是陡升 — 該年 249 件、2021 年 349 件、2022 年 396 件、2023 年 448 件 — COVID-19 疫情先是加速了 AI 在檢傷、資源配置與預後預測上的採用,之後這個領域才擴展到慢性病管理、術中支援與用藥安全。
最大的未解問題是什麼?
資料 — 它的規模、多樣性,以及它代表了誰。公開的組織病理世代資料很少超過 10,000 份病人樣本;縱貫性影像嚴重不足,ADNI 那約 2,000 位參與者、追蹤 15 年以上的規模是特例而非常態;而不同儀器、染色技術與機構之間的取像差異會帶來批次效應,小訓練集又會把它放大。本章提出的解方是保護隱私的資料共享(例如聯邦式學習)、合成資料生成,以及更好的標註策略 — 沒有一項已經解決。

用五句話看這一章

第 5 章「科學與醫學」的頭條發現。

FDA 在 1995 年核准第一件 AI 醫療器材。到 2015 年只有 6 件通過;到 2023 年已達 223 件。
— Chapter 5 · Science and Medicine
在診斷複雜臨床案例上,GPT-4 單獨作答的表現勝過醫師 — 無論醫師有沒有 AI 輔助。
— Chapter 5 · Science and Medicine
o1 在 MedQA 創下 96.0% 的新最佳成績 — 比 2022 年底高出 28.4 個百分點,已接近飽和到該換一個基準了。
— Chapter 5 · Science and Medicine
自 2021 年以來,AlphaFold 資料庫成長 585%、UniProt 成長 31%、蛋白質資料庫成長 23%。
— Chapter 5 · Science and Medicine
2024 年,AI 驅動的研究拿下兩座諾貝爾獎:化學獎頒給 AlphaFold 的蛋白質摺疊,物理獎頒給神經網路的奠基性貢獻。
— Chapter 5 · Science and Medicine

閱讀完整的科學與醫學章節

第 5 章(5.1–5.6 各節)連同所有圖表與引用,皆由史丹佛 HAI 免費提供。或回到報告重點與八大章節總覽。

前往 AI 指數報告 2025 →