AI Index Report 2024

AI 成為科學家真的會拿起來用的儀器的那一年

第 5 章是 2024 年版新增的章節,AI 指數團隊設立它,是因為 AI 在科學與醫療發現中的角色愈來愈重。它談的是 2023 年:由強化學習發現、並被併入 C++ 標準函式庫的排序程式碼,220 萬個新晶體結構,一次評分完成的 7,100 萬個基因變異,還有一個在醫師執照考試基準上突破 90% 的語言模型。同時 FDA 的核准清單持續加長 — 但裡面仍然一件生成式 AI 都沒有。

1392022 年 FDA 核准的 AI 相關醫療器材件數(2021 年為 124 件)
90.2% — GPT-4 Medprompt 在 MedQA 的準確率,比 2022 年最佳成績高 22.6 個百分點
2.2GNoME 找出的新晶體結構數(單位:百萬)
71AlphaMissense 評估的錯義變異數(單位:百萬,其中 89% 完成分類)
50% — EVEscape 預測到的實際 SARS-CoV-2 突變比例(前一代模型為 24%)
10GraphCast 的全球天氣預報天數,一分鐘內就算完

5.1 — 六項成果,改寫了實驗室一週能做完的事

2022 年 AI 開始推進科學發現,2023 年則進入交付階段:演算法進了正式函式庫,材料進了資料庫,預報進了 80 多個國家。以下是 AI 指數指導委員會選出的六項里程碑。

AlphaDev — 更快的排序,而且進了標準函式庫

一個強化學習系統寫出比人類基準更短的排序程式碼 — 而且被併進了 LLVM 的 C++ 標準排序函式庫。

algorithms

FlexiCubes — 更貼近真實形狀的 3D 網格

Nvidia 以梯度為基礎的等值面萃取方法,把網格重建誤差(IN>5°)壓到 34.87%,最佳的 DMTet 版本則是 48.66%。

graphics

Synbot — 會自己收斂的機器人化學家

AI 規劃層、機器人控制層與實體實驗室串成一個回饋迴路:Synbot 在一個目標分子上做到 100% 轉化率,人類參考值是 85%。

chemistryrobotics

GraphCast — 一分鐘算出十天天氣

一個圖神經網路,在十日預報的技巧評估上,均方根誤差勝過業界最先進的 HRES 系統。

weather

GNoME — 220 萬個新晶體結構

Google 的圖網路在穩定晶體數量上勝過材料發現的領先方法 Materials Project,還找出人類研究者漏掉的結構。

materials

洪水預報 — 提前五天示警,用於 80 多國

Google 研究者做出能用在無測站流域的水文模型,在精確率與召回率上都追平或勝過 GloFAS。

climate

5.2 — 醫學拿到五件新工具,沒有一件是聊天機器人

AI 指數指導委員會從 2023 年挑出的醫療系統,做的其實是同一件事:把原本太雜訊、太慢或太貴而做不出來的量測,變成例行作業。

把已經存在的資料救回來

SynthSR 把一般的臨床腦部掃描轉成高解析度的 T1 加權影像 — 那是進階研究需要的格式,對比清楚、腦結構分明。這件事之所以重要,是因為掃描品質差異極大,而這種差異讓大量既有的臨床影像根本進不了研究。SynthSR 產出的影像與真實體積的相關係數,在受試者層級(n=41)於白質、皮質灰質、皮質下灰質、腦室、海馬迴與杏仁核之間落在 0.89 到 0.99;在單次掃描層級(n=435)則較低也較不平均,介於 0.60 到 0.99。

量測質譜儀量不到的東西

帕金森氏症與阿茲海默症的診斷,取決於能不能快速精準辨識生物標記。質譜儀與 ELISA 能定量蛋白質濃度,卻分辨不出結構狀態的變化 — 而疾病訊號往往就藏在那裡。2023 年的解法是 ImmunoSEIRA:把 AI 耦合的等離子體紅外線感測器(使用表面增強紅外吸收光譜)與免疫分析技術結合。在纖維化濃度從 0% 到 100% 的測試樣本中,深度神經網路預測的百分比與實際值高度吻合。

在病毒突變之前先預測它

預測病毒免疫逃逸的傳統做法,依賴即時的病毒株與抗體資料 — 而那正是疫情初期最缺、卻也最需要預測的時候。EVEscape 改以歷史序列加上生物物理與結構資訊訓練,因此不需要當下的病毒株資料就能評估逃逸。只用疫情前的資訊,它預測到 50.0% 實際發生的 SARS-CoV-2 突變;相較之下,握有疫情期間抗體與血清資料的實驗掃描是 46.2% 與 32.3%,前一代模型則只有 24%。

兩件人類幾乎還沒開始做的工作

  • Google DeepMind 的 AlphaMissense 預測了 7,100 萬個錯義變異的致病性 — 這類基因改變會損害蛋白質功能,可能導致包含癌症在內的多種疾病。它為其中 89% 完成分類:57% 可能良性、32% 可能致病、11% 無法確定。作為對照,人類標註者至今只確認過所有錯義突變中的 0.1%。
  • 人類泛基因體參考聯盟 — 來自 60 個機構的 119 位科學家 — 用 AI 建立了更具代表性的人類基因體圖譜。第一版草圖在 2000 年釋出、2022 年更新,但那次更新漏掉了血型之類的變異,對不同族裔祖源的涵蓋也不完整,導致某些族群的疾病偵測並不可靠。新版本標註的中位數達到蛋白質編碼基因 99.07%、蛋白質編碼轉錄本 99.42%、非編碼基因 98.16%、非編碼轉錄本 98.96%。

各方法預測到的實際 SARS-CoV-2 突變比例

EVEscape 只用了疫情前的序列、生物物理與結構資料,成績卻勝過握有疫情期間抗體與血清資料的實驗掃描。前一代模型只有 24%。

各方法預測到的實際 SARS-CoV-2 突變比例EVEscape:5050EVEscape後期實驗掃描:46.246.2後期實驗掃描早期實驗掃描:32.332.3早期實驗掃描前一代模型:2424前一代模型

臨床知識 — 執照考試 90 分,而且沒有微調

MedQA 本來應該是硬骨頭:超過 60,000 道取自專業醫師執照考試的題目,設計上就是要考倒醫師。2023 年有模型跨過 90% — 而讓它跨過去的方法是提示工程,不是訓練。

MedQA 於 2020 年推出,是評估 AI 臨床知識的標準測驗。模型在上面的表現進步驚人:2023 年最領先的系統 GPT-4 Medprompt 達到 90.2% 準確率,比 2022 年的最高分高出 22.6 個百分點。自這個基準問世以來,AI 在 MedQA 上的能力幾乎成長為三倍。

被推翻的那個假設

過去普遍認為,通用大型語言模型必須先用領域資料做大量微調,才有辦法處理專科醫學問題。微軟 2023 年底的研究推翻了這個假設。GPT-4 Medprompt 只靠提示工程引導 GPT-4 應付 MultiMedQA(由四個高難度醫學基準組成的測驗集),在選擇題部分超越 2022 年最強的 Flan-PaLM 540B — PubMedQA 高出 3.0 個百分點、MedMCQA 高出 21.5、MMLU 高出 16.2。它同時勝過當時最先進的 Med-PaLM 2,也是第一個在 MedQA 突破 90% 的系統。本章的結論是:提示工程是領域微調之外一條有潛力的路。

開源與閉源之間差了 20 分

GPT-4 Medprompt 是閉源的,權重並未對外開放。2023 年最強的開源醫學模型 MediTron-70B 在 MedQA 拿到 70.2% — 這是開源模型至今的最高分,比先前的開源最佳成績大有進步,也贏過 Llama 2 的 63.8%,但仍落後 Medprompt 20 分、落後 Med-PaLM 2 16 分。本章想講的不是這個差距很難看,而是:醫療 AI 唯有在能力能被廣泛取得時才發揮得了潛力,而現在最強的臨床知識鎖在不公開的權重後面。

選定模型在 MedQA 的準確率(%)

五個模型、兩個發布年份,一道清楚的分界:三個閉源模型在上,開源的在下。MediTron-70B 與 GPT-4 Medprompt 都是 2023 年 11 月發布。

選定模型在 MedQA 的準確率(%)Medprompt:90.290.2MedpromptMed-PaLM 2:86.286.2Med-PaLM 2MediTron-70B:70.270.2MediTron-70BMed-PaLM:67.267.2Med-PaLMLlama 2:63.863.8Llama 2

診斷與文書 — 真正量得出成效的地方

離開基準測試之後,2023 年的臨床研究問的是更窄的問題:不是模型懂不懂醫學,而是把它接進既有流程之後,醫院數得出來的結果會不會改變。

CoDoC — 知道什麼時候該讓路

AI 影像系統會漏掉臨床醫師抓得到的診斷,臨床醫師也會漏掉 AI 抓得到的。CoDoC(互補導向的臨床流程轉介)正是圍繞這個不對稱設計的:它判斷什麼時候該相信 AI、什麼時候該交回傳統臨床流程。在四個醫學資料集上,它的敏感度平均比臨床醫師高 4.5 個百分點、比單獨運作的 AI 模型高 6.5 個百分點;特異度則比臨床醫師高 2.7 個百分點、比單獨模型高 5.7 個百分點。它同時把臨床工作流程減少了 66%。

PANDA — 篩檢一種擅長躲藏的癌症

胰管腺癌通常被發現時已經無法手術,而對無症狀者做篩檢又很困難 — 盛行率低,偽陽性的代價卻很高。中國的研究團隊做出 PANDA 來偵測與分類胰臟病灶。在涵蓋 6,239 位病人的多中心驗證中,它的敏感度比放射科醫師平均值高 34.1%、特異度高 6.3%。在涵蓋 20,530 位病人的真實世界多情境測試中,它達到 92.9% 敏感度與 99.9% 特異度。

同一年的另外兩項結果

  • 一份針對乳房攝影影像 AI 演算法的統合回顧發現,只用乳房攝影影像預測未來的乳癌風險,準確度已可媲美甚至優於傳統的風險評估工具。
  • X-Raydar 與 X-Raydar-NLP 這兩個開源神經網路,分別以影像與自由文字報告分類胸部 X 光,表現達到與人類專家相當的水準,套用到外部資料集時也維持穩定。

MedAlign — 衡量無聊那一半的基準

MedQA 與 USMLE 這類知識型基準,量不到臨床醫師實際把時間花在哪:圍繞電子病歷的、資訊密集的行政工作。2023 年推出的 MedAlign 是第一個大規模以電子病歷為核心的基準 — 983 道問題與指令、303 份臨床醫師回答,取自七個醫學專科。在它上面測試,表現最好的是採用多步驟精修的 GPT-4 版本,正確率為 65.0%。這是 2023 年行政能力的誠實數字,比同一家族在 MedQA 上拿到的 90.2% 低了一大截。

FDA 核准的 AI 相關醫療器材件數,逐年

2022 年 139 件,比 2021 年增加 12.1%,是 2012 年的 45 倍以上。AI 指數的資料停在 2022 年,因為 FDA 最後一次更新清單是 2023 年 10 月,該年度並不完整。

FDA 核准的 AI 相關醫療器材件數,逐年2012:3320122016:181820162018:636320182020:10710720202021:12412420212022:1391392022

這一章回答的六個問題

最容易被過度解讀的幾項發現,附上數字。

MedQA 拿到 90.2%,代表 AI 能行醫嗎?
不代表,而且本章自己就提供了配重。MedQA 是超過 60,000 道取自專業醫師執照考試的選擇題 — 那確實是醫學知識,但是考試格式的知識。MedAlign 之所以被做出來,正是因為 MedQA、USMLE 這類基準量不到臨床醫師實際在電子病歷上處理的那些多樣又資訊密集的工作。在 MedAlign 上,表現最好的是採用多步驟精修的 GPT-4 版本,正確率為 65.0%。
FDA 核准的醫材裡,有跑大型語言模型的嗎?
沒有。截至 FDA 最後一次更新清單的 2023 年 10 月,它尚未核准任何使用生成式 AI 或以大型語言模型驅動的器材。2022 年那 139 件核准,主體是影像:其中 87.1% 是放射科器材,第二大的心血管科佔 7.2%。那條垂直上升的成長曲線與生成式 AI 熱潮,是兩個當時還沒交會的故事。
在科學領域,2023 年真的和 2022 年不一樣嗎?
本章的說法是:2022 年 AI 開始推進科學發現,2023 年則有更具份量的應用真正問世。判斷的依據是部署而不是發表 — AlphaDev 的程式碼被併入 LLVM 的 C++ 標準排序函式庫,那是該部分函式庫十多年來的第一次更新;洪水預報模型已開源,並實際用在 80 多個國家。GNoME 的 220 萬個晶體結構,則是其他研究者可以直接查詢的資料庫。
開源醫學模型落後多少?
在 2023 年底的 MedQA 上大約落後 20 個百分點。MediTron-70B 拿到 70.2%,是開源模型至今最高分;而閉源的 GPT-4 Medprompt 是 90.2%、Med-PaLM 2 是 86.2%。Llama 2 則是 63.8%。值得注意的是 Medprompt 與 MediTron-70B 同樣在 2023 年 11 月發布,所以這是同期比較,不是時間差造成的落後。
這些診斷系統會取代放射科醫師嗎?
兩項旗艦成果指向相反的方向。CoDoC 存在的目的,就是判斷什麼時候「不要」用 AI,而它的增益正來自兩者的結合:敏感度比臨床醫師高 4.5 個百分點、比單獨運作的 AI 高 6.5 個百分點,同時把臨床流程減少 66%。PANDA 確實直接勝過放射科醫師平均值 — 在 6,239 位病人的驗證中敏感度高出 34.1% — 但它的角色是篩檢一種目前根本沒有在做篩檢的癌症,那是補上缺口,不是取代誰。
相對於臨床,AI 在基礎生物學上做了什麼?
它在補上人工作業永遠補不完的覆蓋缺口。AlphaMissense 為 7,100 萬個錯義變異評分並分類了其中 89%,而人類標註者至今只確認過所有錯義突變的 0.1%。人類泛基因體參考聯盟 — 60 個機構的 119 位科學家 — 重建了基因體圖譜,讓 2000 年草圖與 2022 年更新中代表性不足的族群被納入,標註的中位數達到蛋白質編碼基因 99.07%、非編碼基因 98.16%。

用五句話看這一章

第 5 章「科學與醫療」的頭條發現。

2022 年,AI 開始推進科學發現。但 2023 年出現了更具份量的科學 AI 應用 — 從讓演算法排序更有效率的 AlphaDev,到加速材料發現流程的 GNoME。
— Chapter 5 · Science and Medicine
2023 年最突出的模型 GPT-4 Medprompt 達到 90.2% 的準確率,比 2022 年的最高分高出 22.6 個百分點。
— Chapter 5 · Science and Medicine
2022 年 FDA 核准了 139 件 AI 相關醫療器材,比 2021 年增加 12.1%。自 2012 年以來,FDA 核准的 AI 相關醫材數量成長超過 45 倍。
— Chapter 5 · Science and Medicine
截至 2023 年 10 月,FDA 尚未核准任何使用生成式 AI 或以大型語言模型驅動的醫療器材。
— Chapter 5 · Science and Medicine
在 7,100 萬個可能的錯義變異中,AlphaMissense 分類了 89%。相較之下,人類標註者至今只能確認所有錯義突變中 0.1% 的性質。
— Chapter 5 · Science and Medicine

閱讀第 5 章原文

5.1 與 5.2 兩節連同所有圖表與引用,皆由史丹佛 HAI 免費提供。或回到報告重點與九大章節總覽。

開啟 AI 指數 2024 →