AlphaDev — 更快的排序,而且進了標準函式庫
一個強化學習系統寫出比人類基準更短的排序程式碼 — 而且被併進了 LLVM 的 C++ 標準排序函式庫。
第 5 章是 2024 年版新增的章節,AI 指數團隊設立它,是因為 AI 在科學與醫療發現中的角色愈來愈重。它談的是 2023 年:由強化學習發現、並被併入 C++ 標準函式庫的排序程式碼,220 萬個新晶體結構,一次評分完成的 7,100 萬個基因變異,還有一個在醫師執照考試基準上突破 90% 的語言模型。同時 FDA 的核准清單持續加長 — 但裡面仍然一件生成式 AI 都沒有。
2022 年 AI 開始推進科學發現,2023 年則進入交付階段:演算法進了正式函式庫,材料進了資料庫,預報進了 80 多個國家。以下是 AI 指數指導委員會選出的六項里程碑。
一個強化學習系統寫出比人類基準更短的排序程式碼 — 而且被併進了 LLVM 的 C++ 標準排序函式庫。
Nvidia 以梯度為基礎的等值面萃取方法,把網格重建誤差(IN>5°)壓到 34.87%,最佳的 DMTet 版本則是 48.66%。
AI 規劃層、機器人控制層與實體實驗室串成一個回饋迴路:Synbot 在一個目標分子上做到 100% 轉化率,人類參考值是 85%。
一個圖神經網路,在十日預報的技巧評估上,均方根誤差勝過業界最先進的 HRES 系統。
Google 的圖網路在穩定晶體數量上勝過材料發現的領先方法 Materials Project,還找出人類研究者漏掉的結構。
Google 研究者做出能用在無測站流域的水文模型,在精確率與召回率上都追平或勝過 GloFAS。
AI 指數指導委員會從 2023 年挑出的醫療系統,做的其實是同一件事:把原本太雜訊、太慢或太貴而做不出來的量測,變成例行作業。
SynthSR 把一般的臨床腦部掃描轉成高解析度的 T1 加權影像 — 那是進階研究需要的格式,對比清楚、腦結構分明。這件事之所以重要,是因為掃描品質差異極大,而這種差異讓大量既有的臨床影像根本進不了研究。SynthSR 產出的影像與真實體積的相關係數,在受試者層級(n=41)於白質、皮質灰質、皮質下灰質、腦室、海馬迴與杏仁核之間落在 0.89 到 0.99;在單次掃描層級(n=435)則較低也較不平均,介於 0.60 到 0.99。
帕金森氏症與阿茲海默症的診斷,取決於能不能快速精準辨識生物標記。質譜儀與 ELISA 能定量蛋白質濃度,卻分辨不出結構狀態的變化 — 而疾病訊號往往就藏在那裡。2023 年的解法是 ImmunoSEIRA:把 AI 耦合的等離子體紅外線感測器(使用表面增強紅外吸收光譜)與免疫分析技術結合。在纖維化濃度從 0% 到 100% 的測試樣本中,深度神經網路預測的百分比與實際值高度吻合。
預測病毒免疫逃逸的傳統做法,依賴即時的病毒株與抗體資料 — 而那正是疫情初期最缺、卻也最需要預測的時候。EVEscape 改以歷史序列加上生物物理與結構資訊訓練,因此不需要當下的病毒株資料就能評估逃逸。只用疫情前的資訊,它預測到 50.0% 實際發生的 SARS-CoV-2 突變;相較之下,握有疫情期間抗體與血清資料的實驗掃描是 46.2% 與 32.3%,前一代模型則只有 24%。
MedQA 本來應該是硬骨頭:超過 60,000 道取自專業醫師執照考試的題目,設計上就是要考倒醫師。2023 年有模型跨過 90% — 而讓它跨過去的方法是提示工程,不是訓練。
MedQA 於 2020 年推出,是評估 AI 臨床知識的標準測驗。模型在上面的表現進步驚人:2023 年最領先的系統 GPT-4 Medprompt 達到 90.2% 準確率,比 2022 年的最高分高出 22.6 個百分點。自這個基準問世以來,AI 在 MedQA 上的能力幾乎成長為三倍。
過去普遍認為,通用大型語言模型必須先用領域資料做大量微調,才有辦法處理專科醫學問題。微軟 2023 年底的研究推翻了這個假設。GPT-4 Medprompt 只靠提示工程引導 GPT-4 應付 MultiMedQA(由四個高難度醫學基準組成的測驗集),在選擇題部分超越 2022 年最強的 Flan-PaLM 540B — PubMedQA 高出 3.0 個百分點、MedMCQA 高出 21.5、MMLU 高出 16.2。它同時勝過當時最先進的 Med-PaLM 2,也是第一個在 MedQA 突破 90% 的系統。本章的結論是:提示工程是領域微調之外一條有潛力的路。
GPT-4 Medprompt 是閉源的,權重並未對外開放。2023 年最強的開源醫學模型 MediTron-70B 在 MedQA 拿到 70.2% — 這是開源模型至今的最高分,比先前的開源最佳成績大有進步,也贏過 Llama 2 的 63.8%,但仍落後 Medprompt 20 分、落後 Med-PaLM 2 16 分。本章想講的不是這個差距很難看,而是:醫療 AI 唯有在能力能被廣泛取得時才發揮得了潛力,而現在最強的臨床知識鎖在不公開的權重後面。
離開基準測試之後,2023 年的臨床研究問的是更窄的問題:不是模型懂不懂醫學,而是把它接進既有流程之後,醫院數得出來的結果會不會改變。
AI 影像系統會漏掉臨床醫師抓得到的診斷,臨床醫師也會漏掉 AI 抓得到的。CoDoC(互補導向的臨床流程轉介)正是圍繞這個不對稱設計的:它判斷什麼時候該相信 AI、什麼時候該交回傳統臨床流程。在四個醫學資料集上,它的敏感度平均比臨床醫師高 4.5 個百分點、比單獨運作的 AI 模型高 6.5 個百分點;特異度則比臨床醫師高 2.7 個百分點、比單獨模型高 5.7 個百分點。它同時把臨床工作流程減少了 66%。
胰管腺癌通常被發現時已經無法手術,而對無症狀者做篩檢又很困難 — 盛行率低,偽陽性的代價卻很高。中國的研究團隊做出 PANDA 來偵測與分類胰臟病灶。在涵蓋 6,239 位病人的多中心驗證中,它的敏感度比放射科醫師平均值高 34.1%、特異度高 6.3%。在涵蓋 20,530 位病人的真實世界多情境測試中,它達到 92.9% 敏感度與 99.9% 特異度。
MedQA 與 USMLE 這類知識型基準,量不到臨床醫師實際把時間花在哪:圍繞電子病歷的、資訊密集的行政工作。2023 年推出的 MedAlign 是第一個大規模以電子病歷為核心的基準 — 983 道問題與指令、303 份臨床醫師回答,取自七個醫學專科。在它上面測試,表現最好的是採用多步驟精修的 GPT-4 版本,正確率為 65.0%。這是 2023 年行政能力的誠實數字,比同一家族在 MedQA 上拿到的 90.2% 低了一大截。
最容易被過度解讀的幾項發現,附上數字。
第 5 章「科學與醫療」的頭條發現。
2022 年,AI 開始推進科學發現。但 2023 年出現了更具份量的科學 AI 應用 — 從讓演算法排序更有效率的 AlphaDev,到加速材料發現流程的 GNoME。
2023 年最突出的模型 GPT-4 Medprompt 達到 90.2% 的準確率,比 2022 年的最高分高出 22.6 個百分點。
2022 年 FDA 核准了 139 件 AI 相關醫療器材,比 2021 年增加 12.1%。自 2012 年以來,FDA 核准的 AI 相關醫材數量成長超過 45 倍。
截至 2023 年 10 月,FDA 尚未核准任何使用生成式 AI 或以大型語言模型驅動的醫療器材。
在 7,100 萬個可能的錯義變異中,AlphaMissense 分類了 89%。相較之下,人類標註者至今只能確認所有錯義突變中 0.1% 的性質。