AI Index Report 2026

AI 正衝刺取代整套科學工作流,可靠性仍是缺口

AI 指數 2026 第 5 章橫跨各門科學 — 從物理、化學、天文,到生物與地球科學,再到自主研究代理。2025 年,AI 不再只是改善單一流程步驟,而是邁向取代整套工作流;但嚴謹的基準仍揭露「看似合理的產出」與「可靠的科學」之間的巨大落差。先看數字:

80,1502025 年自然科學的 AI 論文數
26% 科學 AI 論文成長(2024→2025)
20% 前沿模型天文物理論文重現上限
39% PaperArena 最佳代理(博士基準 83.5%)
200百萬天體訓練 AION-1(天文首個基礎模型)
4分鐘:FourCastNet 3 跑完 60 天全球預報

5.1 — 科學 AI:從單一步驟到整套工作流

AI 在科學中的角色分為三個並存的層次 — 在資料上建模做預測、協助科學家工作的助手,以及能自主產生發現的系統。2025 年,最受矚目的進展轉向第二與第三層。

在 Web of Science 資料庫中,自然科學的 AI 相關論文在 2025 年達到約 80,150 篇,高於 2024 年的 63,547 篇 — 一年成長約 26%。物理科學與生命科學走勢相近,分別達到約 33,000 與 29,000 篇,各年增 27%–28%;地球科學是最小的類別(約 20,460 篇),則成長約 23%。

AI 正成為各學科的常規作法

  • 以佔總產出的比例來看,AI 相關研究在各領域仍是個位數,但攀升迅速。到 2025 年,地球科學的 AI 滲透率最高,達 8.8%,其次是自然科學整體 6.8%、生命科學 6.5%、物理科學 5.8%。在 2010 年,這四個類別都還不到 1%。
  • 最明確的突破集中在既有資料基礎扎實的領域 — 結構生物學、物理、化學與材料科學 — 而不是那些建立在最精密數學或物理模型上的領域。
  • 這些發展並不會自動轉化為科學進展。實驗驗證仍然昂貴又緩慢:AI 能大規模提出新的候選分子,但要確認它們是否有效的臨床試驗,仍是耗時多年、所費不貲的過程。「AI 能提出什麼」與「科學家實際能驗證什麼」之間的落差,在每個領域反覆出現。

自然科學的 AI 論文(2025 年)

2025 年各領域的 AI 相關論文數(一篇論文可同時歸入多個領域,故自然科學總數已去重,並非各領域簡單加總)。單位:篇。

自然科學的 AI 論文(2025 年)自然科學(總計):8015080150自然科學(總計)物理科學:3305033050物理科學生命科學:2891028910生命科學地球科學:2046020460地球科學

5.2 — 跨越各領域:能力很強,卻還不可靠

5.2 節追蹤三大科學群組的資料集、基準、基礎模型與代理。一個一致的發現是:多數科學 AI 模型來自跨國合作的學術與政府機構 — 與由產業主導的通用 AI 版圖恰恰相反。

物理、天文、化學、材料 — 以及生物學裡的小模型驚喜

  • 在分子生物學,小模型正在勝過大模型。MSAPairformer 是一個 1.11 億參數的蛋白質語言模型,在 ProteinGym 基準上超越先前的領先方法;GPN-Star 是一個 2 億參數的基因體模型,勝過了 400 億參數的 Evo 2。
  • 虛擬細胞模型成為 2025 年的新前沿:Evo 2(Arc Institute)、STATE 與 DeepMind 的 AlphaGenome,目標是在不做濕實驗的情況下預測細胞對藥物與基因擾動的反應 — 不過現行系統仍需實驗驗證。Evo 2 以 OpenGenome2 訓練,該語料涵蓋來自所有生命領域的 9.3 兆個 DNA 鹼基對。
  • 天文學在 2025 年釋出了第一個基礎模型、第一個視覺化基準,以及一個 100TB 的訓練資料集。AION-1 以來自五大巡天的超過 2 億個天體訓練,是該領域首個基礎模型;AstroVisBench 則推出首個評測 LLM 科學運算與視覺化的基準。
  • 2025 年,AI 系統首次端到端跑完整套天氣預報流程:Aardvark Weather 以單一機器學習系統取代傳統數值預報流程,多個 AI 天氣模型也進入實際運作部署。FourCastNet 3 能在 4 分鐘內產生 60 天全球預報 — 比先前方法快 8 到 60 倍。

子任務很強,整套研究很弱

前沿模型平均勝過人類化學家,卻無法重現已發表的研究。在 ChemBench(2,700 多題化學題)上,最佳模型擊敗人類專家平均,卻仍在基礎任務上絆倒。在 ReplicationBench 上,前沿模型在天文物理的論文級重現任務得分低於 20%。在 UnivEarth 上,LLM 代理回答地球觀測問題的正確率僅 33%,程式碼有 58% 的時候失敗;而在 BixBench 上,前沿模型在真實世界的生物資訊分析僅達約 17%。

前沿代理離專家級科學還很遠

2025 年前沿模型與代理在整套科學任務上的部分基準分數,並對照 PaperArena 上的博士專家基準。單位:% 正確率。

前沿代理離專家級科學還很遠博士專家(PaperArena 基準):8383博士專家(PaperArena 基準)最佳代理 · PaperArena:3939最佳代理 · PaperArenaLLM 代理 · UnivEarth(地球觀測):3333LLM 代理 · UnivEarth(地球觀測)前沿 · ReplicationBench(天文物理):2020前沿 · ReplicationBench(天文物理)前沿 · BixBench(生物資訊):1717前沿 · BixBench(生物資訊)

AI 在科學產出中的佔比正快速攀升

2025 年各領域 AI 相關研究佔總論文數的比例(2010 年時四者都不到 1%)。單位:佔總產出 %(四捨五入)。

AI 在科學產出中的佔比正快速攀升地球科學:99地球科學自然科學(整體):77自然科學(整體)生命科學:66生命科學物理科學:66物理科學

六個領域,六道前沿

2025 年 AI 如何重塑各個科學領域。點任一張卡片看完整趨勢與數字。

物理與材料:學習式代理模型

基礎模型正取代昂貴的第一原理模擬,並以逆向設計創造新物質。

physics

天文學:第一個基礎模型

AION-1、AstroVisBench 與一個 100TB 資料集,標誌全領域轉向 AI 基礎設施。

astronomy

化學:勝過專家,卻無法重現

前沿模型在 ChemBench 的 2,700+ 題上勝過人類化學家 — 卻在整套研究上絆倒。

chemistry

生命科學:小模型,大資料

1.11 億參數的 MSAPairformer 與 2 億的 GPN-Star 擊敗更大模型;OpenGenome2 收 9.3 兆鹼基對。

biology

地球科學:天氣 AI 進入實戰

Aardvark Weather 跑完端到端流程;FourCastNet 3 不到 4 分鐘預報 60 天。

earth

數學:奪金牌,難題仍未解

一年內從 IMO 銀牌躍升金牌 — 但厄爾多斯猜想仍遙不可及。

math

5.3 — 研究代理:專家水準的一半

PaperArena 上最佳代理 38.8%,博士專家 83.5%;AstaBench 最佳約 0.53。

agents

用五句話看這一章

第 5 章「科學」的頭條發現。

在分子生物學,小模型正在勝過大模型 — 一個 1.11 億參數的模型擊敗了建立在數百億參數上的方法。
— Chapter 5 · Science
自然科學的 AI 論文在 2025 年達到約 80,150 篇,一年成長約 26%。
— Chapter 5 · Science
前沿模型平均勝過人類化學家 — 卻在重現已發表的天文物理論文上得分低於 20%。
— Chapter 5 · Science
天文學在 2025 年釋出第一個基礎模型 AION-1,以來自五大巡天的超過 2 億個天體訓練。
— Chapter 5 · Science
在端到端研究上,最佳 AI 代理只達博士專家的一半 — PaperArena 上 38.8% 對 83.5%。
— Chapter 5 · Science

閱讀完整的科學章節

第 5 章(5.1–5.3 各節)連同所有圖表與引用,皆由史丹佛 HAI 免費提供。或回到 15 條重點與九大章節總覽。

前往第 5 章:科學 →