物理與材料:學習式代理模型
基礎模型正取代昂貴的第一原理模擬,並以逆向設計創造新物質。
AI 指數 2026 第 5 章橫跨各門科學 — 從物理、化學、天文,到生物與地球科學,再到自主研究代理。2025 年,AI 不再只是改善單一流程步驟,而是邁向取代整套工作流;但嚴謹的基準仍揭露「看似合理的產出」與「可靠的科學」之間的巨大落差。先看數字:
AI 在科學中的角色分為三個並存的層次 — 在資料上建模做預測、協助科學家工作的助手,以及能自主產生發現的系統。2025 年,最受矚目的進展轉向第二與第三層。
在 Web of Science 資料庫中,自然科學的 AI 相關論文在 2025 年達到約 80,150 篇,高於 2024 年的 63,547 篇 — 一年成長約 26%。物理科學與生命科學走勢相近,分別達到約 33,000 與 29,000 篇,各年增 27%–28%;地球科學是最小的類別(約 20,460 篇),則成長約 23%。
5.2 節追蹤三大科學群組的資料集、基準、基礎模型與代理。一個一致的發現是:多數科學 AI 模型來自跨國合作的學術與政府機構 — 與由產業主導的通用 AI 版圖恰恰相反。
前沿模型平均勝過人類化學家,卻無法重現已發表的研究。在 ChemBench(2,700 多題化學題)上,最佳模型擊敗人類專家平均,卻仍在基礎任務上絆倒。在 ReplicationBench 上,前沿模型在天文物理的論文級重現任務得分低於 20%。在 UnivEarth 上,LLM 代理回答地球觀測問題的正確率僅 33%,程式碼有 58% 的時候失敗;而在 BixBench 上,前沿模型在真實世界的生物資訊分析僅達約 17%。
2025 年 AI 如何重塑各個科學領域。點任一張卡片看完整趨勢與數字。
基礎模型正取代昂貴的第一原理模擬,並以逆向設計創造新物質。
AION-1、AstroVisBench 與一個 100TB 資料集,標誌全領域轉向 AI 基礎設施。
前沿模型在 ChemBench 的 2,700+ 題上勝過人類化學家 — 卻在整套研究上絆倒。
1.11 億參數的 MSAPairformer 與 2 億的 GPN-Star 擊敗更大模型;OpenGenome2 收 9.3 兆鹼基對。
Aardvark Weather 跑完端到端流程;FourCastNet 3 不到 4 分鐘預報 60 天。
一年內從 IMO 銀牌躍升金牌 — 但厄爾多斯猜想仍遙不可及。
PaperArena 上最佳代理 38.8%,博士專家 83.5%;AstaBench 最佳約 0.53。
第 5 章「科學」的頭條發現。
在分子生物學,小模型正在勝過大模型 — 一個 1.11 億參數的模型擊敗了建立在數百億參數上的方法。
自然科學的 AI 論文在 2025 年達到約 80,150 篇,一年成長約 26%。
前沿模型平均勝過人類化學家 — 卻在重現已發表的天文物理論文上得分低於 20%。
天文學在 2025 年釋出第一個基礎模型 AION-1,以來自五大巡天的超過 2 億個天體訓練。
在端到端研究上,最佳 AI 代理只達博士專家的一半 — PaperArena 上 38.8% 對 83.5%。