AI Index Report 2025

2024 年:基準測試再也擋不住的一年

2025 年 AI 指數涵蓋 2024 年,分為八大章節:研發、技術表現、負責任 AI、經濟、科學與醫療、政策、教育與民意。一年前才推出的基準測試大致被攻克,成本崩跌,投資創下新高。先看幾個定錨的數字:

71.7% SWE-bench 程式問題解決率(2023 年為 4.4%)
252.3全球企業 AI 投資(十億美元)
78% 回報使用 AI 的組織(2023 年為 55%)
280倍 — GPT-3.5 等級推論成本在約 18 個月內的降幅
2332024 年 AI 事故通報件數,創下新高
223至 2023 年 FDA 核准的 AI 醫材件數(2015 年為 6 件)

12 條重點摘要

報告自身對這一年的總結,依其原本順序排列。點任一張卡片可看完整內容。

1 · 高難度基準測試的表現持續進步

MMMU、GPQA 與 SWE-bench 於 2023 年推出,用來測試最強系統的極限。一年後,分數分別上升 18.8、48.9 與 67.3 個百分點。

benchmarks

2 · AI 日益融入日常生活

2023 年 FDA 核准了 223 項 AI 醫療器材,而 2015 年僅有 6 項。Waymo 每週提供超過 15 萬趟自駕接送。

deployment

3 · 企業全力投入,推升投資創紀錄

美國私人 AI 投資達 1,091 億美元 — 近乎中國 93 億美元的 12 倍、英國 45 億美元的 24 倍。組織的 AI 使用率由 55% 躍升至 78%。

economy

4 · 美國仍領先頂尖模型 — 中國正在追上

2024 年美國機構產出 40 個重要模型,中國 15 個、歐洲 3 個。但在 MMLU 與 HumanEval 上的表現差距,已從兩位數收斂到幾乎持平。

geopolitics

5 · 負責任 AI 生態系在演進 — 但並不均勻

AI 相關事故急遽上升,但在主要的產業級模型開發者之間,標準化的負責任 AI 評估依然罕見。

responsible AI

6 · 全球樂觀情緒上升 — 但區域鴻溝依舊

在中國(83%)、印尼(80%)與泰國(77%),多數人認為 AI 利大於弊 — 但在加拿大(40%)、美國(39%)與荷蘭(36%),抱持此看法的只是少數。

public opinion

7 · AI 變得更高效、更便宜、更容易取得

達到 GPT-3.5 等級表現的推論成本,在 2022 年 11 月至 2024 年 10 月間下降逾 280 倍。硬體成本每年下降 30%,能源效率每年提升 40%。

cost

8 · 政府積極介入 — 監管與投資雙管齊下

2024 年美國聯邦機關推出 59 條 AI 相關法規 — 是 2023 年的兩倍有餘,且發布機關數也翻倍。75 個國家的立法提及次數成長 21.3%。

policy

9 · AI 與資訊科學教育擴張 — 但取得落差仍在

三分之二的國家已提供或計畫提供 K–12 資訊科學教育 — 是 2019 年的兩倍。美國的資訊類學士學位數,十年間成長 22%。

education

10 · 產業界一路領先 — 但前沿正在收攏

2024 年近 90% 的重要模型來自產業界,2023 年為 60%。但排名第一與第十的模型 Elo 差距,已從 11.9% 縮小至 5.4%。

frontier

11 · AI 因其對科學的影響獲得最高榮譽

兩座諾貝爾獎分別表彰了促成深度學習(物理獎)以及將其應用於蛋白質摺疊(化學獎)的研究;圖靈獎則表彰了強化學習的貢獻。

science

12 · 複雜推理仍是難題

模型在國際數學奧林匹亞這類題目上表現優異,卻仍在 PlanBench 這類推理基準上碰壁。

limitations

2024 年各國私人 AI 投資

美國進一步拉開差距:其私人 AI 投資近乎中國的 12 倍、英國的 24 倍。單位為十億美元。

2024 年各國私人 AI 投資美國:109.1109.1美國中國:9.39.3中國英國:4.54.5英國

為了「夠難」而生的基準,一年之間的進展

2023 年推出、用以測試最強系統極限的三項基準,在 2024 年的進步幅度(百分點)。

為了「夠難」而生的基準,一年之間的進展SWE-bench:67.367.3SWE-benchGPQA:48.948.9GPQAMMMU:18.818.8MMMU

八大章節速覽

每一章的關鍵數字。展開可看摘要,再由連結進入完整章節。

1 · 研發
近 90% 的重要模型出自產業界(2023 年為 60%),但高被引研究仍以學術界為主。AI 論文在 2013 至 2023 年間近乎三倍,由約 102,000 篇增至逾 242,000 篇。專利由 2010 年的 3,833 件暴增至 2023 年的 122,511 件,其中中國佔 69.7%。訓練算力每五個月翻倍;訓練 Llama 3.1 405B 這類模型排放 8,930 噸碳,而 2012 年的 AlexNet 僅 0.01 噸。完整章節:研發
2 · 技術表現
2023 年為了「夠難」而設計的基準,一年內大致被攻克:SWE-bench 由 4.4% 升至 71.7%,GPQA 進步 48.9、MMMU 進步 18.8 個百分點。開放權重模型與閉源的差距由 8.0% 收斂至 1.7%。中美模型在 MMLU 上幾乎持平(差距 0.3 個百分點)。Phi-3-mini 以 38 億參數,達到兩年前 PaLM 需要 5,400 億參數才能達到的水準。完整章節:技術表現
3 · 負責任 AI
2024 年 AI 事故通報達 233 件創新高,年增 56.4%。資料共享正在快速萎縮:C4 中仍在維護的網域,受限 token 比例由 5–7% 跳升至 20–33%。基礎模型透明度由 37% 升至 58%,但主要開發者之間,標準化的負責任 AI 評估仍然罕見。明確訓練為去偏誤的模型,依然表現出隱性偏誤。完整章節:負責任 AI
4 · 經濟
全球企業 AI 投資達 2,523 億美元,其中私人投資成長 44.5%。美國私人 AI 投資 1,091 億美元,近乎中國 93 億美元的 12 倍、英國 45 億美元的 24 倍。組織的 AI 使用率由 55% 躍升至 78%。中國 2023 年安裝 276,300 台工業機器人 — 佔全球 51.1%,是日本的六倍。完整章節:經濟
5 · 科學與醫療
OpenAI 的 o1 在 MedQA 創下 96.0% 的新標竿。FDA 核准的 AI 醫療器材至 2023 年達 223 件,2015 年僅 6 件。AlphaFold 資料庫自 2021 年起成長 585%。醫療 AI 倫理論文由 2020 年的 288 篇增至 2024 年的 1,031 篇,近乎四倍。兩座諾貝爾獎頒給 AI 相關研究 — 物理獎表彰神經網路,化學獎表彰蛋白質摺疊。完整章節:科學與醫療
6 · 政策與治理
美國州級 AI 法案由 2023 年的 49 件增至 2024 年的 131 件,倍增有餘。聯邦機關推出 59 條 AI 相關法規(前一年 25 條),發布機關由 21 個增至 42 個。75 個國家的立法提及 AI 共 1,889 次,年增 21.3%,自 2016 年以來成長九倍。至 2024 年已有 24 州通過深偽相關規範。完整章節:政策與治理
7 · 教育
三分之二的國家已提供或計畫提供 K–12 資訊科學教育,是 2019 年的兩倍,其中非洲與拉丁美洲進步最多。美國資訊類學士學位十年成長 22%,AI 碩士學位在 2022 至 2023 年間近乎倍增。但 81% 的美國資訊科學教師認為 AI 應納入基礎課程,卻不到半數自認具備教學能力。完整章節:教育
8 · 民意
2022 與 2024 年皆受調查的 26 國中,有 18 國轉趨正面;全球認為 AI 利大於弊的比例由 52% 升至 55%。三分之二的人預期 AI 會在三到五年內顯著影響日常生活。但對 AI 企業會保護個資的信心由 50% 降至 47%,區域鴻溝也依舊 — 中國 83%,荷蘭僅 36%。完整章節:民意

閱讀 2025 年完整報告

全文 457 頁,由史丹佛以人為本人工智慧研究院以 CC BY-ND 4.0 開放取用發行。所有圖表背後的原始資料也可於該處取得。

史丹佛 HAI · AI 指數 2025