AI Index Report 2025

2024 年,AI 研究變得更龐大、更昂貴 — 而且幾乎全由企業主導

AI 指數 2025 第 1 章追蹤 AI 知識的產地:論文、專利、重要模型、底下的晶片,以及它們燒掉的能源。模式相當一致 — 產出持續攀升,但前沿正在移往少數資金極其充裕的手上。先看數字:

90% 2024 年出自產業界的重要 AI 模型(2023 年為 60%)
402024 年美國機構產出的重要 AI 模型數(中國 15、歐洲 3)
2422023 年電腦科學領域的 AI 論文(千篇;2013 年為 102 千篇)
122,5112023 年全球核准的 AI 專利件數(2010 年為 3,833 件)
280GPT-3.5 等級推論成本在約 18 個月內下降的倍數
8,930訓練 Llama 3.1 405B 排放的二氧化碳公噸數(GPT-3 為 588)

1.1 — AI 論文比以往任何時候都多,而中國寫得最多

2013 至 2023 年間,電腦科學領域的 AI 論文增加一倍以上,從約 102,000 篇增至超過 242,000 篇 — 光是最近一年就成長 19.7%。AI 如今佔所有電腦科學論文的 41.8%,十年前僅 21.6%。

這股成長並不只是更多 AI 研究者寫了更多 AI 論文。電腦科學底下的各個領域 — 硬體、軟體工程、人機互動 — 如今都在為 AI 做出貢獻,因此這波上升反映的是整個學科朝 AI 方法遷移。2023 年,期刊承載了最大比例的 AI 論文(41.8%),其次是研討會(34.3%),而 arXiv 這類預印本平台的份額則持續攀升。

論文從哪裡來

  • 2023 年中國以 23.2% 的佔比在 AI 論文發表量上領先全球,高於歐洲(15.2%)與印度(9.2%)。中國在被引用數上同樣領先,拿下所有 AI 論文引用的 22.6%,高於歐洲(20.9%)與美國(13.0%)。
  • 以區域來看,東亞與太平洋地區產出了 34.5% 的 AI 論文,並吸引 37.1% 的引用 — 這個比例自 2017 年以來急速上升,當時它與北美大致相當。
  • 學術機構仍是主要引擎,2023 年產出 84.9% 的 AI 論文,產業界佔 7.1%、政府機構 4.9%、非營利組織 1.7%。
  • 各國的組成差異顯著:美國有 16.5% 的 AI 論文來自產業界,中國僅 8.0%,而中國有 84.5% 出自教育部門。
  • 以主題來看,機器學習出現在 2023 年 75.7% 的 AI 論文中,其次是電腦視覺(47.2%)、模式識別(25.9%)與自然語言處理(17.1%),過去一年生成式 AI 的論文則大幅激增。

被引用最多的論文說著另一個故事

今年新增的分析中,AI 指數也追蹤了 2021、2022 與 2023 年被引用最多的 100 篇 AI 論文。美國每年都居榜首 — 2021 年 64 篇、2022 年 59 篇、2023 年 50 篇 — 中國每年皆居第二,不過美國的佔比正逐步下滑。學術界產出了最多高被引研究(2023 年 42 篇),產業界的貢獻則從 2021 年的 17 篇、2022 年的 19 篇,崩跌至 2023 年的僅 7 篇:隨著競爭加劇,企業實驗室發表得更少,發表時揭露的細節也更少。Google 每年領先,但 2023 年與清華大學並列,兩者各有八篇進入前 100。

東亞與太平洋地區如今產出全球三分之一的 AI 研究

2023 年電腦科學領域 AI 論文佔世界總數的比例(%)。同年,東亞與太平洋地區也拿下所有 AI 論文引用的 37.1%。

東亞與太平洋地區如今產出全球三分之一的 AI 研究東亞與太平洋:34.534.5東亞與太平洋歐洲與中亞:18.218.2歐洲與中亞北美:10.310.3北美中東與北非:5.25.2中東與北非

1.2 與 1.3 — 中國掌握專利,美國推出模型

兩張截然不同的 AI 實力地圖。在核准專利上,中國握有全球總數的 69.7%。在重要模型上 — 也就是真正推動前沿的那些系統 — 美國 2024 年產出 40 個,中國 15 個,歐洲合計 3 個。

專利:成長,以及持續拉開的地理差距

  • 全球核准的 AI 專利從 2010 年的 3,833 件成長到 2023 年的 122,511 件 — 光是最近一年就上升 29.6%。
  • 截至 2023 年,全球 82.4% 的核准 AI 專利來自東亞與太平洋地區,北美以 14.2% 居次。這道差距自 2010 年以來持續擴大。
  • 以國家來看,中國佔核准量的 69.7%,美國佔 14.2% — 低於美國 2015 年 42.8% 的高峰。
  • 換算成人均,情況就不同了:2023 年南韓以每 10 萬人 17.3 件核准 AI 專利領先,其次是盧森堡(15.3)與中國(6.1)。十年之間,瑞典的 AI 專利成長幅度最大。

重要模型:數量變少,而且幾乎沒有一個來自大學

2024 年美國以 40 個重要 AI 模型領先,其次是中國的 15 個與法國的 3 個。所有主要地理區塊釋出的重要模型數量都比前一年少 — 可能的原因包括訓練規模愈來愈大、技術複雜度上升,以及要找出真正新穎的建模方法愈來愈難。部門分布的落差更為劇烈:Epoch AI 統計 2024 年產業界產出 55 個重要模型,學術界則一個也沒有被認定,使產業界的佔比推升到 90.2%,而 2023 年約為 60%。

  • 2024 年產出最多的是 Google(7 個)、OpenAI(7 個)與阿里巴巴(6 個)。自 2014 年起累計,領先者為 Google(187 個)、Meta(82 個)與 Microsoft(39 個)。
  • 學術機構方面,自 2014 年以來以卡內基美隆大學(25 個)、史丹佛大學(25 個)與清華大學(22 個)產量最高。
  • 2024 年最常見的釋出形式是 API 存取,佔 61 個模型中的 20 個 — 亦即 32.8%,這個比例自 2020 年起穩定上升。
  • 開放到程式碼就停住了:2024 年釋出的重要模型有 60.7% 沒有附上對應的訓練程式碼,即使權重已公開。
  • 學術模型掛零這件事要小心解讀:它的意思是 Epoch AI 沒有把任何一個認定為重要模型,而非大學停止造模型。學術成果也通常需要更久才會獲得認可。

十年的重要模型,以及誰造了它們

2014 至 2024 年各組織累計產出的重要 AI 模型數。光是 Google 就比第二名多出一倍以上;領先的大學則落後一個數量級。

十年的重要模型,以及誰造了它們Google:187187GoogleMeta:8282MetaMicrosoft:3939Microsoft卡內基美隆:2525卡內基美隆史丹佛:2525史丹佛清華大學:2222清華大學

從 AlexNet 到 DeepSeek-V3,一個前沿模型要花多少

重要模型的訓練運算量約每五個月翻倍,LLM 訓練資料集規模每八個月翻倍,訓練所需電力則每年翻倍。以下是這種複利效應換算成金錢、瓦數與碳排的樣子。

  1. 2012 年 · AlexNet

    五天的訓練,以及可忽略的排放

    AlexNet 是最早利用 GPU 訓練的模型之一,在今天看來相當原始的硬體上,大約五到六天就完成訓練。它的訓練排放估計約為 0.01 公噸二氧化碳。

  2. 2017 年 · Transformer

    670 美元,訓練出所有現代 LLM 背後的架構

    最初的 Transformer 以約 20 億個 token 訓練,需要約 7,400 petaFLOP,估計耗電 4,500 瓦,換算通膨後的訓練成本約 670 美元。

  3. 2019 年 · RoBERTa Large

    六位數金額,換來理解任務上的最佳成績

    RoBERTa Large 在 SQuAD、GLUE 等經典基準上取得當時最佳成績,訓練成本約 160,000 美元 — 兩年之間比 Transformer 增加了 240 倍。

  4. 2020 年 · GPT-3 175B

    3,740 億個 token,以及 588 公噸的碳

    支撐最初 ChatGPT 的模型之一,估計以 3,740 億個 token 訓練,訓練過程據報排放約 588 公噸二氧化碳 — 大約是一位美國人年均排放量的 33 倍。

  5. 2023 年 · GPT-4

    約 7,900 萬美元,以及 5,184 公噸的碳

    AI 指數依據雲端運算租用價格,估計 GPT-4 的訓練成本約 7,900 萬美元;OpenAI 執行長 Sam Altman 則表示訓練費用超過 1 億美元。訓練排放估計為 5,184 公噸二氧化碳。

  6. 2024 年 · Llama 3.1 405B

    90 天、2,530 萬瓦、1.7 億美元

    Meta 的旗艦模型花了約 90 天訓練 — 以今天的標準算是常見的時間長度 — 估計成本 1.7 億美元,耗電 2,530 萬瓦,是最初 Transformer 的 5,000 倍以上。訓練排放 8,930 公噸二氧化碳。同年釋出的 Llama 3.3 則以約 15 兆個 token 訓練。

  7. 2024 年 12 月 · DeepSeek-V3

    高性能,據報只花約 600 萬美元

    DeepSeek 的 V3 之所以引人注目,是因為它用遠少於同儕的運算資源就取得強勁成績;據報訓練成本約 600 萬美元,排放估計與五年前的 GPT-3 相當。也有報導質疑這個數字,認為若把薪資、資本支出與研究費用算進去並不只如此。Epoch AI 發現,中國訓練運算量前十名的模型自 2021 年底以來每年約放大 3 倍,而世界其他地方自 2018 年以來每年約 5 倍。

1.4–1.6 — 晶片效率提升,模型卻把紅利全吃光

機器學習硬體在每一個重要面向上都在進步:效能每年成長 43%、成本每年下降 30%、能源效率每年提升 40%。然而,訓練一個前沿模型所需的電力仍在每年翻倍。

更快、更便宜、更省電

  • 以 16 位元浮點運算衡量,機器學習硬體效能在 2008 至 2024 年間每年約成長 43%,每 1.9 年翻倍 — 由電晶體數量、半導體製程與 AI 專用晶片共同推動。
  • 性價比每年約改善 30%。Nvidia 於 2022 年 3 月發表的 H100,每美元可提供每秒 220 億次浮點運算 — 約為 A100 的 1.7 倍、2016 年 P100 的 16.9 倍。
  • 能源效率每年約提升 40%。2024 年 3 月推出的 B100 達到每瓦每秒 2.5 兆次浮點運算,而 2016 年的 P100 為 740 億次 — 效率高出 33.8 倍。
  • A100 仍是最常被回報使用的訓練晶片,共有 64 個重要模型採用;H100 則快速攀升,到 2024 年底已有 15 個模型使用。

然而總耗電量仍在翻倍

效率的進步被規模整個吞掉了。最初的 Transformer 估計耗電 4,500 瓦;Google 早期旗艦 LLM 之一的 PaLM 耗電 260 萬瓦 — 幾乎是前者的 600 倍。Llama 3.1 405B 需要 2,530 萬瓦,是 Transformer 的 5,000 倍以上。Epoch AI 發現,訓練前沿模型所需的電力每年翻倍,碳排也跟著走:AlexNet 的排放可以忽略,GPT-3 約 588 公噸,GPT-4 約 5,184 公噸,Llama 3.1 405B 約 8,930 公噸。作為對照,一位美國人年均排放 18.08 公噸碳,而一名乘客往返紐約與舊金山一趟則相當於 0.99 公噸。

模型周圍的社群

  • AI 研討會的參與人數在 2023 至 2024 年間成長 21.7%,自 2014 年以來增加超過 60,000 人次。NeurIPS 仍是規模最大的一場,2024 年吸引近 20,000 名參與者。
  • GitHub 上的 AI 專案從 2011 年的 1,549 個成長到 2024 年的約 430 萬個 — 光是最近一年就上升 40.3%。
  • 2024 年,美國開發者貢獻了 23.4% 的 GitHub AI 專案,印度以 19.9% 緊追在後,歐洲則佔 19.5%。美國的佔比自 2016 年起下滑,近年似乎已趨於穩定。
  • AI 專案獲得的新 GitHub 星數從 2023 年的 1,400 萬增至 2024 年的 1,770 萬,其中美國專案總計獲得 2,110 萬顆星。

這一章真正回答的五個問題

AI 研究中還在爭論的幾件事,以及 2025 年的數據怎麼說。

AI 快要沒有訓練資料了嗎?
不是馬上,但期限已經看得見。Epoch AI 估計 Common Crawl 的中位數為 130 兆個 token,已索引的網頁約 510 兆,整個網際網路約 3,100 兆;影像再加上約 300 兆,影片約 1,350 兆。在 80% 信賴區間下,Epoch 預測目前的訓練資料存量會在 2026 到 2032 年之間用盡。這比去年預估的「高品質文字 2024 年就會耗盡」來得晚,因為新研究顯示,經過篩選的網頁資料比精心整理的語料庫更有效,而且同一份資料可以重複訓練多次。過度訓練 — 也就是為了換取更便宜的推論而衝過報酬遞減點 — 會讓存量更快見底。
合成資料能補上這個缺口嗎?
部分可以,但有但書。早期研究警告過模型崩潰:反覆以合成資料訓練會讓模型失去分布的尾端、輸出品質下降,這在變分自編碼器、高斯混合模型與 LLM 上都被觀察到。較新的研究發現,若合成資料是疊加在真實資料之上而非取而代之,崩潰就不會發生 — 儘管單純累積也未必能提升表現。一支斯洛維尼亞團隊發現,多數合成關聯式資料仍可被系統性地辨識出來,整體表現通常不如真實資料,偶有例外。特定領域確實有實質收穫:經合成擴增的醫療資料集,讓少數類別的 F1 或 AUROC 分數提升 5%–10%;史丹佛與北卡羅來納大學教堂山分校的研究者則以自動事實查核打造 FactTune-FS,在事實性上勝過其他 RLHF 與解碼式方法。
為什麼用模型變得這麼便宜?
因為小模型不斷追上昨天的前沿。把效能固定住來看,一個在 MMLU 上達到 GPT-3.5 水準(64.8 分)的模型,查詢成本從 2022 年 11 月的每百萬 token 20.00 美元,降到 2024 年 10 月 Gemini-1.5-Flash-8B 的 0.07 美元 — 約 18 個月內下降超過 280 倍。更難的測試上也是同一個模式:在 GPQA 上得分超過 50% 的模型,推論成本從 2024 年 5 月的每百萬 token 15 美元,降到同年 12 月 Phi-4 的 0.12 美元。Epoch AI 估計,依任務不同,LLM 推論價格每年下降 9 到 900 倍不等。最新的頂尖模型依然賣得比較貴 — 重點在於,昨天的頂尖幾乎已經免費。
現在到底是誰在造模型?
幾乎全是產業界。2024 年將近 90% 的重要模型出自產業界,而 2023 年約為 60%,同年 Epoch AI 甚至沒有認定任何一個學術界的重要模型。打造尖端模型如今需要的資料、運算與金錢規模,已經不是大學負擔得起的。但如果看的是影響力而非產量,畫面就反過來了:2023 年被引用最多的 100 篇 AI 論文中,學術界佔 42 篇,產業界則從 2022 年的 19 篇跌到 2023 年的僅 7 篇 — 企業實驗室發表得更少,發表時揭露的也更少。
訓練對氣候的代價有多大?
代價持續上升,而參照點正變得令人不安。AlexNet 在 2012 年的訓練排放約 0.01 公噸二氧化碳。2020 年的 GPT-3 約 588 公噸,2023 年的 GPT-4 約 5,184 公噸,2024 年的 Llama 3.1 405B 約 8,930 公噸。一位美國人年均排放 18.08 公噸碳,因此 Llama 3.1 405B 的一次訓練約等於 494 位美國人一整年的排放。值得注意的是,效能與 OpenAI o1 相當的 DeepSeek V3,排放估計落在五年前 GPT-3 的區間 — 這表示只要把效率當一回事,它仍然做得到。

閱讀完整的研發章節

第 1 章(1.1–1.6 各節) — 論文、專利、重要模型、硬體、研討會與開源軟體 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

前往 AI 指數報告 2025 →