AI Index Report 2024

2023 年,基礎模型數量翻倍 — 而前沿研究的價碼把大學擋在門外

AI 指數 2024 第 1 章追蹤 AI 知識的產地:論文、專利、重要模型、基礎模型、研討會與開源程式碼。論文與專利資料仍落後一年,因此那兩節講的是 2022 年;模型資料則更新到 2023 年。每一節的主軸都一樣 — 產出持續上升,而前沿持續往付得起錢的人手上移動。先看數字:

1492023 年發布的基礎模型數(2022 年為 72)
65.7% 2023 年以開源形式釋出的基礎模型比例(2022 年為 44.4%)
612023 年出自美國機構的重要機器學習模型數(歐盟 21、中國 15)
191訓練 Gemini Ultra 的運算成本(百萬美元;GPT-4 為 78)
62.7% 2021 至 2022 年全球核准 AI 專利的成長率
12.22023 年 AI 專案獲得的 GitHub 星數(百萬顆;2022 年為 400 萬)

1.1 — AI 論文十年間幾乎增為三倍,然後這一年只成長 1.1%

2010 至 2022 年間,AI 論文總數幾乎增為三倍,從約 88,000 篇增至超過 240,000 篇。但在可取得資料的最後一年,成長率只有 1.1% — 而同一年研討會論文卻跳升 30.2%。

總數這個數字藏了兩條走勢完全不同的曲線。期刊承載了絕大多數的 AI 研究 — 2022 年約有 232,700 篇期刊論文,研討會論文則約 41,200 篇 — 但研討會才是跑得比較快的那一半。自 2015 年起,研討會論文成長 2.6 倍,期刊論文成長 2.4 倍;而最近一年研討會產出上升 30.2%,期刊只有 4.5%。研討會論文從 2020 年的 22,727 篇增至 2021 年的 31,629 篇、2022 年的 41,174 篇,自 2010 年以來增加超過一倍。

論文都在寫什麼

  • 機器學習主宰了領域分布,2022 年約有 72,200 篇論文 — 自 2015 年以來成長將近七倍。
  • 後面的領域差距很大:電腦視覺(21,309 篇)、模式識別(19,841 篇)與流程管理(12,052 篇)。
  • 再往下是電腦網路、控制理論、演算法、語言學與數學最佳化,各約落在 6,800 到 10,400 篇之間。
  • 這一版的論文資料來自 CSET,而 CSET 的方法論自 AI 指數上次採用以來已有調整,因此總數與過去幾版略有出入。

誰在寫這些論文

  • 2022 年學術部門產出 81.1% 的 AI 論文,維持它過去十年在所有區域都居首的位置。
  • 產業界佔 7.9%、政府部門 7.0%、非營利組織 2.6%,其餘 1.5%。
  • 產業參與度最高的是美國,有 14.1% 的 AI 論文出自企業,高於歐盟加英國(9.5%)與中國(7.4%)。
  • 三者之中中國最學院派:81.8% 的 AI 論文來自教育部門,美國為 75.5%,歐盟加英國為 75.6%。
  • 政府部門的研究則反過來 — 中國有 10.1%、歐盟加英國有 9.3% 的 AI 論文出自政府單位,美國只有 5.6%。

1.2 — AI 專利正在爆炸性成長,而每五件就有三件來自中國

光是 2021 到 2022 年,全球核准的 AI 專利就成長 62.7%,達到 62,264 件,自 2010 年以來增加超過 31 倍。其中 61.1% 來自中國;美國的佔比則從 2010 年的 54.1% 掉到 20.9%。

成長,以及愈來愈高的駁回率

  • 整個 2010 至 2014 年間,核准的 AI 專利成長 56.1%。而光是 2021 到 2022 年就成長 62.7% — 等於把十年前的成長幅度壓縮進一年。
  • 拿到核准變得困難許多。2015 年有 42.2% 的 AI 專利申請沒有獲准;到 2022 年這個數字升到 67.4%。
  • 2022 年未獲准的 AI 專利有 128,952 件,獲准的只有 62,264 件 — 前者是後者的兩倍以上。
  • 這道落差在每個主要申請區域都看得到。中國約有 80,500 件未獲准、35,300 件獲准,美國約 15,100 件對 12,100 件,歐盟加英國約 2,170 件對 1,170 件。

專利從哪裡來

  • 截至 2022 年,全球 75.2% 的核准 AI 專利來自東亞與太平洋地區,北美以 21.2% 居次,歐洲與中亞為 2.3%。2011 年之前領先的還是北美。
  • 以地理區域來看:中國 61.1%、美國 20.9%、歐盟加英國 2.0%、印度 0.2%,世界其餘地區合計 15.7%。
  • 換算成人均,排名就反過來了。2022 年南韓以每 10 萬人 10.26 件核准 AI 專利居首,其次是盧森堡(8.73)與美國(4.23),日本(2.53)與中國(2.51)緊追在後。
  • 若看 2012 到 2022 年的成長幅度,新加坡最快,達 +5,366%,其次是南韓(+3,801%)與中國(+3,569%)。同一個十年間美國成長 1,299%。

全球每五件核准的 AI 專利,就有三件來自中國

2022 年核准 AI 專利佔全球總數的比例(%)。美國的佔比在 2010 年達到 54.1% 的高點,之後年年下滑。

全球每五件核准的 AI 專利,就有三件來自中國中國:61.1361.13中國美國:20.920.9美國其他地區:15.7115.71其他地區歐盟與英國:2.032.03歐盟與英國印度:0.230.23印度

1.3 — 前沿如今由產業界打造,而一年之內就冒出 149 個基礎模型

兩個數字就說完了整件事。Epoch AI 統計 2023 年產業界產出 51 個重要機器學習模型,學術界只有 15 個。史丹佛的 Ecosystem Graphs 則記錄到 149 個基礎模型 — 是 2022 年 72 個的兩倍以上,也接近 2019 年的 38 倍。

重要模型:產業界領先,產學合作創新高

  • 2014 年之前,模型釋出是學術界領先。2023 年產業界產出 51 個重要機器學習模型,學術界 15 個 — 但另有 21 個出自產學合作,創下新高,因此差距比前一年略為縮小。
  • 打造尖端模型如今需要的資料、算力與資金規模,已經不是大學能負擔的,這也是分布會長成這樣的原因。
  • 以國家來看,美國 2023 年產出 61 個重要模型,領先中國(15 個)、法國(8 個)、德國(5 個),加拿大、以色列與英國則各 4 個。
  • 歐盟與英國合計產出 25 個 — 這是 2019 年以來,兩者加總首度超過中國。
  • 算力解釋了這種向企業傾斜的走勢。2012 年 AlexNet 訓練估計需要 470 petaFLOP,2017 年最初的 Transformer 約 7,400,2023 年的 Gemini Ultra 則要 500 億。

基礎模型:數量更多,而且更開放

  • 2023 年釋出的 149 個基礎模型中,98 個為開放模型、23 個為受限存取、28 個完全不開放。換算比例,18.8% 完全不開放,15.4% 為受限存取。
  • 開放的比例上升得很快:2021 年 33.3%、2022 年 44.4%、2023 年 65.7%。
  • 2023 年有 72.5% 的基礎模型出自產業界 — 共 108 個 — 學術界 28 個、產學合作 9 個、政府部門 4 個。
  • 2023 年釋出最多的是 Google(18 個),其次是 Meta(11 個)、Microsoft(9 個)與 OpenAI(7 個)。學術機構中以加州大學柏克萊分校最多,有 3 個。
  • 自 2019 年累計,領先者是 Google(40 個)、OpenAI(20 個)、Meta(19 個)、Microsoft(18 個)與 DeepMind(15 個)。清華大學(7 個)是產出最多的非西方機構,史丹佛(5 個)則是美國學術機構之冠。
  • 以 2023 年的國家分布來看:美國 109 個、中國 20 個、英國 8 個、阿拉伯聯合大公國 4 個。自 2019 年累計,美國、中國與英國分別為 182、30 與 21 個。

美國產出的重要模型數是中國的四倍

2023 年重要機器學習模型的數量,依作者所屬機構的所在國歸屬。作者橫跨多國的模型可能被重複計入。

美國產出的重要模型數是中國的四倍美國:6161美國中國:1515中國法國:88法國德國:55德國加拿大:44加拿大

六年之間,從 930 美元漲到 1.91 億美元

這一版首度與 Epoch AI 合作,推出扎實的訓練成本估算:依據訓練時長,以及訓練硬體的類型、數量與使用率,再以雲端運算租用價格換算,並調整通膨。把下面這串看完,就會明白大學為什麼實質上已經退出前沿模型的競賽。

  1. 2012 年 · AlexNet

    470 petaFLOP,GPU 時代就此開始

    AlexNet 是把「用 GPU 訓練 AI 模型」推成標準做法的論文之一,訓練估計需要 470 petaFLOP。十一年後的 Gemini Ultra,需要的算力是它的一億倍以上。

  2. 2017 年 · Transformer

    930 美元,訓練出所有現代 LLM 背後的架構

    最初的 Transformer 提出了幾乎所有現代 LLM 都建立其上的架構。它需要約 7,400 petaFLOP,調整通膨後的訓練成本約 930 美元 — 一個研究生刷卡就付得起的金額。

  3. 2019 年 · RoBERTa Large

    160,018 美元,換來理解任務上的當時最佳

    RoBERTa Large 在 SQuAD、GLUE 等經典理解基準上取得當時最佳成績,訓練成本約 160,000 美元 — 兩年之後,已是 Transformer 的 170 倍左右。

  4. 2020 年 · GPT-3 175B

    430 萬美元,榜上第一個七位數的模型

    GPT-3 175B(davinci)的訓練成本估計為 4,324,883 美元。這是曲線上的轉折點:訓練模型從此不再是研究經費的一個項目,而是一項資本決策。

  5. 2021 年 · Megatron-Turing NLG

    640 萬美元,換 5,300 億個參數

    Megatron-Turing NLG 530B 的訓練成本估計為 6,405,653 美元。這個階段成本還在緩步上升 — 陡峭的那一段,還要再一年才會出現。

  6. 2022 年 · PaLM(540B)

    1,240 萬美元 — 而同一年內部就差了十倍

    PaLM(540B)的訓練成本估計為 12,389,056 美元,而同年釋出的 LaMDA 只有 1,319,586 美元。到 2022 年,「訓練一個模型要多少錢」的答案,幾乎完全取決於你指的是哪一個模型。

  7. 2023 年 · GPT-4 與 Gemini Ultra

    同一年,7,800 萬美元與 1.91 億美元

    AI 指數估計 GPT-4 的訓練運算成本為 78,352,034 美元,Gemini Ultra 為 191,400,000 美元;OpenAI 執行長 Sam Altman 則表示 GPT-4 的訓練費用超過 1 億美元。同年釋出的 Llama 2 70B 估計為 3,931,897 美元 — 前沿與「堪用」之間,如今已是兩個價格級距。本章指出,這樣的漲勢實質上把大學排除在尖端基礎模型的開發之外,而美國國家 AI 研究資源等政策,正是為了把非產業界缺少的算力補回去而設。

資料會不會用完 — 以及為什麼合成資料不是乾淨的替代品

1.3 節裡的專題。Epoch AI 用兩種方法推估各類訓練資料存量何時見底:一種依訓練資料集規模的歷史成長率,一種依算力可得性調整;另外兩份 2023 年的研究,則測試了改餵模型自己產出的資料會發生什麼事。點卡片看細節。

高品質語言資料:大約就是現在

Epoch 的歷史推估把耗盡時點放在 2024.5 年,90% 信賴區間為 2023.5 到 2025.7 年。

dataprojections

低品質語言資料:2030 年代

歷史推估為 2032.4 年;以算力調整後則往後推到 2040.5 年。

dataprojections

影像資料:2030 年代末到 2040 年代中

歷史推估為 2046 年;這一類反而是算力調整後的推估較悲觀,落在 2038.8 年。

dataprojections

模型崩潰:分布的尾端消失了

一支英國與加拿大的研究團隊發現,主要以合成資料訓練的模型,會失去記住真實資料分布的能力。

syntheticresearch

模型自噬失調(MAD)

2023 年一份影像研究把同樣的失效命名為 MAD(取自狂牛症),並用三種指標量了出來。

syntheticresearch

1.4 與 1.5 — 研討會的人潮回流,開源則直接垂直起飛

AI 指數追蹤的研討會,2023 年參與人數成長 6.7%,回到約 63,300 人,在活動全面實體化之後止跌回升。GitHub 上的變化則是另一個量級:AI 專案一年之內成長 59.3%,拿到的星數更是增加三倍以上。

研討會

  • 受追蹤研討會的總參與人數在 2023 年達到約 63,300 人 — 較前一年成長 6.7%,也比 2015 年多出約 50,000 人。其中一部分成長來自新增的研討會,而不是既有活動變大。
  • NeurIPS 仍是規模最大的一場,2023 年吸引約 16,380 名參與者,其次是 CVPR(約 8,340 人)、ICML(7,920 人)、ICCV(7,330 人)與 ICRA(6,600 人)。
  • 各場走勢並不一致:NeurIPS、ICML、ICCV 與 AAAI 都較前一年成長,CVPR、ICRA、ICLR 與 IROS 則都小幅下滑。
  • 規模較小的場次中,IJCAI 約 1,990 人、AAMAS 970 人、FAccT 830 人。
  • 這些數字要保守看待 — 近幾年有多場採線上或混合形式,主辦方也表示線上參與人數很難精確統計。

開源 AI 軟體

  • GitHub 上的 AI 專案從 2011 年的 845 個成長到 2023 年的約 180 萬個,光是最近一年就大幅上升 59.3%。
  • 2023 年,美國開發者貢獻了 22.9% 的 GitHub AI 專案,印度以 19.0% 居次,歐盟加英國為 17.9%。中國為 3.0%,世界其餘地區合計 37.1%。
  • 美國的佔比自 2016 年起穩定下滑 — 不是因為美國的產出減少,而是其他地方漲得更快。
  • AI 專案獲得的新星數增加三倍以上,從 2022 年的 400 萬顆增至 2023 年的 1,220 萬顆。星數最高的多是 TensorFlow、OpenCV、Keras 與 PyTorch 這類函式庫。
  • 累計來看,美國專案握有約 1,045 萬顆星,領先歐盟加英國(453 萬)、中國(212 萬)與印度(192 萬)。所有被取樣的主要區域,星數都較前一年增加。

用五句話看這一章

第 1 章「研發」的頭條發現。

2023 年,產業界產出 51 個重要機器學習模型,學術界只貢獻了 15 個。同年另有 21 個重要模型出自產學合作,創下新高。
— Chapter 1 · Research and Development
2023 年共釋出 149 個基礎模型,是 2022 年的兩倍以上。這些新釋出的模型中有 65.7% 為開源,而 2022 年僅 44.4%、2021 年僅 33.3%。
— Chapter 1 · Research and Development
OpenAI 的 GPT-4 訓練估計用掉價值 7,800 萬美元的運算資源,而 Google 的 Gemini Ultra 光是運算就花了 1.91 億美元。
— Chapter 1 · Research and Development
2022 年,中國以 61.1% 在全球 AI 專利來源上居首,遠遠超過佔 20.9% 的美國。自 2010 年以來,美國的 AI 專利佔比已從 54.1% 一路下滑。
— Chapter 1 · Research and Development
自 2011 年以來,GitHub 上的 AI 相關專案持續增加,從 2011 年的 845 個成長到 2023 年的約 180 萬個,光是最近一年就大幅上升 59.3%。
— Chapter 1 · Research and Development

閱讀第 1 章原文

第 1 章(1.1 至 1.5 各節) — 論文、專利、前沿 AI 研究、研討會與開源軟體 — 連同所有圖表、註腳與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2024 →