AI Index Report 2023

2022 年,AI 研究的前沿徹底搬進了企業裡

AI 指數 2023 第 1 章追蹤 AI 知識的產地:論文、重要機器學習系統、大型語言與多模態模型、研討會與開源程式碼。產出持續攀升 — 2021 年全球發表近 50 萬篇 AI 論文,是 2010 年的兩倍以上,其中四分之三仍出自大學。但 2022 年真正推動前沿的系統,產業界釋出 32 個,學術界只有 3 個。先看數字:

496.012021 年全球 AI 論文數(千篇;2010 年約為 200)
322022 年產業界釋出的重要機器學習系統數(學術界為 3)
540PaLM 的參數量(十億);約為 GPT-2 15 億參數的 360 倍
8.012022 年訓練 PaLM 的估計成本(百萬美元;2019 年 GPT-2 約 0.05)
54.2% 2022 年大型語言與多模態模型出自美國機構的比例
347,9342022 年 GitHub 上的 AI 專案數(2011 年為 1,536 個)

1.1 — AI 論文是 2010 年的兩倍,底下的組成也變了

本版的論文資料停在 2021 年,因為一年的論文往往要到隔年年中才收得齊。以此為準:2021 年全球產出 496,010 篇 AI 論文,2010 年約為 200,000 篇。12 年之間,期刊論文成長約 3 倍、預印本平台成長 26.6 倍 — 研討會論文則自 2019 年起一路下滑。

2021 年,60% 的 AI 出版品是期刊論文,17% 是研討會論文,13% 是預印本平台的投稿;書籍、書籍章節、學位論文與未分類則佔剩下的 10%。這種往期刊與預印本傾斜的變化並不只是表面。研討會論文在 2019 年達到高峰,2021 年的 85,094 篇比高峰低了 20.4% — 只比 2010 年的 75,592 篇略多一些。

論文在寫什麼,又是誰在寫

  • 過去五年成長最快的是模式識別與機器學習:自 2015 年起,模式識別論文約增加一倍,機器學習論文約增加三倍。2021 年發表量次高的領域依序是電腦視覺(30,075 篇)、演算法(21,527 篇)與資料探勘(19,181 篇)。
  • 寫論文的主力仍是大學。2021 年教育部門佔 AI 論文的 75.2%,非營利組織 13.6%,產業界 7.2%,政府機構 3.7%。產業界參與度最高的是美國,其次是歐盟。
  • 不過教育部門的佔比自 2010 年起在每個區域都在下滑 — 研究基礎正在向外擴散,而不是往大學集中。
  • 成長真正發生在跨部門合作上:2021 年教育機構與非營利組織合著 32,551 篇,產業界與教育機構 12,856 篇,教育機構與政府 8,913 篇。
  • 其中產學合作是成長最快的類別之一,自 2010 年以來增加了 4.2 倍。

美中軸線仍然最大 — 而它剛剛停止成長

2010 至 2021 年間,沒有任何一組國家在 AI 研究上的合作多過美國與中國。這段期間雙方合著的論文成長約 4 倍,2021 年達到 10,470 篇,是第二名的英國與中國的 2.5 倍。但曲線已經走平:美中合作論文從 2020 到 2021 年只增加 2.1%,是 2010 年以來最小的年增幅。

期刊撐起這個領域,預印本則是成長最快的發表管道

2021 年各類型 AI 論文數量(千篇)。過去 12 年間,期刊論文成長約 3 倍、預印本投稿成長 26.6 倍,而研討會論文自 2019 年起逐年下滑。

期刊撐起這個領域,預印本則是成長最快的發表管道期刊:293.48293.48期刊研討會:85.0985.09研討會預印本:65.2165.21預印本學位論文:29.8829.88學位論文書籍章節:13.7713.77書籍章節

中國在數量上領先,美國則在被引用上仍然領先

2021 年,中國在全球 AI 期刊論文(39.8%)與研討會論文(26.2%)上佔比最高。美國則在預印本論文(23.5%)、研討會引用(23.9%)與預印本引用(29.2%)上領先 — 但報告指出,這些領先正在緩慢流失。

期刊、研討會、預印本:三張不一樣的地圖

  • 2021 年 AI 期刊論文:中國 39.8%,歐盟加英國 15.1%,美國 10.0%,印度 5.6% — 印度的佔比從 2010 年的 1.3% 一路穩定上升。
  • 2021 年 AI 期刊引用:中國 29.1%,歐盟加英國 21.5%,美國 15.1%。這三方合計拿下全球 AI 期刊引用的 65.7%。
  • 2021 年 AI 研討會論文:中國 26.2%,是在 2017 年超越歐盟加英國的;歐盟加英國以 20.3% 居次,美國 17.2%。但研討會引用仍由美國以 23.9% 領先中國的 22.0%,而且差距正在縮小。
  • 2021 年 AI 預印本論文:美國 23.5%,歐盟加英國 20.5%,中國 11.9%。美國同時拿下 29.2% 的預印本引用,高於歐盟加英國(21.5%)與中國(21.0%)。
  • 以區域來看,2021 年東亞與太平洋地區產出 47.1% 的 AI 期刊論文與 36.7% 的研討會論文。南亞在研討會論文的佔比 12 年間增加超過一倍,從 2010 年的 3.6% 升到 2021 年的 8.5%。

發表量最高的十所機構

自 2010 年以來,產出最多 AI 論文的單一機構是中國科學院,緊接在後的四所也全是中國的大學。2021 年,中國科學院發表 5,099 篇 AI 論文,清華大學 3,373 篇,中國科學院大學 2,904 篇,上海交通大學 2,703 篇,浙江大學 2,590 篇。麻省理工學院以 1,745 篇成為全球前十名中唯一的非中國機構。報告自己也加了但書:許多中國研究機構規模龐大、組織集中,動輒數千名研究者,單看論文篇數自然對它們有利。

全球每十篇 AI 期刊論文,就有四篇掛著中國的機構

2021 年 AI 期刊論文佔世界總數的比例(%)。中國在這裡的領先幅度,遠大於研討會論文(26.2%)或預印本投稿(11.9%) — 那兩張圖的樣貌很不一樣。

全球每十篇 AI 期刊論文,就有四篇掛著中國的機構中國:39.7839.78中國歐盟與英國:15.0515.05歐盟與英國美國:10.0310.03美國印度:5.565.56印度

1.2 — 產業界 32 個重要系統,學術界 3 個

Epoch AI 統計 2022 年釋出的重要機器學習系統共 38 個。2014 年以前,這類系統多半出自學術界。2022 年產業界釋出 32 個,學術界 3 個,研究集體 2 個,還有 1 個是產學合作。非營利組織掛零。

報告的解釋很直接:打造最先進的 AI 系統,愈來愈需要大量資料、運算力與金錢 — 而這些資源,產業界擁有的份量遠多於非營利組織與學術界。重要系統所使用的運算量在過去五年呈指數成長,而自 2010 年起,語言模型一直是吃掉最多運算資源的類別。愈耗運算的模型,環境衝擊也愈大,而產業界取得這些資源的難度遠低於大學。

造了什麼,又是誰造的

  • 以領域來看,2022 年釋出最多的是語言系統,共 23 個 — 約為第二名多模態系統(4 個)的六倍。繪圖系統 3 個,視覺與語音各 2 個。
  • 以國家來看,2022 年產出最多重要系統的是美國(16 個),其次是英國(8 個)與中國(3 個);加拿大與德國各 2 個。
  • 改看人數而非系統數,差距更大。2022 年參與重要系統開發的作者中,285 位隸屬美國機構,英國 139 位,中國 49 位 — 是英國的兩倍多,將近中國的六倍。
  • 這不是新現象:自 2002 年以來,美國在累計的重要機器學習系統數上,一直領先歐盟加英國,也領先中國。

2022 年,是誰釋出了重要的機器學習系統

2022 年各部門釋出的重要機器學習系統數量。非營利組織掛零。2014 年以前,這份統計每一年都由學術界領先。

2022 年,是誰釋出了重要的機器學習系統產業界:3232產業界學術界:33學術界研究集體:22研究集體產學合作:11產學合作

訓練 2022 年那些旗艦模型的價碼

本版新增的分析中,AI 指數依據各家揭露的硬體與訓練時間,估算了大型語言與多模態模型的訓練成本,並為每個數字標上中等、偏高或偏低的估計等級。結果證實了業界原本只能揣測的事:這些模型的訓練費用如今動輒數百萬美元,而成本與模型規模、運算量高度相關。

GPT-2 — 5 萬美元的起點

2019 年 2 月釋出,15 億個參數,估計訓練成本約 5 萬美元。

baseline

PaLM(540B) — 801 萬美元

Google 的 2022 年旗艦:5,400 億個參數,將近 GPT-2 的 360 倍,估計訓練成本 801 萬美元。

flagship

Megatron-Turing NLG 530B — 1,135 萬美元

AI 指數所有估計值中最貴的一次訓練,約 1,135 萬美元。

cost

Chinchilla — 211 萬美元

DeepMind 於 2022 年 5 月推出的模型,估計 211 萬美元 — 百萬美元級的訓練已經是常態,而不是極端值。

cost

BLOOM — 229 萬美元,而且沒有國籍

估計成本 229 萬美元,由超過 1,000 位國際研究者共同完成,國籍歸屬被列為無法判定。

collaboration

GLM-130B — 2022 年中國唯一的一個

2022 年中國唯一釋出的大型語言或多模態模型:來自清華大學的雙語模型,估計訓練成本 16 萬美元。

china

這一章對整個生態系回答的五個問題

研討會、開源程式碼,以及頭條數字底下的幾個爭論。

AI 研討會在萎縮嗎?
AI 指數追蹤的研討會總參與人數在 2021 年下滑,2022 年再次下滑至 59,450 人 — 但報告把原因歸給形式而非熱度:許多研討會在 2020、2021 年全面線上之後,2022 年改回混合或實體舉行,IJCAI 與 KR 更是完全實體。NeurIPS 仍是規模最大的其中之一,約 15,530 人,其次是 CVPR 約 10,170 人、ICML 約 7,730 人。單年增幅最大的是 ICRA,從 2021 年的 1,000 人跳到 2022 年的 8,008 人。報告也提醒,線上研討會的實際參與人數本來就很難精確測量,這些數字要保守看待。
開源 AI 現在有多大?
GitHub 上的 AI 專案從 2011 年的 1,536 個成長到 2022 年的 347,934 個。但貢獻者的分布和論文的分布完全是兩回事:截至 2022 年,印度開發者貢獻了 24.2% 的 GitHub AI 專案,歐盟加英國 17.3%,美國 14.0%,中國 2.4%。美國的佔比自 2016 年起持續下滑。若看星數 — GitHub 上相當於按讚的動作 — 美國專案的累計星數仍以 344 萬居首,高於歐盟加英國(234 萬)、中國(153 萬)與印度(46 萬),不過近幾年許多地區的新增星數都已趨於平緩。
研討會論文為什麼在減少?
研討會論文在 2019 年見頂,2021 年的 85,094 篇比高峰低了 20.4% — 只比 2010 年的 75,592 篇略多。同樣 12 年間,期刊論文成長約 3 倍,預印本投稿成長 26.6 倍。這一章沒有指定單一原因,但描述了機制:研究者愈來愈習慣先把未經同儕審查的論文丟到 arXiv、SSRN 這類平台,在投期刊與研討會之前就先分享成果,藉此加快資訊流通的循環。
學術界真的被擠出去了嗎?
被擠出去的是造模型,不是做研究。2022 年學術界釋出 3 個重要機器學習系統,產業界 32 個;報告也明講,最先進的系統如今需要的資料、運算力與金錢規模,是產業界握有而大學沒有的。但 2021 年教育部門仍產出全部 AI 論文的 75.2%,全球發表量前十名的機構中,有九所是大學或研究院。真正成長最快的是兩個世界之間的橋:產學合著在 2021 年達到 12,856 篇,是 2010 年的 4.2 倍。
美中研究正在脫鉤嗎?
資料顯示的是停滯,不是斷裂。美國與中國仍是 AI 論文合作規模最大的一組,2021 年合著 10,470 篇 — 約為 2010 年的 4 倍,也是第二名英國與中國的 2.5 倍。但 2020 到 2021 年只成長 2.1%,是 2010 年以來最小的年增幅。這一章自己的說法是:儘管美國與中國仍主導 AI 研發,研究活動正在愈來愈分散到更多地方 — 印度在 AI 期刊論文的佔比從 2010 年的 1.3% 升到 2021 年的 5.6%,南亞在研討會論文的佔比也從 3.6% 升到 8.5%。

用報告自己的話說一次

第 1 章裡撐起這一年的五句話。

2022 年,產業界產出了 32 個重要的機器學習模型,學術界只有 3 個。
— Chapter 1 · Chapter Highlights
打造最先進的 AI 系統,愈來愈需要大量的資料、運算力與金錢 — 而這些資源,產業界天生就比非營利組織和學術界擁有得更多。
— Chapter 1 · Chapter Highlights
PaLM 的規模約是 GPT-2 的 360 倍,成本高出 160 倍。而且不只 PaLM:整體而言,大型語言與多模態模型正在變得更大、也更貴。
— Chapter 1 · Chapter Highlights
美中合作論文的總數從 2020 到 2021 年只增加了 2.1%,是 2010 年以來最小的年增幅。
— Chapter 1 · 1.1 Publications
儘管美國與中國仍主導著 AI 研發,研究活動正在愈來愈分散到更多地方。
— Chapter 1 · Overview

閱讀第 1 章原文

第 1 章(1.1–1.4 各節) — 論文、重要機器學習系統、大型語言與多模態模型、研討會與開源軟體 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2023 →