高品質語言資料:大約就是現在
Epoch 的歷史推估把耗盡時點放在 2024.5 年,90% 信賴區間為 2023.5 到 2025.7 年。
AI 指數 2024 第 1 章追蹤 AI 知識的產地:論文、專利、重要模型、基礎模型、研討會與開源程式碼。論文與專利資料仍落後一年,因此那兩節講的是 2022 年;模型資料則更新到 2023 年。每一節的主軸都一樣 — 產出持續上升,而前沿持續往付得起錢的人手上移動。先看數字:
2010 至 2022 年間,AI 論文總數幾乎增為三倍,從約 88,000 篇增至超過 240,000 篇。但在可取得資料的最後一年,成長率只有 1.1% — 而同一年研討會論文卻跳升 30.2%。
總數這個數字藏了兩條走勢完全不同的曲線。期刊承載了絕大多數的 AI 研究 — 2022 年約有 232,700 篇期刊論文,研討會論文則約 41,200 篇 — 但研討會才是跑得比較快的那一半。自 2015 年起,研討會論文成長 2.6 倍,期刊論文成長 2.4 倍;而最近一年研討會產出上升 30.2%,期刊只有 4.5%。研討會論文從 2020 年的 22,727 篇增至 2021 年的 31,629 篇、2022 年的 41,174 篇,自 2010 年以來增加超過一倍。
光是 2021 到 2022 年,全球核准的 AI 專利就成長 62.7%,達到 62,264 件,自 2010 年以來增加超過 31 倍。其中 61.1% 來自中國;美國的佔比則從 2010 年的 54.1% 掉到 20.9%。
兩個數字就說完了整件事。Epoch AI 統計 2023 年產業界產出 51 個重要機器學習模型,學術界只有 15 個。史丹佛的 Ecosystem Graphs 則記錄到 149 個基礎模型 — 是 2022 年 72 個的兩倍以上,也接近 2019 年的 38 倍。
這一版首度與 Epoch AI 合作,推出扎實的訓練成本估算:依據訓練時長,以及訓練硬體的類型、數量與使用率,再以雲端運算租用價格換算,並調整通膨。把下面這串看完,就會明白大學為什麼實質上已經退出前沿模型的競賽。
AlexNet 是把「用 GPU 訓練 AI 模型」推成標準做法的論文之一,訓練估計需要 470 petaFLOP。十一年後的 Gemini Ultra,需要的算力是它的一億倍以上。
最初的 Transformer 提出了幾乎所有現代 LLM 都建立其上的架構。它需要約 7,400 petaFLOP,調整通膨後的訓練成本約 930 美元 — 一個研究生刷卡就付得起的金額。
RoBERTa Large 在 SQuAD、GLUE 等經典理解基準上取得當時最佳成績,訓練成本約 160,000 美元 — 兩年之後,已是 Transformer 的 170 倍左右。
GPT-3 175B(davinci)的訓練成本估計為 4,324,883 美元。這是曲線上的轉折點:訓練模型從此不再是研究經費的一個項目,而是一項資本決策。
Megatron-Turing NLG 530B 的訓練成本估計為 6,405,653 美元。這個階段成本還在緩步上升 — 陡峭的那一段,還要再一年才會出現。
PaLM(540B)的訓練成本估計為 12,389,056 美元,而同年釋出的 LaMDA 只有 1,319,586 美元。到 2022 年,「訓練一個模型要多少錢」的答案,幾乎完全取決於你指的是哪一個模型。
AI 指數估計 GPT-4 的訓練運算成本為 78,352,034 美元,Gemini Ultra 為 191,400,000 美元;OpenAI 執行長 Sam Altman 則表示 GPT-4 的訓練費用超過 1 億美元。同年釋出的 Llama 2 70B 估計為 3,931,897 美元 — 前沿與「堪用」之間,如今已是兩個價格級距。本章指出,這樣的漲勢實質上把大學排除在尖端基礎模型的開發之外,而美國國家 AI 研究資源等政策,正是為了把非產業界缺少的算力補回去而設。
1.3 節裡的專題。Epoch AI 用兩種方法推估各類訓練資料存量何時見底:一種依訓練資料集規模的歷史成長率,一種依算力可得性調整;另外兩份 2023 年的研究,則測試了改餵模型自己產出的資料會發生什麼事。點卡片看細節。
Epoch 的歷史推估把耗盡時點放在 2024.5 年,90% 信賴區間為 2023.5 到 2025.7 年。
歷史推估為 2032.4 年;以算力調整後則往後推到 2040.5 年。
歷史推估為 2046 年;這一類反而是算力調整後的推估較悲觀,落在 2038.8 年。
一支英國與加拿大的研究團隊發現,主要以合成資料訓練的模型,會失去記住真實資料分布的能力。
2023 年一份影像研究把同樣的失效命名為 MAD(取自狂牛症),並用三種指標量了出來。
AI 指數追蹤的研討會,2023 年參與人數成長 6.7%,回到約 63,300 人,在活動全面實體化之後止跌回升。GitHub 上的變化則是另一個量級:AI 專案一年之內成長 59.3%,拿到的星數更是增加三倍以上。
第 1 章「研發」的頭條發現。
2023 年,產業界產出 51 個重要機器學習模型,學術界只貢獻了 15 個。同年另有 21 個重要模型出自產學合作,創下新高。
2023 年共釋出 149 個基礎模型,是 2022 年的兩倍以上。這些新釋出的模型中有 65.7% 為開源,而 2022 年僅 44.4%、2021 年僅 33.3%。
OpenAI 的 GPT-4 訓練估計用掉價值 7,800 萬美元的運算資源,而 Google 的 Gemini Ultra 光是運算就花了 1.91 億美元。
2022 年,中國以 61.1% 在全球 AI 專利來源上居首,遠遠超過佔 20.9% 的美國。自 2010 年以來,美國的 AI 專利佔比已從 54.1% 一路下滑。
自 2011 年以來,GitHub 上的 AI 相關專案持續增加,從 2011 年的 845 個成長到 2023 年的約 180 萬個,光是最近一年就大幅上升 59.3%。
第 1 章(1.1 至 1.5 各節) — 論文、專利、前沿 AI 研究、研討會與開源軟體 — 連同所有圖表、註腳與引用,皆由史丹佛 HAI 免費提供。
開啟 AI 指數 2024 →