AI Index Report 2023

計分板不動了 — 於是 2022 年重新造了幾塊

AI 指數 2023 第 2 章衡量 2022 年在視覺、語言、語音、強化學習與硬體上的技術進展。重點不是躍進而是高原:最先進成績仍持續出現,但在多數基準上只多贏了一點點。真正躍進的是生成式 AI — 以及訓練它的代價。先看數字:

4% AI 指數追蹤的各項基準,年度進步幅度中位數
7全年進步達 5% 以上的基準數量 — 其餘全都低於此
204BIG-bench 的任務數,2022 年 6 月由 132 個機構的 442 位作者共同推出
91% 2022 年 ImageNet top-1 準確率 — 全年只進步 0.1 個百分點
75.2% Flan-PaLM 的 MMLU 分數,當年最佳的多任務語言成績
502GPT-3 訓練排放的二氧化碳當量噸數(BLOOM 為 25 噸)

2.6 — 是基準先沒空間了,不是模型

貫穿整章的主題是飽和。2022 年 AI 仍不斷刷新紀錄,但在 AI 指數追蹤的多數測驗上,新紀錄只比去年好一點點 — 而且基準觸頂的速度還在加快。

若以各基準推出以來的相對變化來衡量,進步幅度中位數是 42.4%;若只看過去一年,中位數是 4%。本章涵蓋的基準裡,除了七個以外,全年進步都不到 5%。AI 指數這一版還把兩個長年常客 SQuAD1.1 與 SQuAD2.0 整個拿掉 — 因為兩者都沒有新的最先進成績出現。

高原長什麼樣子,一個基準一個基準看

  • ImageNet:最強的影像分類器達到 91.0% 的 top-1 準確率。這比十年前高了 27.7 個百分點 — 但只比去年高 0.1 個百分點。
  • MPII 人體姿態估計:ViTPose 正確標出 94.3% 的關節點,比 2020 年創下的紀錄只多 0.2 個百分點。
  • Cityscapes 語意分割:mIoU 86.46%,自 2014 年競賽開辦以來累積進步 23.4 個百分點,但近幾年已經打平。
  • COCO 物件偵測:來自中國學術合作團隊的 EVA 達到 81.9% mAP50 — 偵測器自 2015 年以來累積進步 26 個百分點。
  • Kvasir-SEG 醫學影像分割:平均 Dice 94.11%。Celeb-DF 深偽偵測:AUC 78。Procgen 強化學習:最小最大正規化平均分數 0.57。
  • 人臉辨識實質上已經結束。在 NIST FRVT 的每一組資料上,除了 WILD Photos 之外,最佳模型的錯誤率都已低於 1%,而在 VISA Photos 上只有 0.06%。

應對方式:更大、更全面的測驗套組

研究者對飽和的回應,是打造更難跑完的評測。2022 年 6 月,132 個機構的 442 位作者推出 BIG-bench(Beyond the Imitation Game),共 204 項任務,橫跨語言學、兒童發展、數學、常識推理、生物、物理、社會偏見與軟體開發。同年 11 月,史丹佛研究者釋出 HELM(Holistic Evaluation of Language Models),試圖用統一標準評判語言模型,而不是一次只看一個分數。Google 的 Imagen 團隊則在發表模型的同時推出 DrawBench,正是因為既有的文字轉圖像基準已經分不出高下。

2022 年 AI 站在人類基準的哪一邊

四項附有人類基準的測驗,2022 年最先進分數(%)。AI 在 aNLI(人類 92.90)、SuperGLUE(89.80)與 VQA v2(80.78)上都已越線,唯獨視覺常識推理仍在人類基準 85.00 之下。

2022 年 AI 站在人類基準的哪一邊aNLI:93.6593.65aNLISuperGLUE:91.391.3SuperGLUEVQA v2:84.384.3VQA v2VCR:75.675.6VCR

2.1 — 生成式 AI 走進大眾視野的那一年

從本章時間軸中挑出的幾則 2022 年重大 AI 進展,這份名單由 AI 指數指導委員會選定。

  1. 2022 年 2 月 2 日

    AlphaCode · DeepMind

    一套能以競賽水準撰寫電腦程式的 AI 系統,在人類程式競賽中擠進前 54% 的參賽者之列 — 而複雜問題求解正是 AI 一向不擅長的領域。

  2. 2022 年 4 月 5 日

    PaLM · Google

    全球規模最大的語言模型之一,共 5,400 億參數。PaLM 強化了當時的主流信念 — 只要餵更多資料訓練,效能就會變好。

  3. 2022 年 4 月 13 日

    DALL·E 2 · OpenAI

    能依文字描述生成寫實藝術與影像的文字轉圖像系統。AI 指數把它的公開釋出,標記為點燃生成式 AI 熱潮的那一刻。

  4. 2022 年 5 月 12 日

    Gato · DeepMind

    一個能同時做機器手臂操作、玩遊戲、影像描述與自然語言生成的強化學習代理 — 顯示 AI 的泛化能力正在提升。

  5. 2022 年 6 月 9 日

    BIG-bench · 442 位作者

    為了更有效地挑戰日益強大的大型語言模型,132 個機構的 442 位作者推出 Beyond the Imitation Game 基準:204 項任務,從語言學、兒童發展一路到物理與軟體開發。

  6. 2022 年 6 月 21 日

    Copilot 開賣 · GitHub

    GitHub 把 Copilot 以訂閱制開放給個別開發者。它能把自然語言提示轉成多種語言的程式碼建議;調查顯示它讓工程師更有生產力、也更少受挫。同類系統還有 OpenAI 的 Codex 與 Salesforce 的 CodeGen。

  7. 2022 年 8 月 22 日

    Stable Diffusion · Stability AI

    一個開源的文字轉圖像擴散模型,任何人都能自由取用其權重。它以既有的人類創作影像訓練,卻不註明來源或給予署名,留下了影像生成器倫理使用的疑問。

  8. 2022 年 9 月 21 日

    Whisper · OpenAI

    以約 700,000 小時音訊訓練的大規模語音辨識系統。它既不需要監督式預訓練,也不需要非監督訓練加微調,卻表現優異 — 再一次驗證了單純擴大訓練資料的做法。

  9. 2022 年 11 月 16 日

    HELM · 史丹佛

    Holistic Evaluation of Language Models 是一套新的評測方法,改以更統一的標準評判語言模型 — 顯示這個領域正試圖為愈來愈強大的系統建立透明度。

  10. 2022 年 11 月 30 日

    ChatGPT · OpenAI

    一個人人可用、能寫出大學程度文章的聊天機器人。上線幾個月後就達到一億月活躍使用者,成為史上成長最快的消費性應用 — 也為生成式 AI 進入時代精神的這一年畫下句點。

2.2–2.5 — 輸入文字、輸出圖像:生成技術成為主流的一年

分類基準一路平坦的同時,生成並沒有停下來。2022 年,文字轉圖像、文字轉影片與語音都推出了一般使用者真的碰得到的系統。

文字轉圖像

DALL·E 2、Stable Diffusion、Midjourney、Meta 的 Make-A-Scene 與 Google 的 Imagen 在短短數月內接連登場。AI 指數用同一句提示 —「a panda playing a piano on a warm evening in Paris」— 分別餵給 DALL·E 2、Stable Diffusion 與 Midjourney 並排比較。在 MS-COCO 256×256 FID-30K 基準上(Fréchet Inception Distance 愈低愈好),Imagen 以 7.27 領先,其次是 Make-A-Scene 的 7.55 與 DALL·E 2 的 10.39;作為對照,2017 年的 AttnGAN 是 35.49。Google 在發表 Imagen 的同時推出更難的 DrawBench,因為文字轉圖像模型已經長得比舊測驗還大。

文字轉影片

  • 5 月,清華大學與北京智源人工智慧研究院釋出 CogVideo,以 50.46 的 inception score 拿下當時 UCF-101 文字轉影片基準的最高分。
  • 9 月,Meta 的 Make-A-Video 以 82.55 的 inception score 大幅超越 — 在 UCF-101 上比 CogVideo 好 63.6%。
  • 10 月,Google 釋出 Phenaki,不過這個模型並未在 UCF-101 上評測。
  • 本章加註的但書是:這些模型雖然驚人,但目前都只能生成幾秒鐘長的影片。

一個模型,多種技能

AI 傳統上擅長狹窄任務,卻不擅長在任務之間切換。2022 年這個界線開始鬆動。微軟的 BEiT-3 一口氣在四項視覺技能與五項視覺語言技能上都拿下最先進成績 — 在 NLVR 視覺推理上達到 92.60,超越先前最佳的 87.00,進步 6.44%,是九項中幅度最大的。Google 的 PaLI 則以 84.30% 登上 VQA v2 榜首,高於 80.78% 的人類基準。這兩個都是單一系統,做的是過去得動用好幾個系統才做得到的事。

語音

2022 年,規模擴張的做法也來到了語音領域。以 700,000 小時音訊、弱監督方式訓練的 Whisper,在一系列英語語音辨識基準上勝過 wav2vec 2.0 Large,並在 CoVoST 2 的 X→EN 子集上以 29.1 BLEU 勝過 MAESTRO 的 25.2,超越多個頂尖翻譯模型。在 Kincaid46 上,它 8.81% 的中位字錯誤率贏過所有受測的商用語音辨識服務。但它並非樣樣最好:在 FLEURS 語言辨識上,零樣本的 Whisper 只有 64.5%,而 mSLAM-CTC 有 77.7%。另一方面,在原始的 VoxCeleb 語者辨識資料集上,美國研究者寫下 0.1% 的等錯誤率,比前一年的最先進成績再降 0.28 個百分點。

2.9 — 全世界最好的新科學家 …… 是 AI?

2022 年,AI 不再只是被研究的對象,而是開始動手做研究。以下是本章的六個案例 — 其中兩個是拿 AI 來改進 AI。點任一張卡片看細節。

用學習控制核融合電漿

DeepMind 訓練強化學習代理,找出約束氫電漿的最佳托卡馬克操控程序。

science

AlphaTensor 改寫矩陣乘法

以強化學習找出更快的矩陣乘法演算法 — 這個問題研究者已經啃了 50 年。

algorithms

Nvidia GPU 裡的 AI 設計電路

Nvidia 的 PrefixRL 代理設計出比傳統 EDA 工具更小更快的晶片電路。

hardware

從零設計出來的抗體

生成模型以零樣本方式產出全新抗體 — 只生成一輪,不再優化。

biology

BCOOLER 幫 Google 機房降溫

強化學習代理在三個月的實驗中,把冷卻用電降低約 12.7%。

energy

PaLM 改進 PaLM

Google 研究者用自家的語言模型,去改進同一個模型的推理能力。

self-improvement

2.7–2.8 — 硬體變快也變便宜,帳單還是寄來了

這兩節其實該擺在一起看。每一塊錢買到的訓練速度不斷提升,正因如此模型才愈做愈大 — 也正因如此,這一版第一次替它們算出碳排數字。

硬體

  • 在 MLPerf 訓練競賽中,影像分類與物件偵測的頂尖系統,如今訓練速度約是 2018 年開賽時的 32 倍。2022 年在物件偵測、語音辨識、影像分割、推薦、影像分類與語言處理上全都創下新低,其中最快的語言處理只要 0.18 分鐘。
  • 這裡面有很大一部分是硬體堆出來的。MLPerf 參賽者使用的加速器數量最高達到 4,216 個;能拿下最佳成績的系統平均用了 1,859 個;而所有參賽者的平均只有 211 個。這道差距在競賽的每一年都在擴大。
  • 在 MLPerf 推論競賽上,頂尖影像分類器與語言處理器產出的離線樣本數,自 2020 年以來已經翻倍以上,推薦系統的吞吐量也成長約 23%。
  • GPU 效能持續往上:FP32 效能中位數自 2021 年以來將近三倍,自 2003 年以來則提升約 7,000 倍。
  • 真正決定規模擴張的是性價比。2022 年每美元的 FLOP/s 中位數是 2021 年的 1.4 倍、2003 年的 5,600 倍 — 相當於每 1.5 年翻一倍。

碳排

本章引用 Luccioni 等人 2022 年的研究,從參數量、資料中心能源使用效率(PUE)、電網碳強度、耗電量到排放量,比較四個大型語言模型。GPT-3(1,750 億參數、1,287 MWh、PUE 1.10、電網碳強度 429 gCO₂eq/kWh)排放最多,達 502 噸:是 Gopher 的 1.4 倍、OPT 的 7.2 倍、BLOOM 的 20.1 倍。這種比較並不完美 — 碳排放的計算方法至今沒有統一標準 — 但相對關係已經很清楚。四者中最乾淨的 BLOOM 只有 25 噸,卻仍相當於一名乘客紐約往返舊金山飛行排放量的 25 倍、一個美國人一年排放量的 1.4 倍,而它訓練所耗的電力足以供應一個美國家庭用 41 年。

一次訓練要付多少噸二氧化碳

以噸為單位的二氧化碳當量排放,資料出自 Luccioni 等人(2022)與 Strubell 等人(2019)。四個語言模型中有兩個的排放量,超過一輛車含燃料的一生;四個全都超過一個人一年的碳足跡。

一次訓練要付多少噸二氧化碳GPT-3:502502GPT-3Gopher:352352GopherOPT:7070OPT一輛車一生:6363一輛車一生BLOOM:2525BLOOM美國人一年:18.0818.08美國人一年

2022 年的系統還做不到什麼

對於「令人驚豔的展示」與「可靠的能力」之間的落差,以及這些分數本身值多少,本章講得異常直白。

大型語言模型會規劃與推理嗎?
並不真的會 — 而 2022 年正好出現了證明這件事的測驗。Valmeekam 等人建立了一套包含七項作業的規劃基準(計畫生成、成本最佳規劃、對計畫執行的推理、目標改述的穩健性、計畫重用、重新規劃、計畫泛化),並在 Blocksworld 環境中測試 GPT-3、Instruct-GPT3 與 BLOOM — 在這個環境裡,代理必須把不同顏色的積木排成指定順序。結果相當難看:計畫生成上三者分別是 0.6%、5.0% 與 0.5%;最佳規劃是 0.2%、3.2% 與 0%;計畫重用是 0%、14.4% 與 0%。它們在改述目標上好得多,某一項目標改述穩健性測試甚至達到 77.4%,但整體與人類相比仍差得很遠 — 作者認為這說明「有能力」跟「具備人類式推理」並不是同一件事。
語言模型到底進步了多少?
AI 指數自己做了一個小實驗:把同一句提示 —「Explain to me the major accomplishments of Theodore Roosevelt’s presidency」— 分別給 GPT-2(2019)、GPT-3(2020)與 ChatGPT(2022)。GPT-2 的回答大部分是胡言亂語,句子合乎文法,卻從頭到尾沒回答問題。GPT-3 有回應問題,但事實錯誤:把帶領美國走出大蕭條、投入二戰的功勞算到老羅斯福頭上(那是小羅斯福),也說他創立了國家公園管理局與國家野生動物聯盟(這兩者分別成立於 1916 與 1936 年,都在他任期之後)。ChatGPT 的答案最強:除了一項之外事實全對,而且比前兩者更完整也更精簡。
這些系統可以放心倚賴嗎?
本章的重點摘要說得很直白:不行。2022 年出現了 DALL·E 2、Stable Diffusion 這類文字轉圖像模型,Make-A-Video 這類文字轉影片系統,以及 ChatGPT 這類聊天機器人 —「然而,這些系統仍容易產生幻覺,會信心十足地輸出不連貫或不真實的回應,使人難以在關鍵應用中倚賴它們。」問題正出在那份自信:它的失效方式不是顯而易見的錯誤,而是一個聽起來很有道理的錯答案。
還有哪個視覺基準真的還沒被攻克?
還有幾個。視覺常識推理(VCR)是本報告中極少數 AI 尚未超越人類的視覺基準:2022 年最高的 Q→AR 分數是 75.60,人類基準則是 85.00。VCR 比 VQA 難,因為系統不只要選對答案,還要選對答案背後的推理。在影片方面,Kinetics-600(91.80%)與 Kinetics-700(84.00%)相差 7.8 個百分點,本章認為這代表 700 類別的資料集仍是個有意義的挑戰。而在人臉辨識上,WILD Photos 是 FRVT 中唯一錯誤率仍高於 1% 的資料集,為 2.97%。
這些進步幅度可以互相比較嗎?
不行,本章在註腳裡就講明了。飽和分析中的進步幅度是以相對變化呈現,而每個基準的參數各不相同 — 所以那張圖不應拿來跨基準比較進步幅度。同樣的提醒在本章其他地方也適用:MLPerf 比的是絕對牆鐘時間,FID 分數愈低愈好,VoxCeleb 用等錯誤率計分,Procgen 用最小最大正規化分數。把其中任何一個直接讀成「AI 進步了多少」,都是搞錯了範疇。

用本章自己的話說

五句話,取自第 2 章「技術表現」的重點摘要與內文。

AI 持續刷新最先進成績,但許多基準的年度進步幅度依然微小。而且,基準達到飽和的速度還在加快。
— Chapter 2 · Chapter Highlights
2022 年出現了 DALL-E 2、Stable Diffusion 這類文字轉圖像模型,Make-A-Video 這類文字轉影片系統,以及 ChatGPT 這類聊天機器人。然而,這些系統仍容易產生幻覺,會信心十足地輸出不連貫或不真實的回應,使人難以在關鍵應用中倚賴它們。
— Chapter 2 · Chapter Highlights
與人類相比,這些大型語言模型表現差得多,顯示它們雖然有能力,卻不具備人類的推理能力。
— Chapter 2 · 2.4 Language
AI 模型正開始快速加速科學進展,2022 年就被用來協助氫融合、提升矩陣運算效率,以及生成新的抗體。
— Chapter 2 · Chapter Highlights
Nvidia 用 AI 強化學習代理改良了驅動 AI 系統的晶片設計。同樣地,Google 近期也用自家的語言模型 PaLM,來提出改進同一個模型的方法。會自我改進的 AI 學習,將加速 AI 的進展。
— Chapter 2 · Chapter Highlights

閱讀第 2 章原文

第 2 章(2.1–2.9 各節) — 2022 年時間軸、影像與影片電腦視覺、語言、語音、強化學習、硬體、環境與 AI 做科學 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2023 →