AI Index Report 2022

2021 年最好的成績都帶著同一個星號:額外的訓練資料

AI 指數 2022 第 2 章橫跨視覺、語言、語音、推薦、強化學習、硬體與機器人,量的是 2021 年的技術進展。這一年的重點不是某個突破,而是一個模式:本章追蹤的 10 個基準裡,有 9 個的 2021 年最佳系統都靠額外資料預訓練 — 這等於把優勢悄悄交給手握最大資料集的人。同時,訓練成本大幅下降,強化學習也開始走向泛化。先看數字:

9本章 10 個基準中,2021 年最佳系統使用額外訓練資料的個數
1人類在 aNLI 上仍領先 AI 的百分點(2019 年為 9 分)
128.6% 通用強化學習基準 Procgen 相對 2019 年基準線的進步幅度
24.3% 最強西洋棋引擎超越 Magnus Carlsen 生涯最高 2,882 Elo 的幅度
4.592021 年把 ImageNet 分類器訓練到 93% 準確率的成本(美元;2017 年為 1,112.6)
22,6002021 年機器手臂的中位價格(美元;2017 年為 42,000)

資料、資料、資料 — 十個排行榜裡有九個靠它

本章第一條重點,是同一個詞連講三次。在這裡追蹤的十個基準中,2021 年有九個的最佳系統都在基準本身的訓練集之外額外預訓練過 — AI 指數直言,這個趨勢等於偏袒握有龐大資料集的私部門。

這件事之所以重要,是因為它改變了排行榜量的東西。一個依賴預訓練的分數,有一部分量的是誰湊得出那批預訓練語料,而不只是誰的架構設計得好。本章多半用兩條線並排來說明:在它畫出的幾乎每一個基準上,「有額外訓練資料」的曲線都壓在「沒有額外訓練資料」的曲線上面。

額外資料買到了什麼

  • ImageNet top-1 準確率:有額外訓練資料 90.88%,沒有則是 87.80%。
  • COCO 物件偵測:有額外資料的平均精度為 79.50%,沒有則是 77.10%。
  • Cityscapes 像素級語意標註:有額外資料的平均 IoU 為 86.20%,沒有則是 84.30%。
  • WMT 2014 翻譯:有額外資料時英法 46.40 BLEU、英德 35.14,沒有則分別是 43.95 與 31.26。
  • LibriSpeech Test Clean:有額外資料的字錯率為 1.4%,沒有則是 1.7% — 每聽 100 個字,最強的模型可以正確轉寫 99 個。

唯一沒幫上忙的地方

arXiv 文本摘要是本章的例外:沒有額外訓練資料的最佳 ROUGE-1 為 47.15,反而略高於有額外資料的 46.74。自 arXiv 開始被當作基準以來的五年間,摘要模型進步了 47.1% — 而曲線已經明顯趨緩。PubMed 從另一側講同一件事:有額外資料 48.25、沒有 47.81,自 2017 年以來進步 34.6%,但速度同樣放慢了。2021 年的榜首是 HAT,一個由 Birch AI 與華盛頓大學提出的階層式注意力 transformer。

五個有公布人類基準的測驗上,2021 年的最佳分數

2021 年回報的最高分。人類基準依同樣順序為 89.8、91.2、92.9、80.8 與 85.0 — 在單純的閱讀理解上 AI 領先 1 到 5 分,但只要任務同時要求溯因或常識推理,AI 依然落後。

五個有公布人類基準的測驗上,2021 年的最佳分數SuperGLUE:9191SuperGLUESQuAD 1.1:95.7295.72SQuAD 1.1aNLI:91.8791.87aNLIVQA:79.7879.78VQAVCR:7272VCR

2.3–2.4 — 閱讀理解已經結束,對讀到的東西進行推理還沒

AI 在 SuperGLUE 與兩組 SQuAD 上都已超越人類基準 1% 到 5%。但只要在同一段文字前面加上一道邏輯或溯因的步驟,排序就會反轉回來。

英語理解

  • SuperGLUE 於 2019 年 5 月推出,因為當時的系統已經快把 GLUE 做滿。如今它自己也到頂了:SS-MoE 拿下 91.0,高於基準開發者自己給出的人類分數 89.8。本章的判讀是,更難的一套題目又該出現了,而且要快。
  • SQuAD 取自 536 篇維基百科文章、共 107,785 組問答,如今 1.1 版的 F1 為 95.72、2.0 版為 93.21,雙雙高於 91.20 與 89.50 的人類基準。但兩者相對前一年都只是微幅進步:0.4% 與 0.2%。
  • 取材自 LSAT 邏輯推理題的 ReClor,就是停滯被打破的地方。最佳模型在簡單題組答對 91.82%,困難題組只有 69.29% — 同樣是閱讀,只要加上推理要求就掉了 22.5 分。
  • 艾倫人工智慧研究所的溯因推理基準 aNLI 共 170,000 組前提與假設,目前為 91.87%,人類基準是 92.90%。AI 自 2019 年以來進步 7.7 分,人類的領先則從 9 分縮到大約 1 分。
  • 比較簡單的語言任務已經收工。約 60 萬組標註句對的 SNLI 在 2021 年 4 月被 Facebook AI 的 EFL 以 93.10% 拿下。在取自 7,686 則餐廳與筆電評論的 SemEval 2014 情感分析上,最佳成績為 88.64%:2016 年是十次猜對七次,現在是十次對九次。

翻譯與語音

  • 在 WMT 2014 上,最佳 BLEU 為英法 46.40、英德 35.14。自開始收件以來,英法進步 23.7%、英德進步 68.1% — 較難的德語對正在快速追上,但絕對翻譯品質仍是法語明顯較高。
  • 取得管道也變寬了。商用機器翻譯服務數量自 2017 年以來成長近五倍,2021 年還多了三個開源服務:M2M-100、mBART 與 OPUS。
  • 語音辨識在主要基準上實質已經持平。2021 年 LibriSpeech Test Clean 沒有出現新的最佳成績,因為既有系統的字錯率已經只有 1.4%。在雜訊較多的 Test Other 上,MIT 與 Google Brain 合作的 W2V-BERT 拿下 2.0%。
  • 語者辨識進步得更快。在 VoxCeleb 上,2017 年還是 7.8% 等錯誤率的系統,如今回報 0.42%。

2.1–2.2 — 視覺快沒有空間了,於是研究往旁邊移動

影像分類、姿態估計與息肉切割,都離各自的上限只剩一兩分。2021 年真正的移動不是向上,而是橫向 — 移往更窄、更臨床、更能落地的子任務。

影像

  • ImageNet top-1 準確率為 90.88%:2021 年底,領先系統平均每十次判斷錯一次,2012 年底則是每十次錯四次。Top-5 準確率為 99.02%,遠超過 94.90% 的人類基準,微軟的 Florence-CoSwin-H 在 2021 年 11 月達到 99.0%。本章對接下來會怎樣講得很直白 — 一套系統一百次對九十八、九十九次,能再往上的空間就是那麼多。
  • 影像生成用 Fréchet Inception Distance 衡量,分數為零代表生成影像與真實影像完全相同。2021 年的最佳成績是 STL-10 上的 7.71(韓國科學技術院與首爾市立大學),以及解析度較低的 CIFAR-10 上的 2.10(NVIDIA)。
  • 深偽偵測跟上了深偽生成。以 FaceForensics++ 四個資料集平均計算,準確率從 2012 年的 69.9% 升到 2021 年的 97.7%。由 590 支名人影片改造出 5,639 支深偽影片的 Celeb-DF 難上大約 20 分,最佳 AUC 為 76.88。
  • 姿態估計正在飽和。最佳模型在 Leeds Sports Poses 上答對 99.50% 的關鍵點,滿分是 100.0%。在三維的 Human3.6M 上,平均每關節誤差從 2014 年的 16 公分(半把學生尺)降到 2021 年的 1.9 公分,比一個迴紋針還小。
  • 人臉辨識方面,2017 年部分領先演算法在某些 FRVT 測試上的錯誤率超過 50.0%;到 2021 年沒有任何一個超過 3.0%,跨所有資料集表現最好的簽證照片項目,每一千張臉只錯一張。戴口罩仍會付出代價 — 錯誤不匹配率戴口罩 0.014、不戴 0.002 — 但差距自 2019 年起已縮小;北京郵電大學新釋出的 6,000 張遮罩人臉資料集 MLFW 則把代價估在 5 到 16 個百分點。美國 24 個聯邦機關中,已有 18 個在使用某種人臉辨識技術。
  • 視覺推理是這一節的例外。在 VQA 挑戰上最高分為 79.78%,仍不及 80.80% 的人類基準,不過相對 2015 年的 55.4% 已進步 24.4 分。

影片

  • 現在有單一模型同時稱霸三個 Kinetics 動作辨識資料集:Google Research、密西根州立大學與布朗大學於 2022 年 1 月釋出的 MTV,在 400 系列拿下 89.1%、600 系列 89.6%、700 系列 82.20%。更值得注意的是收斂 — 最簡單與最難資料集之間的差距,從 2020 年的 27.14 分降到 2021 年的 7.4 分,代表較難的資料集進步得比較快。
  • 在 COCO 物件偵測上,GLIP 的平均精度達 79.50%,比 2016 年高出 23.8 分。
  • 刻意用準確率換推論速度的 YOLO 來到 72.40%,比 2017 年高 28.4 分,與最強偵測器的差距也從 11.7% 縮到 7.1%。偵測器同時變得又快又準。
  • ActivityNet 的時序動作定位要求同時判斷「何時發生」與「是什麼」,目前由 HUST-Alibaba 以 44.67% 領先,比 2016 年高 26.9 分,但每年的增幅都在縮小。
  • 視覺常識推理是本章人機差距最大的項目 — 它取自 110,000 個電影情境、共 290,000 組選擇題,系統不只要選出答案,還要選出理由。最佳成績為 72.0,人類基準是 85.0;自 2018 年以來進步 63.6%,但改善幅度已愈來愈小。

一個很窄的醫療基準,三年之間的注意力變化

以 Kvasir-SEG 為測試對象的學術論文數 — 那是一組由醫師手動切割的 1,000 張腸胃道息肉影像。本章把這個跳升讀為一個證據:AI 研究正在轉向有直接、真實應用的題目。

一個很窄的醫療基準,三年之間的注意力變化2020 年前:332020 年前2020 年:662020 年2021 年:25252021 年

2.5–2.8 — 代理更泛化、訓練更便宜、手臂更買得起

本章的後半講的是部署經濟學:一個代理變得多泛化、訓練一套系統要多少錢、要花多久,以及一間實驗室要付多少錢,才能在桌上擺一支機器手臂。

從窄技能走向通用技能

  • 在 Atari-57 上,DeepMind 的 MuZero 在 2019 年底以勝過前一名 48.3% 的成績刷新紀錄。2021 年,清華大學與位元組跳動的 GDI-H3 不只超越,還幾乎翻倍 — 而且只用了 2 億個訓練影格,MuZero 用的是 200 億個。效果兩倍,效率一百倍。
  • 真正檢驗泛化的是 Procgen:OpenAI 在 2019 年推出的 16 個程序生成環境,設計目的就是懲罰只學會一項窄技能的系統。MuZero 在 2021 年 11 月拿下 0.6,相對 2019 年的基準線進步 128.6%。
  • 西洋棋則是相反的案例 — 一項被追蹤數十年的窄技能。最強引擎目前是 3,581 Elo,比 Magnus Carlsen 在 2014 年寫下、也是人類有紀錄以來最高的 2,882 高出 24.3%。
  • 推薦系統幾乎沒動。MovieLens 20M 的最佳 nDCG 為 0.448,比 2018 年好 5.2%;Criteo 點擊率預測的最佳 AUC 為 0.813,比 2016 年的榜首高 1.8%。本章另外補了一句值得記住的話:多數推薦研究發生在企業內部,而企業完全有動機不公開,因此這些學術指標未必反映真正的技術前沿。

訓練變便宜了

  • MLPerf 影像分類的訓練時間,從 2018 年的 6.2 分鐘降到 2021 年的 0.2 分鐘,也就是 13.8 秒,約進步 27 倍。推薦、輕量物件偵測、影像分類與語言處理,如今都能在一分鐘內訓練到基準水準。
  • 把 ImageNet 分類器訓練到 93% 準確率,2017 年要 1,112.6 美元,2021 年只要 4.59 美元:四年之間差了 223 倍。若從 MLPerf 競賽開始的 2018 年起算,成本下降 63.6%,訓練時間改善 94.4%。
  • 這個速度是用硬體換來的,而硬體正在集中。使用的加速器數量上限自 2018 年以來成長約七倍,達到 4,320 顆;所有參賽者的平均值成長 3.5 倍,來到 337 顆。最強系統平均用掉 1,785 顆 — 而頂尖系統與整體平均之間的落差,2021 年底比 2018 年大了九倍。

機器手臂變便宜了

本版新增的是 AI 指數自行執行的調查,對象是頂尖大學與新興經濟體的機器人學教授:來自 40 多所大學的 101 位教授與研究者,涵蓋 2016 至 2022 年間的 117 筆機器手臂採購。中位價格五年內下降 46.2%,從 2017 年每支 42,000 美元降到 2021 年約 22,600 美元 — 機器人研究實質上變得更容易進入。被問到使用哪些 AI 技術時,67.0% 的受訪者回答深度學習,46.0% 回答強化學習。

最快的系統各花多久訓練完一項任務

2021 年 MLPerf 最佳系統的實際訓練時間(分鐘);此處的物件偵測是重量級版本,輕量級版本只要 0.34 分鐘。強化學習是異數 — 它是唯一在 2020 與 2021 年都沒有刷新紀錄的類別。

最快的系統各花多久訓練完一項任務強化學習:13.5713.57強化學習物件偵測:3.243.24物件偵測語音辨識:2.382.38語音辨識影像切割:1.261.26影像切割影像分類:0.230.23影像分類

2021 年底,紀錄在誰手上

六套在年底時仍握有最佳成績的系統,以及每個成績真正證明了什麼。

GDI-H3 · Atari-57

在 57 款 Atari 遊戲的測試組上幾乎把 MuZero 的分數翻倍,用掉的訓練影格卻只有百分之一。

reinforcementefficiency

SS-MoE · SuperGLUE

在 2019 年為了「夠難」而打造的基準上拿到 91.0,比設計者自己訂的人類分數高出 1.2 分。

languagebenchmarks

MSRF-Net · 醫療影像切割

在 CVC-ClinicDB 上以 94.20%、Kvasir-SEG 上以 92.17% 切割大腸鏡息肉 — 這是這一年 AI 走向臨床最明確的例子。

visionmedicine

GLIP · COCO 物件偵測

在 COCO 上取得 79.50% 平均精度,比 2016 年高 23.8 分 — 也是額外資料趨勢的教科書案例。

visionbenchmarks

MTV · 三組 Kinetics 全拿

第一個同時稱霸 Kinetics-400、600 與 700 的模型,分別是 89.1%、89.6% 與 82.20%。

video

W2V-BERT · LibriSpeech Test Other

在 LibriSpeech 較吵的那一半上取得 2.0% 字錯率 — 乾淨的那一半在 2021 年根本沒有新紀錄。

speech

本章自己的說法

第 2 章裡的五句話,承載了這一年的論點。

截至 2021 年,本報告 10 個基準中有 9 個的最先進 AI 系統是用額外資料訓練的。這個趨勢實質上偏袒了握有龐大資料集的私部門。
— Chapter 2 · Chapter Highlights
2019 年人類在 aNLI 上比 AI 高 9 個百分點。到 2021 年,這個差距已縮小到 1。
— Chapter 2 · Chapter Highlights
最強的西洋棋軟體引擎如今超越 Magnus Carlsen 的最高 ELO 分數 24%。不過在過去兩年,AI 系統在更通用、必須在陌生環境中運作的強化學習任務(Procgen)上,也進步了 129%。
— Chapter 2 · Chapter Highlights
SuperGLUE 上的進展來得如此之快,意味著研究者必須開發更複雜的自然語言任務組合,才能挑戰下一代的 AI 系統。
— Chapter 2 · 2.3 Language
AI 指數的調查顯示,機器手臂的中位價格在過去五年下降了 46.2% — 從 2017 年每支 42,000 美元降到 2021 年的 22,600 美元。機器人研究變得更容易取得、也更負擔得起。
— Chapter 2 · Chapter Highlights

閱讀第 2 章原文

第 2 章(2.1–2.8 各節) — 影像與影片的電腦視覺、語言、語音、推薦、強化學習、硬體與機器人 — 連同所有圖表、註腳與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2022 →