GDI-H3 · Atari-57
在 57 款 Atari 遊戲的測試組上幾乎把 MuZero 的分數翻倍,用掉的訓練影格卻只有百分之一。
AI 指數 2022 第 2 章橫跨視覺、語言、語音、推薦、強化學習、硬體與機器人,量的是 2021 年的技術進展。這一年的重點不是某個突破,而是一個模式:本章追蹤的 10 個基準裡,有 9 個的 2021 年最佳系統都靠額外資料預訓練 — 這等於把優勢悄悄交給手握最大資料集的人。同時,訓練成本大幅下降,強化學習也開始走向泛化。先看數字:
本章第一條重點,是同一個詞連講三次。在這裡追蹤的十個基準中,2021 年有九個的最佳系統都在基準本身的訓練集之外額外預訓練過 — AI 指數直言,這個趨勢等於偏袒握有龐大資料集的私部門。
這件事之所以重要,是因為它改變了排行榜量的東西。一個依賴預訓練的分數,有一部分量的是誰湊得出那批預訓練語料,而不只是誰的架構設計得好。本章多半用兩條線並排來說明:在它畫出的幾乎每一個基準上,「有額外訓練資料」的曲線都壓在「沒有額外訓練資料」的曲線上面。
arXiv 文本摘要是本章的例外:沒有額外訓練資料的最佳 ROUGE-1 為 47.15,反而略高於有額外資料的 46.74。自 arXiv 開始被當作基準以來的五年間,摘要模型進步了 47.1% — 而曲線已經明顯趨緩。PubMed 從另一側講同一件事:有額外資料 48.25、沒有 47.81,自 2017 年以來進步 34.6%,但速度同樣放慢了。2021 年的榜首是 HAT,一個由 Birch AI 與華盛頓大學提出的階層式注意力 transformer。
AI 在 SuperGLUE 與兩組 SQuAD 上都已超越人類基準 1% 到 5%。但只要在同一段文字前面加上一道邏輯或溯因的步驟,排序就會反轉回來。
影像分類、姿態估計與息肉切割,都離各自的上限只剩一兩分。2021 年真正的移動不是向上,而是橫向 — 移往更窄、更臨床、更能落地的子任務。
本章的後半講的是部署經濟學:一個代理變得多泛化、訓練一套系統要多少錢、要花多久,以及一間實驗室要付多少錢,才能在桌上擺一支機器手臂。
本版新增的是 AI 指數自行執行的調查,對象是頂尖大學與新興經濟體的機器人學教授:來自 40 多所大學的 101 位教授與研究者,涵蓋 2016 至 2022 年間的 117 筆機器手臂採購。中位價格五年內下降 46.2%,從 2017 年每支 42,000 美元降到 2021 年約 22,600 美元 — 機器人研究實質上變得更容易進入。被問到使用哪些 AI 技術時,67.0% 的受訪者回答深度學習,46.0% 回答強化學習。
六套在年底時仍握有最佳成績的系統,以及每個成績真正證明了什麼。
在 57 款 Atari 遊戲的測試組上幾乎把 MuZero 的分數翻倍,用掉的訓練影格卻只有百分之一。
在 2019 年為了「夠難」而打造的基準上拿到 91.0,比設計者自己訂的人類分數高出 1.2 分。
在 CVC-ClinicDB 上以 94.20%、Kvasir-SEG 上以 92.17% 切割大腸鏡息肉 — 這是這一年 AI 走向臨床最明確的例子。
在 COCO 上取得 79.50% 平均精度,比 2016 年高 23.8 分 — 也是額外資料趨勢的教科書案例。
第一個同時稱霸 Kinetics-400、600 與 700 的模型,分別是 89.1%、89.6% 與 82.20%。
在 LibriSpeech 較吵的那一半上取得 2.0% 字錯率 — 乾淨的那一半在 2021 年根本沒有新紀錄。
第 2 章裡的五句話,承載了這一年的論點。
截至 2021 年,本報告 10 個基準中有 9 個的最先進 AI 系統是用額外資料訓練的。這個趨勢實質上偏袒了握有龐大資料集的私部門。
2019 年人類在 aNLI 上比 AI 高 9 個百分點。到 2021 年,這個差距已縮小到 1。
最強的西洋棋軟體引擎如今超越 Magnus Carlsen 的最高 ELO 分數 24%。不過在過去兩年,AI 系統在更通用、必須在陌生環境中運作的強化學習任務(Procgen)上,也進步了 129%。
SuperGLUE 上的進展來得如此之快,意味著研究者必須開發更複雜的自然語言任務組合,才能挑戰下一代的 AI 系統。
AI 指數的調查顯示,機器手臂的中位價格在過去五年下降了 46.2% — 從 2017 年每支 42,000 美元降到 2021 年的 22,600 美元。機器人研究變得更容易取得、也更負擔得起。
第 2 章(2.1–2.8 各節) — 影像與影片的電腦視覺、語言、語音、推薦、強化學習、硬體與機器人 — 連同所有圖表、註腳與引用,皆由史丹佛 HAI 免費提供。
開啟 AI 指數 2022 →