用學習控制核融合電漿
DeepMind 訓練強化學習代理,找出約束氫電漿的最佳托卡馬克操控程序。
AI 指數 2023 第 2 章衡量 2022 年在視覺、語言、語音、強化學習與硬體上的技術進展。重點不是躍進而是高原:最先進成績仍持續出現,但在多數基準上只多贏了一點點。真正躍進的是生成式 AI — 以及訓練它的代價。先看數字:
貫穿整章的主題是飽和。2022 年 AI 仍不斷刷新紀錄,但在 AI 指數追蹤的多數測驗上,新紀錄只比去年好一點點 — 而且基準觸頂的速度還在加快。
若以各基準推出以來的相對變化來衡量,進步幅度中位數是 42.4%;若只看過去一年,中位數是 4%。本章涵蓋的基準裡,除了七個以外,全年進步都不到 5%。AI 指數這一版還把兩個長年常客 SQuAD1.1 與 SQuAD2.0 整個拿掉 — 因為兩者都沒有新的最先進成績出現。
研究者對飽和的回應,是打造更難跑完的評測。2022 年 6 月,132 個機構的 442 位作者推出 BIG-bench(Beyond the Imitation Game),共 204 項任務,橫跨語言學、兒童發展、數學、常識推理、生物、物理、社會偏見與軟體開發。同年 11 月,史丹佛研究者釋出 HELM(Holistic Evaluation of Language Models),試圖用統一標準評判語言模型,而不是一次只看一個分數。Google 的 Imagen 團隊則在發表模型的同時推出 DrawBench,正是因為既有的文字轉圖像基準已經分不出高下。
從本章時間軸中挑出的幾則 2022 年重大 AI 進展,這份名單由 AI 指數指導委員會選定。
一套能以競賽水準撰寫電腦程式的 AI 系統,在人類程式競賽中擠進前 54% 的參賽者之列 — 而複雜問題求解正是 AI 一向不擅長的領域。
全球規模最大的語言模型之一,共 5,400 億參數。PaLM 強化了當時的主流信念 — 只要餵更多資料訓練,效能就會變好。
能依文字描述生成寫實藝術與影像的文字轉圖像系統。AI 指數把它的公開釋出,標記為點燃生成式 AI 熱潮的那一刻。
一個能同時做機器手臂操作、玩遊戲、影像描述與自然語言生成的強化學習代理 — 顯示 AI 的泛化能力正在提升。
為了更有效地挑戰日益強大的大型語言模型,132 個機構的 442 位作者推出 Beyond the Imitation Game 基準:204 項任務,從語言學、兒童發展一路到物理與軟體開發。
GitHub 把 Copilot 以訂閱制開放給個別開發者。它能把自然語言提示轉成多種語言的程式碼建議;調查顯示它讓工程師更有生產力、也更少受挫。同類系統還有 OpenAI 的 Codex 與 Salesforce 的 CodeGen。
一個開源的文字轉圖像擴散模型,任何人都能自由取用其權重。它以既有的人類創作影像訓練,卻不註明來源或給予署名,留下了影像生成器倫理使用的疑問。
以約 700,000 小時音訊訓練的大規模語音辨識系統。它既不需要監督式預訓練,也不需要非監督訓練加微調,卻表現優異 — 再一次驗證了單純擴大訓練資料的做法。
Holistic Evaluation of Language Models 是一套新的評測方法,改以更統一的標準評判語言模型 — 顯示這個領域正試圖為愈來愈強大的系統建立透明度。
一個人人可用、能寫出大學程度文章的聊天機器人。上線幾個月後就達到一億月活躍使用者,成為史上成長最快的消費性應用 — 也為生成式 AI 進入時代精神的這一年畫下句點。
分類基準一路平坦的同時,生成並沒有停下來。2022 年,文字轉圖像、文字轉影片與語音都推出了一般使用者真的碰得到的系統。
DALL·E 2、Stable Diffusion、Midjourney、Meta 的 Make-A-Scene 與 Google 的 Imagen 在短短數月內接連登場。AI 指數用同一句提示 —「a panda playing a piano on a warm evening in Paris」— 分別餵給 DALL·E 2、Stable Diffusion 與 Midjourney 並排比較。在 MS-COCO 256×256 FID-30K 基準上(Fréchet Inception Distance 愈低愈好),Imagen 以 7.27 領先,其次是 Make-A-Scene 的 7.55 與 DALL·E 2 的 10.39;作為對照,2017 年的 AttnGAN 是 35.49。Google 在發表 Imagen 的同時推出更難的 DrawBench,因為文字轉圖像模型已經長得比舊測驗還大。
AI 傳統上擅長狹窄任務,卻不擅長在任務之間切換。2022 年這個界線開始鬆動。微軟的 BEiT-3 一口氣在四項視覺技能與五項視覺語言技能上都拿下最先進成績 — 在 NLVR 視覺推理上達到 92.60,超越先前最佳的 87.00,進步 6.44%,是九項中幅度最大的。Google 的 PaLI 則以 84.30% 登上 VQA v2 榜首,高於 80.78% 的人類基準。這兩個都是單一系統,做的是過去得動用好幾個系統才做得到的事。
2022 年,規模擴張的做法也來到了語音領域。以 700,000 小時音訊、弱監督方式訓練的 Whisper,在一系列英語語音辨識基準上勝過 wav2vec 2.0 Large,並在 CoVoST 2 的 X→EN 子集上以 29.1 BLEU 勝過 MAESTRO 的 25.2,超越多個頂尖翻譯模型。在 Kincaid46 上,它 8.81% 的中位字錯誤率贏過所有受測的商用語音辨識服務。但它並非樣樣最好:在 FLEURS 語言辨識上,零樣本的 Whisper 只有 64.5%,而 mSLAM-CTC 有 77.7%。另一方面,在原始的 VoxCeleb 語者辨識資料集上,美國研究者寫下 0.1% 的等錯誤率,比前一年的最先進成績再降 0.28 個百分點。
2022 年,AI 不再只是被研究的對象,而是開始動手做研究。以下是本章的六個案例 — 其中兩個是拿 AI 來改進 AI。點任一張卡片看細節。
DeepMind 訓練強化學習代理,找出約束氫電漿的最佳托卡馬克操控程序。
以強化學習找出更快的矩陣乘法演算法 — 這個問題研究者已經啃了 50 年。
Nvidia 的 PrefixRL 代理設計出比傳統 EDA 工具更小更快的晶片電路。
生成模型以零樣本方式產出全新抗體 — 只生成一輪,不再優化。
強化學習代理在三個月的實驗中,把冷卻用電降低約 12.7%。
Google 研究者用自家的語言模型,去改進同一個模型的推理能力。
這兩節其實該擺在一起看。每一塊錢買到的訓練速度不斷提升,正因如此模型才愈做愈大 — 也正因如此,這一版第一次替它們算出碳排數字。
本章引用 Luccioni 等人 2022 年的研究,從參數量、資料中心能源使用效率(PUE)、電網碳強度、耗電量到排放量,比較四個大型語言模型。GPT-3(1,750 億參數、1,287 MWh、PUE 1.10、電網碳強度 429 gCO₂eq/kWh)排放最多,達 502 噸:是 Gopher 的 1.4 倍、OPT 的 7.2 倍、BLOOM 的 20.1 倍。這種比較並不完美 — 碳排放的計算方法至今沒有統一標準 — 但相對關係已經很清楚。四者中最乾淨的 BLOOM 只有 25 噸,卻仍相當於一名乘客紐約往返舊金山飛行排放量的 25 倍、一個美國人一年排放量的 1.4 倍,而它訓練所耗的電力足以供應一個美國家庭用 41 年。
對於「令人驚豔的展示」與「可靠的能力」之間的落差,以及這些分數本身值多少,本章講得異常直白。
五句話,取自第 2 章「技術表現」的重點摘要與內文。
AI 持續刷新最先進成績,但許多基準的年度進步幅度依然微小。而且,基準達到飽和的速度還在加快。
2022 年出現了 DALL-E 2、Stable Diffusion 這類文字轉圖像模型,Make-A-Video 這類文字轉影片系統,以及 ChatGPT 這類聊天機器人。然而,這些系統仍容易產生幻覺,會信心十足地輸出不連貫或不真實的回應,使人難以在關鍵應用中倚賴它們。
與人類相比,這些大型語言模型表現差得多,顯示它們雖然有能力,卻不具備人類的推理能力。
AI 模型正開始快速加速科學進展,2022 年就被用來協助氫融合、提升矩陣運算效率,以及生成新的抗體。
Nvidia 用 AI 強化學習代理改良了驅動 AI 系統的晶片設計。同樣地,Google 近期也用自家的語言模型 PaLM,來提出改進同一個模型的方法。會自我改進的 AI 學習,將加速 AI 的進展。
第 2 章(2.1–2.9 各節) — 2022 年時間軸、影像與影片電腦視覺、語言、語音、強化學習、硬體、環境與 AI 做科學 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。
開啟 AI 指數 2023 →