AI Index Report 2024

AI 把現成的測驗都考完了 — 於是 2023 年造了更難的

AI 指數 2024 第 2 章量的是 2023 年底 AI 站在哪裡。舊基準的故事是飽和:ImageNet、SuperGLUE 與 VQA 進步太少,這一版索性把它們拿掉。而 2023 年新造的那批基準 — 程式、專家推理、代理、幻覺 — 分數低到還留著好幾年的空間。先看數字:

90.04% 2023 年 MMLU 最高分(Gemini Ultra),首度越過 89.8% 的人類基準
84.3% 競賽等級 MATH 題目的解題率,人類基準為 90%
59.4% 專家等級多模態推理測驗 MMMU 的最高分
41% GPQA 最高分,該領域博士專家可達 65%
4.8% 最強模型 Claude 2 解出的 SWE-bench 真實 GitHub 問題
24.2% 封閉模型領先開放模型的效能中位數差距

2.1 — 壞掉的不是模型,是量尺

AI 一個接一個越過人類基準,直到這些基準再也說不出什麼。2023 年真正的關鍵動作不是某一個模型,而是把整套測驗換掉。

AI 超過我們的地方,以及還沒超過的地方

本章拿九個基準對照人類基準。AI 在 2015 年於影像分類越線、2017 年於基礎閱讀理解越線、2020 年於視覺推理越線、2021 年於自然語言推論越線。到 2023 年,AI 仍無法勝過人類的,是更複雜的認知任務:視覺常識推理,以及競賽等級的高階數學解題。規劃也應該算在這份名單裡。

基準正在磨損

  • 2023 年版 AI 指數用過的 15 個基準,這一版直接拿掉,包括 ImageNet、SuperGLUE、VQA、aNLI、SST-5、STL-10、VoxCeleb 與 Kinetics 系列。
  • 看它們自 2022 年以來的進步就懂了。ImageNet 只動了 1.54%、Kvasir-SEG 1.90%、Cityscapes Challenge 0.23%。其餘 11 個,報告記錄的是完全沒有進步。
  • 取而代之,2024 年版追蹤 18 個基準,其中 13 個是 2023 年才出現的 — 刻意偏向程式、高階推理與代理行為,這些正是先前版本著墨太少的領域。
  • 2023 年這一批是:程式的 SWE-bench、影像生成的 HEIM、通用推理的 MMMU 與 GPQA、道德推理的 MoCa、因果推理的 BigToM、規劃的 PlanBench、代理的 AgentBench 與 MLAgentBench、幻覺的 HaluEval、影像編輯的 EditVal、影像指令遵循的 VisIT-Bench,以及量測人類偏好的 Chatbot Arena 排行榜。

多模態不再是特例

過去的 AI 系統範圍很窄 — 語言模型讀文字在行、處理影像不行,反過來也一樣。2023 年這道分界合起來了:Google 的 Gemini 與 OpenAI 的 GPT-4 能同時處理影像與文字,有些情況下連音訊也行。指導委員會挑出的年度重要發表,幾乎就是這個轉變的地圖 — 3 月同一天的 Claude 與 GPT-4、春天的 Stable Diffusion v2 與 Segment Anything、7 月的 Llama 2、8 月的 DALL-E 3 與 SynthID、9 月的 Mistral 7B、10 月的 Ernie 4.0,接著是 11 月一擁而上的 GPT-4 Turbo(128K 脈絡窗)、Whisper v3 與 200K 脈絡窗的 Claude 2.1,最後是 12 月 6 日的 Gemini 與 12 月 21 日的 Midjourney v6。

2023 年底的成績單

各基準的最佳回報分數(%)。MMLU 已經結束了 — 90.04% 越過了 89.8% 的人類基準。MATH 也逼近 90% 的基準。2023 年才寫出來的兩個基準分數低得多,SWE-bench 幾乎還沒起步。

2023 年底的成績單MMLU:90.0490.04MMLUMATH:84.384.3MATHMMMU:59.459.4MMMUGPQA:4141GPQASWE-bench:4.84.8SWE-bench

2.2 — 流暢、受歡迎,而且還在編故事

語言是 AI 看起來最完成、卻最不可信的地方。理解類基準逼近天花板,人類投票成了認真的量尺,而真正該盯著看的是事實性那組數字。

理解

  • 史丹佛的 HELM 在十種情境下評分,回報的是平均勝率。截至 2024 年 1 月,GPT-4 以 0.96 領先總榜,其後是 0.83 的 GPT-4 Turbo 與 0.82 的 Palmyra X V3(72B)。
  • 但沒有哪個模型包辦所有任務。NarrativeQA 由 Yi(34B)以 0.78 居首、閉書式 NaturalQuestions 由 Llama 2(70B)以 0.46 居首、開書版由 PaLM-2(Bison)以 0.81 居首,WMT 2014 翻譯則是 Palmyra X V3(72B)以 0.26 居首。
  • MMLU 涵蓋人文、STEM 與社會科學共 57 個學科。截至 2024 年 1 月,Gemini Ultra 以 90.0% 居首 — 比 2022 年高出 14.8 個百分點,比 2019 年 MMLU 誕生時高出 57.6 個百分點,也是第一個越過該基準 89.8% 人類基準的分數。

人類偏好變成了指標

2023 年上線的 Chatbot Arena 排行榜,讓任何人向兩個匿名模型提問,再投票給比較好的答案。到 2024 年初已累積超過 200,000 張投票,使用者把 OpenAI 的 GPT-4 Turbo 評為最受偏好的模型;最佳封閉模型的 Elo 為 1,252,最佳開放模型為 1,149。AI 指數認為這是評測性質的轉向:當生成式模型能產出高品質的文字與影像,評測就從 ImageNet 或 SQuAD 這類電腦化排名,轉向人類評估。大眾對 AI 的感受,正在成為衡量進展的一部分。

事實性與幻覺

  • TruthfulQA 有約 800 道題目、橫跨 38 個類別,許多題目刻意環繞人類自己也會答錯的常見迷思。GPT-4(RLHF)拿下目前最高的 0.6 分,幾乎是 2021 年受測的 GPT-2 系模型的三倍。
  • 2023 年新推出的 HaluEval 收錄超過 35,000 筆幻覺與正常樣本。它最醒目的發現是:ChatGPT 約有 19.5% 的回應會捏造無法查證的資訊,主題從語言、氣候到科技都有。
  • 而看穿幻覺本身就是另一道難題。在 HaluEval 的分類任務上,ChatGPT 問答類達 62.59%、摘要類 58.53%;Claude 2 問答類 69.78%,摘要類卻只有 57.75%;Llama 2 在對話類掉到 43.99%,一般類更只有 20.46%。
  • 報告直說了為什麼這件事要緊 — LLM 正被放進法律與醫療現場,而幻覺已經真的出現在法庭案件裡。

2.6 — 沒有合攏的那道差距

推理是 2023 年數字最誠實的地方。在專家級多模態題目、研究所程度的科學題、規劃與視覺常識上,最強的系統都還輸給人 — 有時候輸很多。

通用推理:MMMU 與 GPQA

MMMU 由美國與加拿大的研究者在 2023 年建立,涵蓋六大學科約 11,500 道大學程度題目,題型包含圖表、地圖、表格與化學結構式。截至 2024 年 1 月,Gemini Ultra 在每個學科類別都居首,總分 59.4%;而學科層級的表格顯示它離中等程度的人類專家還有多遠:人文與社會科學 78.3 對 85、健康與醫療 67.3 對 78.8、商業 59.3 對 86、科學 54.7 對 84.7、藝術與設計 51.4 對 84.2、科技與工程 47.1 對 79.1。GPQA 更狠 — 448 道由生物、物理、化學領域專家撰寫的選擇題,刻意設計成 Google 搜尋幫不上忙。博士等級專家在自己領域得分 65%,非專家約 34%。最強的模型 GPT-4 在主測試集只拿到 41.0%。

數學

  • GSM8K 收錄約 8,000 道需要多步算術的小學程度應用題。GPT-4 的變體 GPT-4 Code Interpreter 拿到 97% — 比前一年的最佳成績高 4.4%,比基準初推出的 2022 年高 30.4%。
  • MATH 是更難的那一位:加州大學柏克萊分校研究者 2021 年釋出的 12,500 道競賽等級題目,剛推出時系統只解得出 6.9%。2023 年,一個以 GPT-4 為基礎的模型解出了 84.3%。很漂亮,但仍在 90% 的人類基準之下 — 這也是為什麼競賽等級數學還留在人類做得比較好的名單上。
  • HELM 自己的子榜單上,MATH 由 GPT-4 Turbo(1106 preview)以 0.86 的思維鏈等價分數居首,GSM8K 則由 GPT-4(0613)以 0.93 居首。

規劃、視覺與道德判斷

  • 亞利桑那州立大學提出的 PlanBench,以單樣本學習測試 GPT-4 與 I-GPT-3 在 600 道 Blocksworld 題目上的表現。GPT-4 有 34.3% 的機率生成正確計畫、33% 生成成本最佳計畫;I-GPT-3 分別只有 6.8% 與 5.8%。檢查計畫比生成計畫容易 — GPT-4 的計畫驗證正確率 58.6%,I-GPT-3 則是 12%。
  • 在視覺常識推理上,系統既要回答關於影像的問題,也要挑出正確的理由。2023 年最高的 Q->AR 分數是 81.60,人類基準為 85。AI 表現在 2022 到 2023 年間提升了 7.93%,差距仍未補上。
  • 史丹佛建立的 MoCa 資料集由含道德元素的人類故事組成。結果是沒有任何模型完全吻合人類的道德體系,但 GPT-4、Claude 這類較新較大的模型,比 GPT-3 這類較小的模型更貼近人類。在所有受測模型中,GPT-4 與人類道德判斷的吻合度最高。
  • BigToM 以 25 個對照組與 5,000 筆模型生成評估來測試心智理論。GPT-4 表現最好,在前向信念與後向信念上非常接近人類準確度,在前向行動上甚至略勝人類 — 整體而言逼近但尚未超越人類水準。

2023 年出生的那一批基準

這一版追蹤的 18 個基準中,有 13 個是 2023 年才出現的。以下挑出六個,以及它們留下多少空間的分數。

SWE-bench · 程式

取自熱門 Python 專案真實 GitHub issue 的 2,294 道軟體工程問題。最強的模型解出 4.8%。

coding

MMMU · 通用推理

涵蓋六大學科約 11,500 道大學程度題目,題型含圖表、地圖與化學結構式。Gemini Ultra 以 59.4% 居首。

reasoning

GPQA · 搜尋不到答案的題目

448 道生物、物理、化學的研究所程度題目,搜尋找不到答案。GPT-4 拿到 41.0%。

reasoning

HaluEval · 幻覺

超過 35,000 筆幻覺與正常樣本。ChatGPT 約 19.5% 的回應會捏造無法查證的資訊。

factuality

AgentBench · 代理行為

八種互動環境,包含網頁瀏覽、線上購物、家務管理與紙牌遊戲。GPT-4 總分 4.01。

agents

HEIM · 影像生成

以人類評分者評估文字轉影像模型的十二個面向。沒有任何一個模型全面勝出。

image

在這一版裡,封閉模型全部贏

最佳封閉模型與最佳開放模型之間的分數百分比差距,資料收集於 2024 年 1 月初。十個基準的中位數差距是 24.2%,而最大的一道差距根本畫不進這張圖:AgentBench,317.7%。

在這一版裡,封閉模型全部贏HumanEval:54.8254.82HumanEvalMATH:39.5739.57MATHMMLU:27.5427.54MMLUSWE-bench:20.9120.91SWE-benchGSM8K:3.973.97GSM8K

2.3–2.9 — 程式、畫素、代理與身體

離開語言排行榜,2023 年看起來比較不像飽和,更像一個還在站穩腳步的領域 — 只有一個例外,那裡的數字直接垂直上升。

程式:先被解決,然後又沒有了

HumanEval 由 OpenAI 研究者在 2021 年推出,含 164 道手寫程式題。GPT-4 的變體 AgentCoder 目前以 96.3% 居首 — 比 2022 年的最高分高 11.2 個百分點,自 2021 年以來共進步 64.1 個百分點。那條垂直線就是它。接著 2023 年 10 月出現的 SWE-bench,收錄 2,294 道取自真實 GitHub issue 的問題,要求的是跨程式庫協調修改而不是改一個函式,而全世界最強的模型只做到 4.8%。同一年、同一批模型,差了兩個數量級 — 這大概就是「寫完練習題」與「做完這份工作」之間的距離。

影像與影片

  • 在 HEIM 由人類評分的影像文字對齊上,DALL-E 2(3.5B)以 0.94 領先。而品質、美感與原創性三項,由以 Stable Diffusion 為基礎的 Dreamlike Photoreal v2.0(1B)以 0.92、0.87、0.98 拿下 — 一個十億參數的模型,在人們真正會看的面向上贏過大得多的模型。
  • VisIT-Bench 量的是視覺語言模型能不能照著文字指令處理影像,共 592 條指令、約 70 個類別,像是劇情分析、藝術知識與地點辨識。截至 2024 年 1 月,GPT-4V 以 1,349 的 Elo 居首,些微超過該基準 1,338 的人類參考分數。
  • Meta 的 Segment Anything 在 23 個資料集中的 16 個勝過 RITM 等領先的分割方法,接著又與人類標註者合作建出 SA-1B:1,100 萬張影像、超過 10 億個分割遮罩。更好的模型做出更好的資料,更好的資料再做出更好的模型。
  • 影片生成用 UCF101 這個含 101 種動作類別的資料集來量。年度最佳模型 W.A.L.T-XL 拿下 FVD16 分數 36 — 這個分數愈低愈好,而它比前一年的最佳成績還少了一半以上。

代理

  • 由 Nvidia、加州理工、德州大學奧斯汀分校、史丹佛與威斯康辛大學麥迪遜分校打造的 Voyager,是以 GPT-4 為核心的 Minecraft 代理:它蒐集到的獨特物品是先前系統的 3.3 倍、移動距離 2.3 倍、抵達關鍵科技樹里程碑的速度快 15.3 倍。它之所以重要,是因為它能在開放世界中持續學習,而 AlphaZero 那類系統從來不必面對這件事。
  • MLAgentBench 問的是代理能不能跑科學實驗 — 也就是當一名資訊科學研究助理。結果依任務劇烈分裂:在改良既有論文分類模型的 ogbn-arxiv 上,有些代理超過 80%;而在訓練小型語言模型的 BabyLM 上,受測代理全數掛零。GPT-4 在其中一貫表現最好。
  • 在 AgentBench 的八種環境裡,GPT-4 的總分 4.01 就是天花板;研究團隊把失敗歸因於長期推理、決策與指令遵循能力有限 — 而不是少了哪個工具。

可以對話的機器人

本章最安靜但最有後果的發現是:語言建模改善了機器人。Google 的 PaLM-E 最大規模達 5,620 億參數,以視覺語言資料與機器人資料一同訓練,在具身視覺問答與規劃上勝過 SayCan、PaLI 等既有方法,而且更可靠地偵測自己的失敗 — PaLM-E-12B 的失敗偵測為 0.91,CLIP-FT 為 0.65,零樣本 PaLI 為 0.73,而閉環規劃正是靠這個。DeepMind 的 RT-2 則以代幣化的機器人軌跡資料加上視覺語言資料訓練:在面對從未見過的物體時,RT-2/PaLM-E 變體的成功率達 80%,MOO 是 53%,並比前一年的 RT-1 高出 43 個百分點。除了做得更多,這些系統還能提問 — 這是邁向「與世界互動」而不只是「在世界裡執行」的機器人的實質一步。

分數沒有告訴你的五件事

2.11 節把顯微鏡轉向模型本身,2.13 節則轉向跑這些模型的代價。兩者都沒有排行榜好看。

這些模型真的會規劃嗎?
不可靠。亞利桑那州立大學團隊提出的 PlanBench,取材自自動規劃社群的題目,包含國際規劃競賽用題。在 600 道 Blocksworld 題目上 — 一隻手一次只能移動一塊積木,放到桌上或放到另一塊淨空的積木上 — 單樣本學習下的 GPT-4 有 34.3% 的機率生成正確計畫、33% 的機率生成成本最佳計畫,I-GPT-3 則是 6.8% 與 5.8%。驗證計畫比生成計畫容易:GPT-4 的計畫驗證正確率 58.6%,I-GPT-3 為 12%。規劃與競賽等級數學、視覺常識推理並列在人類仍舊做得比較好的那份短名單上。
模型自己檢查一遍,會變好嗎?
會變差。自我修正聽起來是幻覺與推理瑕疵的當然解法,而內在自我修正 — 模型不靠外部指引就自行修正 — 是其中最誘人的版本。DeepMind 與伊利諾大學厄巴納香檳分校的研究者在三個推理基準上測試 GPT-4,發現表現全數下滑。GSM8K 上,標準提示是 95.50%,自我修正第一輪 91.50%,第二輪 89.00%。CommonSenseQA 是 82.00%、79.50%、80.00%。HotpotQA 是 49.00%、49.00%、43.00%。而且每多一輪就多花呼叫次數 — 從一次變成三次,再變成五次。
湧現能力是真的嗎?
很多時候那是量測方式造成的假象。許多論文主張 LLM 會在更大規模時不可預測地突然展現新能力,這也帶來一種擔憂:更大的模型可能長出令人意外、甚至無法控制的能力。史丹佛研究者主張,這種湧現往往是基準的性質而非模型的性質:用多選題評分這類非線性或不連續的指標時,湧現看起來很明顯;換成線性或連續的指標,這些能力大致就消失了。在 BIG-bench 的 39 個基準中,他們只在其中 5 個觀察到湧現能力。這直接挑戰了 AI 安全與對齊研究中相當流行的一種信念。
模型上線之後還是同一個模型嗎?
不是,而且可能倒退。GPT-4、Claude 2、Gemini 這類封閉模型會被開發者依新資料與使用者回饋持續更新,而外界幾乎沒有研究在追蹤這對模型做了什麼。史丹佛與柏克萊的一項研究比較 GPT-3.5 與 GPT-4 的 2023 年 3 月版與 6 月版,發現 6 月版的 GPT-4 在產生程式碼上差了 42 個百分點、回答敏感問題差了 16 個百分點、某些數學任務差了 33 個百分點。它遵循指令的能力也下降了,研究者認為這或許能解釋更廣泛的退步。本章每一個排行榜數字,都是對一個移動中物體拍下的快照。
訓練一個這樣的模型,要付出多少環境代價?
比多數開發者願意講的更多。訓練 GPT-3(175B)據報排放 502 公噸二氧化碳當量、耗電 1,287 MWh;Gopher(280B)是 352 公噸與 1,066 MWh;Meta 的 Llama 2 70B 約 291 公噸、耗電 400 MWh — 幾乎是一名旅客紐約到舊金山來回航班排放量的 291 倍,約等於一個美國人年排放量的 16 倍。較小的模型便宜得多:Starcoder(15.5B)16.68 公噸,Luminous Base(13B)3.17 公噸。更大的問題是沉默。OpenAI、Google、Anthropic 與 Mistral 都不揭露訓練排放,Meta 則有;推論階段幾乎完全沒人報告 — 即使單次查詢的排放很低,一旦模型每天被查詢數百萬次,推論的總影響仍可能超過訓練。

本章自己的說法

第 2 章裡承載這一年論點的五句話。

AI 已在數個基準上超越人類表現,包括影像分類、視覺推理與英文理解中的一部分。但在競賽等級數學、視覺常識推理與規劃這類更複雜的任務上,它仍然落後。
— Chapter 2 · Chapter Highlights
AI 模型在 ImageNet、SQuAD、SuperGLUE 等既有基準上已達到效能飽和,促使研究者開發更具挑戰性的基準。
— Chapter 2 · Chapter Highlights
隨著生成式模型能產出高品質的文字、影像與更多內容,評測正緩慢轉向納入 Chatbot Arena 排行榜這類人類評估,而非 ImageNet 或 SQuAD 這類電腦化排名。
— Chapter 2 · Chapter Highlights
在 10 個選定的 AI 基準上,封閉模型全面勝過開放模型,效能優勢中位數為 24.2%。封閉與開放模型的表現差異,對 AI 政策辯論有重要意涵。
— Chapter 2 · Chapter Highlights
隨著 AI 模型規模愈來愈大、使用愈來愈廣,AI 研究社群認真監測並減緩 AI 系統的環境影響,從未如此重要。
— Chapter 2 · 2.13 Environmental Impact of AI Systems

閱讀第 2 章原文

第 2 章(2.1–2.13 各節) — 語言、程式、影像與影片、推理、音訊、代理、機器人、強化學習、LLM 的性質、改進技術與環境影響 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2024 →