SWE-bench · 程式
取自熱門 Python 專案真實 GitHub issue 的 2,294 道軟體工程問題。最強的模型解出 4.8%。
AI 指數 2024 第 2 章量的是 2023 年底 AI 站在哪裡。舊基準的故事是飽和:ImageNet、SuperGLUE 與 VQA 進步太少,這一版索性把它們拿掉。而 2023 年新造的那批基準 — 程式、專家推理、代理、幻覺 — 分數低到還留著好幾年的空間。先看數字:
AI 一個接一個越過人類基準,直到這些基準再也說不出什麼。2023 年真正的關鍵動作不是某一個模型,而是把整套測驗換掉。
本章拿九個基準對照人類基準。AI 在 2015 年於影像分類越線、2017 年於基礎閱讀理解越線、2020 年於視覺推理越線、2021 年於自然語言推論越線。到 2023 年,AI 仍無法勝過人類的,是更複雜的認知任務:視覺常識推理,以及競賽等級的高階數學解題。規劃也應該算在這份名單裡。
過去的 AI 系統範圍很窄 — 語言模型讀文字在行、處理影像不行,反過來也一樣。2023 年這道分界合起來了:Google 的 Gemini 與 OpenAI 的 GPT-4 能同時處理影像與文字,有些情況下連音訊也行。指導委員會挑出的年度重要發表,幾乎就是這個轉變的地圖 — 3 月同一天的 Claude 與 GPT-4、春天的 Stable Diffusion v2 與 Segment Anything、7 月的 Llama 2、8 月的 DALL-E 3 與 SynthID、9 月的 Mistral 7B、10 月的 Ernie 4.0,接著是 11 月一擁而上的 GPT-4 Turbo(128K 脈絡窗)、Whisper v3 與 200K 脈絡窗的 Claude 2.1,最後是 12 月 6 日的 Gemini 與 12 月 21 日的 Midjourney v6。
語言是 AI 看起來最完成、卻最不可信的地方。理解類基準逼近天花板,人類投票成了認真的量尺,而真正該盯著看的是事實性那組數字。
2023 年上線的 Chatbot Arena 排行榜,讓任何人向兩個匿名模型提問,再投票給比較好的答案。到 2024 年初已累積超過 200,000 張投票,使用者把 OpenAI 的 GPT-4 Turbo 評為最受偏好的模型;最佳封閉模型的 Elo 為 1,252,最佳開放模型為 1,149。AI 指數認為這是評測性質的轉向:當生成式模型能產出高品質的文字與影像,評測就從 ImageNet 或 SQuAD 這類電腦化排名,轉向人類評估。大眾對 AI 的感受,正在成為衡量進展的一部分。
推理是 2023 年數字最誠實的地方。在專家級多模態題目、研究所程度的科學題、規劃與視覺常識上,最強的系統都還輸給人 — 有時候輸很多。
MMMU 由美國與加拿大的研究者在 2023 年建立,涵蓋六大學科約 11,500 道大學程度題目,題型包含圖表、地圖、表格與化學結構式。截至 2024 年 1 月,Gemini Ultra 在每個學科類別都居首,總分 59.4%;而學科層級的表格顯示它離中等程度的人類專家還有多遠:人文與社會科學 78.3 對 85、健康與醫療 67.3 對 78.8、商業 59.3 對 86、科學 54.7 對 84.7、藝術與設計 51.4 對 84.2、科技與工程 47.1 對 79.1。GPQA 更狠 — 448 道由生物、物理、化學領域專家撰寫的選擇題,刻意設計成 Google 搜尋幫不上忙。博士等級專家在自己領域得分 65%,非專家約 34%。最強的模型 GPT-4 在主測試集只拿到 41.0%。
這一版追蹤的 18 個基準中,有 13 個是 2023 年才出現的。以下挑出六個,以及它們留下多少空間的分數。
取自熱門 Python 專案真實 GitHub issue 的 2,294 道軟體工程問題。最強的模型解出 4.8%。
涵蓋六大學科約 11,500 道大學程度題目,題型含圖表、地圖與化學結構式。Gemini Ultra 以 59.4% 居首。
448 道生物、物理、化學的研究所程度題目,搜尋找不到答案。GPT-4 拿到 41.0%。
超過 35,000 筆幻覺與正常樣本。ChatGPT 約 19.5% 的回應會捏造無法查證的資訊。
八種互動環境,包含網頁瀏覽、線上購物、家務管理與紙牌遊戲。GPT-4 總分 4.01。
以人類評分者評估文字轉影像模型的十二個面向。沒有任何一個模型全面勝出。
離開語言排行榜,2023 年看起來比較不像飽和,更像一個還在站穩腳步的領域 — 只有一個例外,那裡的數字直接垂直上升。
HumanEval 由 OpenAI 研究者在 2021 年推出,含 164 道手寫程式題。GPT-4 的變體 AgentCoder 目前以 96.3% 居首 — 比 2022 年的最高分高 11.2 個百分點,自 2021 年以來共進步 64.1 個百分點。那條垂直線就是它。接著 2023 年 10 月出現的 SWE-bench,收錄 2,294 道取自真實 GitHub issue 的問題,要求的是跨程式庫協調修改而不是改一個函式,而全世界最強的模型只做到 4.8%。同一年、同一批模型,差了兩個數量級 — 這大概就是「寫完練習題」與「做完這份工作」之間的距離。
本章最安靜但最有後果的發現是:語言建模改善了機器人。Google 的 PaLM-E 最大規模達 5,620 億參數,以視覺語言資料與機器人資料一同訓練,在具身視覺問答與規劃上勝過 SayCan、PaLI 等既有方法,而且更可靠地偵測自己的失敗 — PaLM-E-12B 的失敗偵測為 0.91,CLIP-FT 為 0.65,零樣本 PaLI 為 0.73,而閉環規劃正是靠這個。DeepMind 的 RT-2 則以代幣化的機器人軌跡資料加上視覺語言資料訓練:在面對從未見過的物體時,RT-2/PaLM-E 變體的成功率達 80%,MOO 是 53%,並比前一年的 RT-1 高出 43 個百分點。除了做得更多,這些系統還能提問 — 這是邁向「與世界互動」而不只是「在世界裡執行」的機器人的實質一步。
2.11 節把顯微鏡轉向模型本身,2.13 節則轉向跑這些模型的代價。兩者都沒有排行榜好看。
第 2 章裡承載這一年論點的五句話。
AI 已在數個基準上超越人類表現,包括影像分類、視覺推理與英文理解中的一部分。但在競賽等級數學、視覺常識推理與規劃這類更複雜的任務上,它仍然落後。
AI 模型在 ImageNet、SQuAD、SuperGLUE 等既有基準上已達到效能飽和,促使研究者開發更具挑戰性的基準。
隨著生成式模型能產出高品質的文字、影像與更多內容,評測正緩慢轉向納入 Chatbot Arena 排行榜這類人類評估,而非 ImageNet 或 SQuAD 這類電腦化排名。
在 10 個選定的 AI 基準上,封閉模型全面勝過開放模型,效能優勢中位數為 24.2%。封閉與開放模型的表現差異,對 AI 政策辯論有重要意涵。
隨著 AI 模型規模愈來愈大、使用愈來愈廣,AI 研究社群認真監測並減緩 AI 系統的環境影響,從未如此重要。
第 2 章(2.1–2.13 各節) — 語言、程式、影像與影片、推理、音訊、代理、機器人、強化學習、LLM 的性質、改進技術與環境影響 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。
開啟 AI 指數 2024 →