AI Index Report 2025

AI 一年之內,就跨過了為攔住它而設的基準

AI 指數 2025 第 2 章橫跨語言、程式、數學、推理、視覺、語音、代理與機器人。2023 年設計來撐好幾年的高難度基準,到 2024 年底大致已被攻克;開放權重模型的差距幾乎消失,中國模型也幾乎追平美國模型。先看數字:

71.7% 2025 年初解出的 SWE-bench Verified 程式問題(2023 年為 4.4%)
48.9GPQA Diamond 一年內躍升的百分點
1.7% 最佳封閉與開放權重模型之間剩下的差距(2024 年 1 月為 8.0%)
142跨過 MMLU 60% 門檻的最小模型縮小的倍數(5,400 億 → 38 億參數)
8.8% 最難的新學術基準 Humanity's Last Exam 的最高分
150,000Waymo 每週在四座美國城市提供的付費自駕計程車趟次

2.1 — 四道差距同時被填平

2024 年的故事是收斂。AI 與人類基準之間、封閉與開放權重之間、美國與中國模型之間,以及排名第一與第十的系統之間 — 四道差距在十二個月內全部急遽縮小。

AI 對上人類

人類能力明顯勝過 AI 的任務類別已所剩無幾,而在僅存的幾項上,差距也在快速縮小。在競賽等級的數學基準 MATH 上,最先進的系統如今領先人類表現 7.9 個百分點。在跨學科、專家等級的 MMMU 上,2024 年最佳模型 o1 拿下 78.2%,僅比人類基準 82.6% 低 4.4 分;而 2023 年底 Google Gemini 只有 59.4%。在 GPQA Diamond 上,o3 的 87.7% 是史上第一個超越專家人類驗證者 81.3% 準確率的分數。

封閉權重對上開放權重

  • 2024 年 1 月初,領先的封閉權重模型在 Chatbot Arena 排行榜上勝過最強的開放權重模型 8.0%。到 2025 年 2 月,這道差距已縮小到 1.7%。
  • 同樣的崩塌也出現在靜態基準上。2023 年底,封閉模型在 MMLU 上領先開放模型 15.9 分;到 2024 年底,差距只剩 0.1 個百分點。
  • 這波追趕主要由 Meta 夏天釋出的 Llama 3.1 帶動,其後還有 DeepSeek V3 等表現優異的開放權重模型。
  • 開放與否仍有爭議:支持者指出它能降低市場集中度、強化資安檢視與透明度;批評者則警告造假資訊與生物武器風險。也要注意,開放權重不等於開源 — 訓練程式碼與資料通常仍未公開。

美國對上中國

2024 年 1 月,最強的美國模型在 LMSYS Chatbot Arena 上勝過最強的中國模型 9.3%。到 2025 年 2 月,這個領先只剩 1.7%。在靜態基準上落差更為明顯:2023 年底,MMLU、MMMU、MATH 與 HumanEval 的差距分別是 17.5、13.5、24.3 與 31.6 個百分點;到 2024 年底,只剩 0.3、8.1、1.6 與 3.7。DeepSeek 的 R1 之所以受矚目還有第二個理由 — 該公司表示只用了通常所需硬體的一小部分就取得這些成績,不但撼動美股,也引發外界質疑半導體出口管制的效果。

前沿對上自己

  • Chatbot Arena 排行榜上第一名與第十名之間的 Elo 差距,一年內從 11.9% 降到 5.4%;前兩名之間的差距則從 2023 年的 4.9% 縮小到 2024 年的 0.7%。
  • 2024 年是小模型的突破年。2022 年,MMLU 得分超過 60% 的最小模型是 5,400 億參數的 PaLM;到 2024 年,微軟的 Phi-3 Mini 只用 38 億參數就達標 — 兩年縮小 142 倍。
  • 新的推理典範登場:OpenAI 的 o1 與 o3 會在推論階段反覆檢視自己的輸出。o1 在國際數學奧林匹亞資格考上拿下 74.4%,GPT-4o 只有 9.3%。
  • 這種推理並不便宜。o1 每百萬輸入 token 收費 15 美元、每百萬輸出 token 60 美元,GPT-4o 則是 2.50 與 10 美元;而且產出第一個 token 的時間約慢 40 倍(29.7 秒對上 0.72 秒)。

在最難的測驗上,AI 到底站在哪裡

截至 2025 年初各基準的最佳回報分數(%)。2023 年出生的測驗大致已被攻克,2024 年出生的還沒 — 最強的系統只答對 Humanity's Last Exam 的 8.8%,以及 FrontierMath 的 2%。

在最難的測驗上,AI 到底站在哪裡GPQA Diamond:87.787.7GPQA DiamondMMMU:78.278.2MMMUSWE-bench Verified:71.771.7SWE-bench VerifiedBigCodeBench(難):35.535.5BigCodeBench(難)Humanity's Last Exam:8.88.8Humanity's Last ExamFrontierMath:22FrontierMath

這一年的發表大事記

從本章時間軸中挑出的幾個模型與能力發表,它們形塑了 2024 年。

  1. 2024 年 2 月 15 日

    Gemini 1.5 Pro · Google

    Google 的新旗艦 LLM。到 2025 年初,Chatbot Arena 已累積超過一百萬張投票,而使用者把 Google 的 Gemini 系列之一評為社群最偏好的系統。

  2. 2024 年 3 月 4 日

    Claude 3 · Anthropic

    Anthropic 的新 LLM 系列。它的後繼者 Claude 3.5 Sonnet 後來在 HPT 提示策略下於 HumanEval 拿到滿分 100%、GSM8K 97.72%,並在史丹佛 HELM Safety 測試組中以 0.977 拿下最高的平均安全分數。

  3. 2024 年 5 月 13 日

    GPT-4o · OpenAI

    原生多模態模型,可跨文字、音訊與影像推理,定價為每百萬輸入 token 2.50 美元、每百萬輸出 token 10 美元,首個 token 的產出時間為 0.72 秒。

  4. 2024 年 7 月 23 日

    Llama 3.1 405B · Meta

    Meta 迄今最大的模型,也是開放權重差距崩塌最主要的單一原因。訓練約耗時 90 天、耗電 2,530 萬瓦,成本估計 1.7 億美元。

  5. 2024 年 9 月 12 日

    o1-preview · OpenAI

    o 系列的第一個模型,設計成一步步推理而非單純自迴歸作答。完整版 o1 於 12 月 5 日推出,同時上線的還有每月 200 美元的 ChatGPT Pro。相較於 GPT-4o,o1 在 MMLU 上多 2.8 分、MATH 多 34.5 分、GPQA Diamond 多 26.7 分、AIME 2024 多 65.1 分。

  6. 2024 年 10 月 22 日

    Computer Use · Anthropic

    一項讓模型直接操作桌面電腦的能力 — 這是這一年從聊天機器人邁向代理最明確的一步。

  7. 2024 年 12 月 12 日

    Sora · OpenAI

    2 月先行預覽、12 月正式開放,Sora 可生成長達 20 秒、解析度最高 1080p 的影片。它出現在一個相當擁擠的年份:3 月有 Stable Video 3D,10 月有 Meta 的 Movie Gen(16 秒、1080p、含聲音),還有 Google 的 Veo 2 — 在使用者比較中,Veo 2 的產出一貫勝過 Movie Gen、Kling v1.5 與 Sora Turbo。

  8. 2024 年 12 月 20 日與 27 日

    o3(beta) · OpenAI,接著是 DeepSeek-V3

    o3 在 ARC-AGI 上拿下 75.7% — 若給予超過該基準 10,000 美元上限的運算預算則可達 87.5% — 另有 GPQA Diamond 87.7%、SWE-bench Verified 71.7%。一週後 DeepSeek 釋出開源的 V3,效能直逼前沿,而據報訓練成本只是一小部分。

2.5–2.7 — 程式與數學先被攻克,推理正在跟上

兩年前定義 AI 程式與數學能力的那些基準,如今不是飽和就是被解掉了。2024 年打造的更難替代品,則顯示還剩下多少空間。

程式

  • OpenAI 研究者於 2021 年推出、含 164 道手寫題目的 HumanEval 已經結束了:Claude 3.5 Sonnet 在 HPT 提示下拿到 100%。
  • SWE-bench 取材自 Python 專案的真實 GitHub issue,原本應該困難得多 — 它要求跨檔案協調修改。2023 年底最強的模型只解出 4.4% 的問題。到 2025 年初,o3 解出了 Verified 子集的 71.7%。
  • 2024 年推出的 BigCodeBench 是目前的難題:1,140 項任務,需跨 139 個函式庫、七個領域呼叫函式。最強的 o1 在困難子集上平均 35.5 分 — 遠低於人類水準的 97%。
  • 在 Chatbot Arena 的程式篩選中,Gemini-Exp-1206 以 1,369 的競技場分數領先,o1 以 1,361 緊追在後。中國模型中 DeepSeek-V3 以 1,317 居首,落後榜首 3.8%。

數學

  • GSM8K 已接近飽和:Claude 3.5 Sonnet 搭配 HPT 提示拿到 97.72%,高於 2023 年 91.00% 的最高分,而 Mistral、Meta 與 Qwen 的數個模型都聚集在 96% 附近。在 MATH 上,最強的系統解出 97.9% 的題目。
  • Epoch AI 推出的 FrontierMath 就是對這種飽和的回應 — 由專業數學家審核的原創題目,往往需要數小時、數天,甚至協作研究才解得出來。發布當時,六個領先 LLM 中表現最好的 Gemini 1.5 Pro 只解出 2.0%。
  • DeepMind 的 AlphaProof 與 AlphaGeometry 2 在 2024 年國際數學奧林匹亞解出六題中的四題,相當於銀牌水準。在 IMO-AG-30 幾何題上,這些系統解出 25 題,而 IMO 銀牌得主平均為 22.9 題。
  • 在 Chatbot Arena 的數學篩選中 — 涵蓋超過 181 個模型與逾 340,000 張公開投票 — 榜首是 2024 年 12 月釋出的 OpenAI o1 變體,打破了 Gemini 在一般與程式競技場中的領先。

推理

MMMU 於 2023 年推出,涵蓋六大學科約 11,500 道大學程度題目,一年之內從 59.4% 的最佳成績躍升到 o1 的 78.2%。GPQA Diamond 由專家撰寫、無法靠網路搜尋作答的 448 道題目,則從 GPT-4 的 38.8% 升到 o3 的 87.7%,躍升 48.9 分,也是第一個超越 81.3% 專家人類基準的分數。設計來抵抗記憶的 ARC-AGI 是最戲劇性的案例:2020 年首次舉辦時只有 20%,四年後仍只有 33%,接著 o3 拿下 75.7% — 若給予超過該基準 10,000 美元上限的運算預算,更達 87.5%。研究者認為先前的停滯源於過度偏重規模擴張,那只提升了特定任務的技巧,卻沒有提升泛化能力。

2024 年底的美中效能差距

最強的美國模型領先最強的中國模型的百分點數。一年前這四道差距分別是 17.5、13.5、24.3 與 31.6 分 — 如今只剩多模態推理還有實質空間。

2024 年底的美中效能差距MMMU:8.18.1MMMUHumanEval:3.73.7HumanEvalMATH:1.61.6MATHMMLU:0.30.3MMLU

2.9 — 走出瀏覽器,開上馬路

本章今年新增並擴充了機器人與自駕車的分析。自駕計程車如今已在四座美國城市與十六座中國城市成為商業服務,而安全數據開始看起來具有說服力。

商業規模的自駕計程車

  • 截至 2025 年 1 月,Waymo 在鳳凰城、舊金山、洛杉磯與奧斯汀營運,每週提供約 150,000 趟付費載客,行駛超過一百萬英里。截至 2024 年 9 月的純載客里程為:鳳凰城 2,082.3 萬英里、舊金山 1,020.9 萬英里、洛杉磯 194.7 萬英里、奧斯汀 12.4 萬英里。該公司計畫再到十座城市測試,並刻意納入紐約州北部與加州特拉基等會下雪的地點。
  • 百度的 Apollo Go 回報 2024 年第三季在中國完成 988,000 趟載客,年增 20%;2024 年 10 月營運 400 台自駕計程車,並計畫在 2025 年底前擴增到 1,000 台。其配備換電系統的 RT6 車型售價約 30,000 美元。
  • 小馬智行承諾把車隊從 200 台擴大到至少 1,000 台,預期 2026 年底可達 2,000 至 3,000 台。中國測試中的無人車數量居全球之冠,已在 16 座城市推展,並優先建立管理部署的全國性法規。
  • 特斯拉在 2024 年 10 月發表 Cybercab — 一款沒有方向盤與踏板的雙人座車輛,預定 2026 年量產、售價低於 30,000 美元 — 同時發表可載 20 人的 Robovan。相對地,Cruise 在 2023 年因一連串安全事件被吊銷執照。

它們比我們安全嗎?

浮現中的證據說是的。與人類駕駛在同樣里程下的估計值相比,Waymo 車輛每百萬英里少了 1.42 次安全氣囊啟動、3.16 次有傷亡通報的碰撞,以及 3.65 次警方紀錄的碰撞。另一項與再保險公司瑞士再保合作的研究 — 對照的是超過 500,000 筆理賠與 2,000 億英里行駛資料 — 發現財物損害理賠減少 88%、人身傷害理賠減少 92%。以絕對數字來看,在 2,530 萬英里中,Waymo 車輛只產生 9 件財物損害理賠與 2 件人身傷害理賠,而人類駕駛在同樣距離下預期會是 78 件與 26 件。Waymo 的表現也勝過配備現代安全功能的最新一代人類駕駛車輛。

會學習的機器人

  • 2024 年是人形機器人值得記上一筆的一年。Figure AI 的 Figure 02 可搬運 44 磅負載、單次充電運作長達五小時,並與 OpenAI 整合而具備語音到語音的推理能力 — 它能解釋自己正在做什麼。特斯拉的 Optimus 與波士頓動力的 Atlas 也持續發展。
  • DeepMind 的 AutoRT 可自主生成機器人訓練資料,迄今產出涵蓋 6,650 種獨特任務的 77,000 次機器人試驗資料集。SARA-RT 提升以 transformer 為基礎的機器人模型效率;ALOHA 與 DemoStart 則用少得多的資料處理靈巧操作。
  • 基礎模型也進入機器人領域:Nvidia 的 GROOT 開發套件把人形機器人模型與模擬框架、Thor 機器人電腦組合在一起,承接 RT-2、PaLM-E 與 Open-X Embodiment 的路線。
  • 新基準跟上了這份野心。nuPlan 提供 1,282 小時的行駛情境與閉環評估;Bench2Drive 提供來自超過 10,000 段影片的 200 萬幀以上標註畫面,外加 220 條評估路線;OpenAD 則是第一個針對駕駛 3D 物件偵測的真實開放世界基準。

AI 仍然做不好的事

本章對限制相當坦率 — 也對這些分數本身有多可信,說得很直白。

這些模型真的會規劃嗎?
比以前好,但不可靠。在 PlanBench 上 — 取自自動規劃社群的 600 道堆積木問題 — o1 在 Blocksworld 零樣本評估中拿下 97.8%,遠勝 Llama 3.1 405B(62.6%)與 GPT-4o(35.5%)。但在答案經過語法混淆的 Mystery Blocksworld 上,o1 只有 52.8%,Llama 3.1 405B 為 0.8%,GPT-4 則是 0%。而在需要至少 20 步的題目上,o1 只解出 23.6%。這些系統依然無法可靠地解決那些用邏輯推理就能得出可證明正確答案的問題 — 這對它們是否適合用於精確性攸關成敗的高風險場域,構成了實質限制。
AI 代理已經可以上線了嗎?
還沒有,但它們的優勢輪廓已經逐漸清楚。在測試具身、GUI 與視覺設計代理的 VisualAgentBench 上,最佳模型 GPT-4o 的整體成功率只有 36.2%,多數專有模型平均約 20%;作者的結論是,現有模型離直接部署還很遠。RE-Bench 發現關鍵在時間:兩小時預算下,最強的 AI 系統得分是人類專家的四倍;八小時時人類略為超前;到 32 小時,人類以二比一勝出。在特定任務上,代理已具備與人類相當的專業能力 — 它們寫客製化 Triton kernel 比任何人類專家都快,成本也更低。在 Meta 的 GAIA 基準上,最強系統達到 65.1%,約比先前最高分高出 30 個百分點。
這些基準分數到底可不可信?
請小心對待。BetterBench 的研究者系統性分析了 24 個知名基準,發現結構性缺陷:14 個沒有報告統計顯著性、17 個沒有提供重現結果的腳本,多數的文件也不足。MMLU 對品質標準的遵循程度很差,GPQA 則明顯好得多。汙染是第二個問題 — Scale 的一項研究發現許多 LLM 在 GSM8K 上的表現有明顯汙染,因而催生了 LiveBench 這類定期更新的基準。第三,分數是由開發者自己回報的,有時還使用非標準的提示方式:Google 回報 Gemini Ultra 的 MMLU 分數時,用的是其他開發者沒有採用的思維鏈技巧;第三方研究者也發現,公開回報的分數與獨立評測的結果可能相差多達五個百分點。
AI 通過圖靈測試了嗎?
實質上已經通過了,而更有意思的一點是,這個問題本身已經不重要了。近期證據顯示,LLM 進步到讓人們難以在文字對話中分辨最強的模型與真人。AI 指數的說法,與其說是達成了一個里程碑,不如說是一個里程碑失去了意義:這項測試仍是重要的歷史與文化地標,但它相關性的下降,本身就是進展的量尺。注意力已經轉向那些系統還碰不到的基準。
還剩下什麼是 AI 做不到的?
2024 年這一批新基準。Humanity's Last Exam 由頂尖教授與研究所層級的審稿者撰寫,共 2,700 道多模態題目,每一題在收錄前都先對最先進的 LLM 測試過,只要現有模型答得出來就淘汰 — o1 只答對其中 8.8%,不過設計者推測到 2025 年底表現可能超過 50%。FrontierMath 停在 2%。BigCodeBench 的困難子集停在 35.5%,而人類水準是 97%。至於 OpenAI 自家的事實性測驗 SimpleQA,表現最好的 o1-preview 也只答對 42.7%。

閱讀完整的技術表現章節

第 2 章(2.1–2.9 各節) — 語言、影像與影片、語音、程式、數學、推理、代理、機器人與自駕車 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

前往 AI 指數報告 2025 →