AI Index Report 2026

AI 能力正在跑贏用來衡量它的基準

AI 指數 2026 第 2 章橫跨語言、推理、程式、數學、代理與機器人。分數一路狂飆,頂尖模型之間的差距正在縮小,而基準測試在幾個月內就被刷爆。先看數字:

100% SWE-bench Verified 達到的人類基準(2024 約 60%)
66% OSWorld 電腦操作代理準確率(原約 12%)
30Humanity's Last Exam 一年內躍升的百分點
25Arena 前四名模型如今相差的 Elo 分數
89% RLBench 模擬中的機器人操作成功率
12% 真實居家機器人任務成功率(BEHAVIOR-1K)

推理基準正在跨過人類門檻

前沿推理基準的頂尖模型準確率(%),2026 年初。MMMU 與 GPQA Diamond 已達到或超越專家;ARC-AGI-2 與 Humanity's Last Exam 則刻意維持高難度。

推理基準正在跨過人類門檻GPQA Diamond(平均):9393GPQA Diamond(平均)MMMU(最佳):8888MMMU(最佳)ARC-AGI-2(最佳):8585ARC-AGI-2(最佳)Humanity's Last Exam:3838Humanity's Last Exam

2.4 — 拿得到金牌,卻還看不懂時鐘

推理在科學、數學與抽象上大幅躍進 — 但同一批模型卻在多數人覺得理所當然的任務上栽跟頭。研究者稱之為「鋸齒狀智慧」。

前沿模型在 Humanity's Last Exam(一個專為難住 AI、有利於人類專家而設計的基準)上單年躍升 30 個百分點,從不到 10% 攀升到 38.3%。在 GPQA Diamond 上,平均準確率達 93%,高出專家驗證者 81.2% 的基準 12 個百分點。在 MMMU 上,Gemini 3.1 Pro Preview 得 88.2%,與最強人類專家僅差 0.4 個百分點。

鋸齒狀智慧:IMO 金牌對上類比時鐘

  • Gemini Deep Think 在 2025 年國際數學奧林匹亞(IMO)上拿到 35 分奪金,全程在 4.5 小時時限內以自然語言端到端作答 — 高於 2024 年 28 分的銀牌。
  • 然而在 ClockBench 上,頂尖模型只有 50.6% 的時候能正確讀出類比時鐘,而人類為 90.1%。當模型看錯時間時,中位誤差約一到三小時,人類則僅三分鐘。
  • 在 FrontierMath Tier 4 上,準確率自 2024 年以來從近 0% 升到 31.3% — 但最強模型在最難等級仍約每三題答錯兩題。在 MathArena 上,答案型準確率達 97%,但嚴謹的證明書寫仍遠遠落後。

AI 代理從「回答」走向「完成任務」

真實任務基準的頂尖代理成功率(%),2026 年初對比 2024–25 起點。代理進步飛快,但仍約每三次嘗試失敗一次。

AI 代理從「回答」走向「完成任務」Cybench(無引導):9393Cybench(無引導)Terminal-Bench 2.0:7777Terminal-Bench 2.0GAIA:7575GAIAWebArena:7474WebArenaOSWorld:6666OSWorldMLE-bench:6464MLE-bench

2.6 與 2.7 — 代理崛起,機器人卻卡在家門口

軟體代理在結構化任務上正逼近人類。實體機器人一離開實驗室就失靈 — 自駕車則是最突出的例外。

AI 代理在 2025 年從回答問題進展到完成多步驟任務,但在結構化基準上仍約每三次嘗試失敗一次。在 OSWorld 上,準確率從約 12% 升到 66.3%,距人類僅 6 個百分點;在 WebArena 上達 74.3%,距 78.2% 的人類基準僅 4 個百分點;在 Cybench 上,無引導解題率達 93%,高於 2024 年的 15%。

實驗室大勝,居家慘敗

  • 在受控模擬中,RLBench 上的機器人操作成功率達 89.4%(EquAct),高於 2022 年的約 48%。但在 2025 年 BEHAVIOR-1K 居家挑戰中,最佳隊伍只完成 12.4% 的真實任務 — 鮮明地量出 AI 距離無結構的實體世界還有多遠。
  • 在 ResponsibleRobotBench 上,當環境存在真實危險時,即使是最佳模型(GPT-4o,安全分數 0.64)也只能安全完成不到三分之一的任務。
  • 人形硬體大量湧現:Figure AI 的 Figure 02 在一家 BMW 工廠累積超過 1,250 小時,跨越 30,000 多輛車裝載逾 90,000 個零件。但多數里程碑仍以未來企圖、而非已驗證的營運來陳述。

自駕車:已落地部署的例外

自駕車在 2025 年達到大規模部署。Waymo 在五個美國城市營運約 2,500 輛無人計程車,每週約 45 萬趟。在中國,百度的 Apollo Go 提供約 1,100 萬趟全無人駕駛載客 — 年增 175%,高於 2022 年的 150 萬趟。目前的部署集中在天候良好的地區,並有場外人員待命於必要時接手。

2.5 — 走進專業領域

AI 被推進專家工作的地方 — 程式、數學、影片、時間,以及國家層級的競賽。點任一張卡片看完整趨勢與數字。

SWE-bench:從 60% 到接近 100%

自主軟體工程從 2024 年約 60% 升到接近人類基準的 100%。

coding

數學:答案對了,證明還虛

MathArena 答案準確率達 97%,但嚴謹的證明書寫仍遠落後人類。

mathematics

美中差距已實質消失

DeepSeek-R1 在 2025 年 2 月曾短暫追平頂尖美國模型;如今差距僅 2.7%。

competition

影片模型開始學會物理

Veo 3 在 18,000+ 部影片測試中,展現出未受訓練的浮力模擬與迷宮求解。

video

它還無法穩定讀懂時間

在 ClockBench 上,頂尖模型只有 50.6% 能正確讀類比時鐘,人類為 90.1%。

reasoning

自駕車進入大規模量產部署

Waymo 每週約 45 萬趟;Apollo Go 約 1,100 萬趟無人駕駛,年增 175%。

deployment

兩年間從近乎零到接近人類

各基準較早起點對比 2026 年初的最佳成功率(%) — 看曾經困難的任務進步有多快。

兩年間從近乎零到接近人類OSWorld · 約 2024:1212OSWorld · 約 2024OSWorld · 2026:6666OSWorld · 2026Cybench · 2024:1515Cybench · 2024Cybench · 2026:9393Cybench · 2026MLE-bench · 2024:1717MLE-bench · 2024MLE-bench · 2026:6464MLE-bench · 2026

用五句話看這一章

第 2 章「技術表現」的頭條發現。

前沿模型在 Humanity's Last Exam(一個專為難住 AI、有利於人類專家而設計的基準)上單年躍升 30 個百分點。
— Chapter 2 · Technical Performance
美中 AI 模型的表現差距已實質消失;截至 2026 年 3 月,頂尖美國模型僅領先 2.7%。
— Chapter 2 · Technical Performance
AI 拿得到國際數學奧林匹亞金牌,卻只有 50.6% 能正確讀類比時鐘,人類為 90.1%。
— Chapter 2 · Technical Performance
AI 代理從回答問題進展到完成任務 — 但在結構化基準上仍約每三次嘗試失敗一次。
— Chapter 2 · Technical Performance
機器人在受控模擬中達 89.4%,真實居家任務卻只有 12% 成功,而自駕車已達大規模部署。
— Chapter 2 · Technical Performance

閱讀完整的技術表現章節

第 2 章(2.1–2.7 各節)連同所有基準、圖表與引用,皆由史丹佛 HAI 免費提供。或回到 15 條重點與九大章節總覽。

前往第 2 章:技術表現 →