SWE-bench:從 60% 到接近 100%
自主軟體工程從 2024 年約 60% 升到接近人類基準的 100%。
AI 指數 2026 第 2 章橫跨語言、推理、程式、數學、代理與機器人。分數一路狂飆,頂尖模型之間的差距正在縮小,而基準測試在幾個月內就被刷爆。先看數字:
2025 年 AI 在語言、推理、程式與數學上快速進步 — 但進展正在超越用來衡量它的評測,而且浮現一個清楚的模式:前沿正在收斂。
前沿系統如今在 ImageNet、SuperGLUE、MMLU 等長期基準上達到或超越既定的人類基準,並在更難的推理測試上接近人類水準 — 博士級科學(GPQA Diamond)、多模態推理(MMMU)與競賽數學(AIME)。在 SWE-bench Verified 上,表現從 2024 年約 60% 上升到 2025 年接近人類基準的 100%。
原本設計要難住 AI 好幾年的評測,如今幾個月內就被刷爆。史丹佛對九個廣泛使用的基準所做的審查發現,無效題目比率從 MMLU Math 的 2% 到 GSM8K 的 42% 不等;另有研究指出,Arena 排行榜的名次可能部分反映對平台的適應,而非通用能力。當能力不再是明顯的區隔,競爭正轉向成本、可靠性與真實世界的實用性。
推理在科學、數學與抽象上大幅躍進 — 但同一批模型卻在多數人覺得理所當然的任務上栽跟頭。研究者稱之為「鋸齒狀智慧」。
前沿模型在 Humanity's Last Exam(一個專為難住 AI、有利於人類專家而設計的基準)上單年躍升 30 個百分點,從不到 10% 攀升到 38.3%。在 GPQA Diamond 上,平均準確率達 93%,高出專家驗證者 81.2% 的基準 12 個百分點。在 MMMU 上,Gemini 3.1 Pro Preview 得 88.2%,與最強人類專家僅差 0.4 個百分點。
軟體代理在結構化任務上正逼近人類。實體機器人一離開實驗室就失靈 — 自駕車則是最突出的例外。
AI 代理在 2025 年從回答問題進展到完成多步驟任務,但在結構化基準上仍約每三次嘗試失敗一次。在 OSWorld 上,準確率從約 12% 升到 66.3%,距人類僅 6 個百分點;在 WebArena 上達 74.3%,距 78.2% 的人類基準僅 4 個百分點;在 Cybench 上,無引導解題率達 93%,高於 2024 年的 15%。
自駕車在 2025 年達到大規模部署。Waymo 在五個美國城市營運約 2,500 輛無人計程車,每週約 45 萬趟。在中國,百度的 Apollo Go 提供約 1,100 萬趟全無人駕駛載客 — 年增 175%,高於 2022 年的 150 萬趟。目前的部署集中在天候良好的地區,並有場外人員待命於必要時接手。
AI 被推進專家工作的地方 — 程式、數學、影片、時間,以及國家層級的競賽。點任一張卡片看完整趨勢與數字。
自主軟體工程從 2024 年約 60% 升到接近人類基準的 100%。
MathArena 答案準確率達 97%,但嚴謹的證明書寫仍遠落後人類。
DeepSeek-R1 在 2025 年 2 月曾短暫追平頂尖美國模型;如今差距僅 2.7%。
Veo 3 在 18,000+ 部影片測試中,展現出未受訓練的浮力模擬與迷宮求解。
在 ClockBench 上,頂尖模型只有 50.6% 能正確讀類比時鐘,人類為 90.1%。
Waymo 每週約 45 萬趟;Apollo Go 約 1,100 萬趟無人駕駛,年增 175%。
第 2 章「技術表現」的頭條發現。
前沿模型在 Humanity's Last Exam(一個專為難住 AI、有利於人類專家而設計的基準)上單年躍升 30 個百分點。
美中 AI 模型的表現差距已實質消失;截至 2026 年 3 月,頂尖美國模型僅領先 2.7%。
AI 拿得到國際數學奧林匹亞金牌,卻只有 50.6% 能正確讀類比時鐘,人類為 90.1%。
AI 代理從回答問題進展到完成任務 — 但在結構化基準上仍約每三次嘗試失敗一次。
機器人在受控模擬中達 89.4%,真實居家任務卻只有 12% 成功,而自駕車已達大規模部署。