1 · 高難度基準測試的表現持續進步
MMMU、GPQA 與 SWE-bench 於 2023 年推出,用來測試最強系統的極限。一年後,分數分別上升 18.8、48.9 與 67.3 個百分點。
2025 年 AI 指數涵蓋 2024 年,分為八大章節:研發、技術表現、負責任 AI、經濟、科學與醫療、政策、教育與民意。一年前才推出的基準測試大致被攻克,成本崩跌,投資創下新高。先看幾個定錨的數字:
報告自身對這一年的總結,依其原本順序排列。點任一張卡片可看完整內容。
MMMU、GPQA 與 SWE-bench 於 2023 年推出,用來測試最強系統的極限。一年後,分數分別上升 18.8、48.9 與 67.3 個百分點。
2023 年 FDA 核准了 223 項 AI 醫療器材,而 2015 年僅有 6 項。Waymo 每週提供超過 15 萬趟自駕接送。
美國私人 AI 投資達 1,091 億美元 — 近乎中國 93 億美元的 12 倍、英國 45 億美元的 24 倍。組織的 AI 使用率由 55% 躍升至 78%。
2024 年美國機構產出 40 個重要模型,中國 15 個、歐洲 3 個。但在 MMLU 與 HumanEval 上的表現差距,已從兩位數收斂到幾乎持平。
AI 相關事故急遽上升,但在主要的產業級模型開發者之間,標準化的負責任 AI 評估依然罕見。
在中國(83%)、印尼(80%)與泰國(77%),多數人認為 AI 利大於弊 — 但在加拿大(40%)、美國(39%)與荷蘭(36%),抱持此看法的只是少數。
達到 GPT-3.5 等級表現的推論成本,在 2022 年 11 月至 2024 年 10 月間下降逾 280 倍。硬體成本每年下降 30%,能源效率每年提升 40%。
2024 年美國聯邦機關推出 59 條 AI 相關法規 — 是 2023 年的兩倍有餘,且發布機關數也翻倍。75 個國家的立法提及次數成長 21.3%。
三分之二的國家已提供或計畫提供 K–12 資訊科學教育 — 是 2019 年的兩倍。美國的資訊類學士學位數,十年間成長 22%。
2024 年近 90% 的重要模型來自產業界,2023 年為 60%。但排名第一與第十的模型 Elo 差距,已從 11.9% 縮小至 5.4%。
兩座諾貝爾獎分別表彰了促成深度學習(物理獎)以及將其應用於蛋白質摺疊(化學獎)的研究;圖靈獎則表彰了強化學習的貢獻。
模型在國際數學奧林匹亞這類題目上表現優異,卻仍在 PlanBench 這類推理基準上碰壁。
每一章的關鍵數字。展開可看摘要,再由連結進入完整章節。