AI Index Report 2025

所有人都同意 AI 應該安全。但幾乎沒有人用同一套方式衡量它

AI 指數 2025 第 3 章描繪出一個發展並不平均的負責任 AI 生態系。事故數創下新高,學界關注快速上升,政府也在行動 — 但模型開發者之間仍然沒有共通的安全基準,而各組織認知到的風險,遠多於他們實際著手處理的。先看數字:

2332024 年通報的 AI 相關事故 — 創新高,較 2023 年多 56.4%
1,2782024 年頂尖 AI 研討會接受的負責任 AI 論文(2023 年為 992 篇)
58基礎模型透明度指數平均分(滿分 100;2023 年 10 月為 37)
48% C4 前段網域中已完全設限的 token(2017 年為 10%)
8% 回報曾發生 AI 相關事故的受訪組織
64% 傾向安全優先的組織 — 但同時有 58% 在探索低度監督的代理

3.2 — 每個人都回報 MMLU,卻沒有人對安全測試有共識

主要開發者一貫用同一批通用能力基準測試旗艦模型 — MMLU、GPQA、AIME。但在安全與責任面向上並沒有相對應的共識,這讓模型在監管者與買方最在意的那些維度上,真的很難互相比較。

這並不是因為開發者忽視安全 — 許多公司做了大量評測。問題在於這些評測是內部的、專有的、非標準化的,結果無法由更廣泛的社群驗證。Gryphon、Apollo Research 與 METR 等外部評測者只評估部分模型,他們的發現同樣難以被廣泛檢核。

新的基準開始補上這個缺口

  • 來自史丹佛基礎模型研究中心的 HELM Safety,以 BBQ(社會偏見)、SimpleSafetyTests(自傷、身體傷害、兒少性剝削素材)、HarmBench(紅隊測試的騷擾、化學武器、假訊息)、AnthropicRedTeam(對抗式對話)與 XSTest(對良性提示的錯誤拒答)測試模型。測得最安全的是 Claude 3.5 Sonnet,得分 0.977,略勝 o1 的 0.976;2022 年的 GPT-3.5 Turbo 為 0.853。
  • AIR-Bench 2024 把安全評測建立在真實法規之上:一套四層分類、共 314 項細緻微風險,來自八份政府法規與 16 份企業政策。在 22 個領先模型中,拒答率從 Anthropic Claude 系列的 91% 到 DBRX Instruct 的 25% 不等 — 這樣的落差顯示模型與歐盟 AI 法案等規則普遍存在錯位。
  • 在幻覺方面,Hughes 幻覺評估模型排行榜上,GLM-4-9b-Chat 與 Gemini-2.0-Flash-Exp 以 1.3% 並列最低,其後是 o1-mini(1.4%)與 GPT-4o(1.5%)。
  • 在事實性方面,OpenAI 的 SimpleQA 由表現最好的 o1-preview 作答,也只有 42.7% 正確。有些模型選擇不答而非亂猜:Claude-3 系列有 75% 的提示拒絕回應。若只看實際嘗試作答的部分,o1-preview 的正確率為 47.0%,Claude 3.5 Sonnet 為 44.5%。

事故持續攀升

AI 事故資料庫在 2024 年記錄了 233 起 AI 相關事故,創下新高,較 2023 年增加 56.4%。由於追蹤仰賴公開的媒體報導,真實數字幾乎確定更高。2024 年的案例涵蓋了本章關注的各類傷害:一名英國購物者被臉部辨識系統誤認為竊賊,遭當眾指控並被禁止進入使用該系統的店家;一名德州高中生遭人以取自她私人帳號的照片,生成不雅影像進行騷擾;一個聊天機器人在家屬不知情下重現了一名被殺害少女的身分;以及一起針對 Character.AI 的訴訟,主張該產品對處於困境的使用者缺乏防護措施,並與一名青少年的死亡有關。2024 年,社群也在爭論究竟該如何定義「嚴重事故」 — 至今仍無共識,而這本身就是問題的一部分。

組織看見的風險 — 以及他們真正動手處理的風險

受訪組織認為各項 AI 風險與自身相關的比例,2024 年(%)。在每一個類別中,真正積極緩解的組織都少於認知到風險的組織:智慧財產權為 57% 相關對 38% 已緩解、商譽 45% 對 29%、可解釋性 40% 對 31%、公平性 34% 對 26%。

組織看見的風險 — 以及他們真正動手處理的風險資安:6666資安法規遵循:6363法規遵循個人隱私:6060個人隱私智財侵權:5757智財侵權商譽:4545商譽可解釋性:4040可解釋性公平性:3434公平性

3.3 — 在企業內部,負責任 AI 既沒有歸屬,也沒有共識

兩份調查 — 一份與麥肯錫合作、橫跨 30 多國,另一份由史丹佛研究者與 Accenture 合作、涵蓋 1,500 家大型組織 — 描繪出同一幅畫面。領導者相信負責任 AI。但關於「該怎麼做」,幾乎沒有一件事有定論。

這件事歸誰管?

  • 沒有任何單一部門主導 AI 治理。最常見的答案是涵蓋資安、詐欺與隱私的資訊安全部門,佔 21%,其次是資料與分析部門的 17%。值得注意的是,已有 14% 的受訪者回報設有專責的 AI 治理職位。
  • 投資規模隨企業規模上升:營收介於 100 億至 300 億美元的組織有 27%、營收超過 300 億美元的有 21%,每年投入 1,000 萬至 2,500 萬美元把負責任 AI 落地。較小的組織投入的金額較少,但不少人以佔營收比例來看仍屬可觀。
  • 法規是最強的外部驅力。65% 的組織表示在負責任 AI 決策上受 GDPR 影響、41% 受歐盟 AI 法案影響、21% 受 OECD AI 原則影響。
  • 主要障礙偏向實務而非政治:知識與訓練落差(51%)以及資源或預算限制居首,只有 16% 提到缺乏高層支持。
  • 在已有政策的組織中,42% 回報營運改善,例如效率提升與成本下降,34% 回報顧客信任增加。

實際出錯的是什麼

《全球負責任 AI 現況》調查 — 這是第二次進行,涵蓋 20 個國家、19 個產業中 1,500 家營收至少 5 億美元的組織,於 2025 年 1 至 2 月執行 — 詢問了組織實際遭遇過哪些事故。對抗式攻擊與隱私侵害名列前茅。更值得注意的是,51% 的受訪者回報出現非預期的決策行為,47% 回報模型偏誤,這顯示許多組織難以預測與控制自家 AI 系統的行為。在麥肯錫的調查中,只有 8% 的組織回報曾發生任何 AI 相關事故,因此上述數字描述的是那些真的在留意的組織。

一年之間變了什麼

  • 2024 到 2025 年間,企業對財務風險的擔憂明顯上升(增加 38 個百分點),品牌與商譽風險(+16)、隱私與資料相關風險(+15)、可靠性風險(+14)也都上升。
  • 有兩個類別走向相反:社會風險下降 7 分、社會環境風險下降 8 分 — 最難定價的風險,正是最快失去關注的那些。
  • 在幾乎所有理念層面的問題上,答案都大致對半分:開放權重與封閉權重哪個更安全、風險緩解責任屬於模型供應商還是使用者、代理是否風險太高而不宜大規模採用。整個產業並沒有統一的策略方向。
  • 唯一明確的例外本身就是個矛盾:64% 的受訪者傾向安全優先,但同時有 58% 已在探索低度監督的代理 — 以目前負責任 AI 的成熟度來看,這樣的組合並不安穩。

3.5 — 治理走向多邊的一年

如果說 2023 年是各國 AI 戰略之年,2024 年就是協調之年。每一個主要國際組織都發布了負責任 AI 框架,而第一個跨國安全網絡也正式成形。

  1. 2024 年 5 月 · OECD

    更新 AI 原則

    OECD 修訂其框架以反映 AI 治理的最新發展,強調包容性成長、透明度與可解釋性,以及對法治的尊重。

  2. 2024 年 5 月 · 歐洲理事會

    第一份具法律拘束力的 AI 條約

    《人工智慧與人權、民主及法治框架公約》獲得通過,旨在確保 AI 生命週期中的各項活動皆符合人權、民主與法治。

  3. 2024 年 6 月 · 歐盟

    歐盟 AI 法案

    這是全球主要經濟體中第一套全面性的 AI 監管框架。它依風險把 AI 系統分類並據以監管,把大部分義務放在高風險系統的供應商與開發者身上。

  4. 2024 年 7 月 · 非洲聯盟

    非洲大陸 AI 戰略

    為整個非洲大陸的 AI 發展、倫理與治理提出統一願景,強調在非洲進行合乎倫理、負責任且公平的 AI 發展。

  5. 2024 年 9 月 · 聯合國

    《為人類治理 AI》報告

    聯合國 AI 諮詢機構更新了關於建立全球 AI 治理機制的報告,建議制定一份因應 AI 風險的藍圖,並呼籲標準組織、科技公司、公民社會與政策制定者共同合作。

  6. 2024 年 10 月 · G7 與東協-美國

    開放市場與共通標準

    G7 數位競爭公報重申對公平開放的 AI 市場與協調一致監管路徑的承諾。第 12 屆東協-美國高峰會後,雙方領袖發表聲明推動安全、可靠、值得信賴的 AI,並承諾在國際治理框架與標準上合作。

  7. 2024 年 11 月 · 九個國家與歐盟

    國際 AI 安全研究院網絡

    第一個跨國的 AI 安全研究院網絡成立,集結致力於推進 AI 安全的技術機構,協助政府與社會理解先進 AI 系統的風險,並提出解方。

  8. 2025 年 2 月 · 阿拉伯聯盟

    阿拉伯 AI 對話圈

    在阿拉伯聯盟總部啟動的「阿拉伯世界的人工智慧」對話,聚焦創新應用,同時高度重視倫理挑戰。

3.6–3.8 — 資料公共財正在關閉,而偏見轉入地下

本章最具後果的兩項發現,離安全話題的鎂光燈很遠:開放網路正被圍起來、擋在 AI 訓練之外;而通過顯性偏見測試的模型,依然在隱性偏見上失守。

網路正在關上大門

  • 一項針對 C4、RefinedWeb 與 Dolma 的同意協定縱向稽核發現,資料使用限制大幅上升,主要透過更新 robots.txt 與服務條款、明文禁止用於 AI 訓練來執行。
  • C4 前段網域中受完全限制的 token 比例,從 2017 年的 10% 上升到 2024 年的 48% — 其中光是 2023 到 2024 一年就增加了 25 個百分點。在維護中的網域裡,受限 token 從 5%–7% 跳升到 20%–33%。
  • 執行方式既不一致也不平均:OpenAI 的爬蟲遭遇的限制最嚴格,較小的開發者面對的門檻反而較低。robots.txt 這類訊號機制效果不彰,明文政策與實際執行往往對不上。
  • 另一項針對逾 1,800 個常用文字資料集的稽核發現,超過 70% 缺乏足夠的授權資訊,50% 的授權標示分類錯誤 — 這讓開發者可能在不知情的狀況下違反著作權或資料使用政策,承受法律與倫理風險。
  • 後果不只在法律層面。公開資料變少意味著資料多樣性下降、模型對齊變弱,繼續擴大規模的路也更難走,因為近期許多效能進步正是來自愈來愈大的訓練資料集。

在基準測試中存活下來的偏見

2024 年,研究者用兩種新的偵測方法 — 分析詞彙與概念間自動聯想的「LLM 隱性偏見」,以及捕捉這些聯想所產生行為的「LLM 決策偏見」 — 對包含 GPT-4 與 Claude 3 Sonnet 在內的八個知名模型、橫跨 21 種刻板印象類別進行檢測。這些模型不成比例地把負面詞彙與黑人聯繫在一起,較常把女性與人文而非 STEM 領域連結,並在領導角色上偏好男性。關鍵在於,隨著模型規模擴大,隱性偏見反而增加,而決策偏見與拒答率並沒有。標準基準上的偏見指標確實改善了,製造出中立的假象;底層的聯想卻沒有消失。

在視覺領域,規模擴大同樣讓情況變糟。研究者以芝加哥臉部資料集評測 14 個在 LAION-400M 與 LAION-2B 上訓練的視覺語言模型,發現較大的資料集雖然改善了人類分類 — 減少把人誤判為非人實體 — 卻同時放大了種族偏見。在較大的 ViT-L 模型中,黑人與拉丁裔男性被不成比例地歸類為罪犯,而且當資料集從 4 億筆增加到 20 億筆時,這種分類機率最高上升 69%。作者主張應建立透明的資料集策展、詳盡的超參數文件,以及開放獨立稽核的管道。

透明度與研究社群

  • 基礎模型透明度指數 v1.1 在 2024 年 5 月錄得平均 58 分(滿分 100),高於 2023 年 10 月的 37 分,開發者在 100 項指標中的 89 項有所改善。資料取得、著作權狀態與下游影響仍相當不透明;而在上游透明度上,開源開發者的表現勝過封閉開發者,在資料與勞動揭露方面尤其明顯。
  • 六個頂尖研討會接受的負責任 AI 論文成長 28.8%,從 2023 年的 992 篇增至 2024 年的 1,278 篇。以比例來看,FAccT(69.14%)與 AIES(63.33%)居首,符合它們的定位;NeurIPS 的比例從 13.8% 降到 9.0%,ICML 則從 3.4% 升到 8.2%。
  • 安全與資安類投稿一年內幾乎翻倍,從 276 篇增至 521 篇。公平性與偏見論文約翻倍至 408 篇。透明度與可解釋性達 355 篇,是 2019 年的四倍。隱私與資料治理是唯一的例外,下降 14.5%。
  • 以國家來看,美國以 2024 年 669 篇負責任 AI 論文領先,高於中國(268 篇)與德國(80 篇)。自 2019 年累計,美國 3,158 篇、中國 1,100 篇、英國 485 篇。

3.9–3.10 — 五個令人不安的發現

安全與特別主題這幾節,是本章最不讓人安心、也最具體的部分。

安全訓練到底做得有多深?
在許多模型裡,只有幾個 token 那麼深。研究者提出「淺層安全對齊」的概念:模型的防護往往只涵蓋回應的前幾個字。直接問怎麼製作炸彈,模型會拒絕;但若誘導它以類似「好的,以下是詳細指南」開頭,後續內容繼續生成的機率就大幅上升。實驗顯示,只要在回應前面填入非標準文字,或做極少量的微調,有害輸出率就會在僅僅六個微調步驟後,從 1.5% 升到 87.9%。提出的解方相當具體:擴充訓練資料,讓模型學會從有害的開頭「回頭」並轉向拒答;以及對開頭用詞做正則化,讓不尋常的起手式不至於作廢安全約束。兩者合併後,攻擊成功率最低可降到 2.8%。
代理可以被託付真正的工具嗎?
在高風險場域還不行。ToolEmu 以模擬工具執行的方式,讓代理安全性可以大規模測試,既有做一般風險評估的標準模擬器,也有針對極端情境施壓的對抗式模擬器。人類評估者確認,它揭露的風險中有 68.8% 是合理的真實世界威脅。在一套含 36 組工具包、144 個測試案例的基準上,即使是安全性最佳化的語言模型代理,也在 23.9% 的關鍵情境中失敗 — 錯誤包括危險指令、誤導的金融交易與交通控制失效。代理自主運作、與環境動態互動,做出的決策帶有法律與社會後果,這正是它們在高風險應用中的可靠性仍令人擔憂的原因。
當代理開始彼此交談,會發生什麼事?
淪陷會自行擴散。研究多模態 LLM 代理系統的學者記錄了他們稱為「傳染式越獄」的現象:只要在一個代理的記憶中注入一張對抗性影像,就可能觸發失控的連鎖反應,有害行為在互連的代理之間指數擴散,不需要任何後續介入。被感染的代理會把那張對抗性影像塞進良性代理的記憶庫。在最多一百萬個以 LLaVA-1.5 為基礎的代理網絡模擬中,感染在 27 到 31 個互動回合內就幾乎完全擴散。目前已有理論上的圍堵策略,但還沒有可行的緩解方法 — 這讓大規模部署互連的多模態代理成為一個現在進行式的資安問題,而非假設性問題。
AI 假訊息左右了 2024 年的選舉嗎?
證據顯示沒有,而這個答案並不該讓人放心。2024 年全球有 40 億人參與各國大選,AI 相關的選舉假訊息出現在十幾個國家、超過 10 個社群平台上。已記錄的案例包括:與中國有關的 spamouflage 行動在美國大選前散布 AI 生成影像;一張 AI 生成的坑洞照片被用來勸阻南非西開普省選民;俄羅斯的 Doppelganger 行動以仿冒正規新聞網站的搶註網域,填入 AI 生成文章;以及美國陽光計畫辨識出的逾 35,000 則深偽內容,對象是 26 位國會議員,其中 25 位是女性。一位邊緣候選人在美屬薩摩亞初選中擊敗拜登,部分靠的正是 AI 生成的電子郵件、簡訊、音訊與影片。然而可量測的影響仍不明朗 — 許多人原本預期假訊息對選舉的衝擊會比實際嚴重得多。本章的切入角度是,二階傷害可能更重要:所謂「說謊者紅利」,也就是深偽技術光是存在,就足以讓人把真實證據斥為捏造。
有沒有什麼真的能讓模型更穩固?
定向潛在對抗訓練是本章最令人振奮的成果。以 Llama3-8B-instruct 系列為例,LAT 在維持 MMLU 等基準上的優異表現同時,顯著降低了對抗式攻擊的脆弱性 — 這種效率很重要,因為一個會犧牲效能與運算資源的安全方法,幾乎不會有開發者願意採用。LAT 也能在事先不知道觸發條件的情況下消除後門漏洞,大幅削弱模型重現受著作權保護文本(例如哈利波特段落)的能力,並讓已移除的知識更難被重新學回。應用在生物或資安風險等敏感領域時,它削弱了知識萃取攻擊,同時仍能正確回應超過 90% 的安全良性請求。

用五句話看這一章

第 3 章「負責任 AI」的頭條發現。

2024 年通報的 AI 相關事故上升到 233 起 — 創下新高,較 2023 年增加 56.4% — 而由於追蹤仰賴媒體報導,真實數字幾乎確定更高。
— Chapter 3 · Responsible AI
主要開發者都用 MMLU 與 GPQA 測試自家模型。但沒有一家在任何一個負責任 AI 基準上取得共識,這讓安全宣稱幾乎無從比較。
— Chapter 3 · Responsible AI
C4 前段網域中完全禁止用於 AI 訓練的 token 比例,從 2017 年的 10% 上升到 2024 年的 48% — 其中 25 個百分點只花了一年。
— Chapter 3 · Responsible AI
在每一個風險類別中,實際緩解的組織都少於認知到風險的組織:智慧財產權侵權對 57% 的組織有相關性,但只有 38% 積極處理。
— Chapter 3 · Responsible AI
明確訓練成無偏見的模型,依然展現出隱性偏見 — 而且隨著模型規模擴大,偏見還會增加,即使標準基準上的分數正在變好。
— Chapter 3 · Responsible AI

閱讀完整的負責任 AI 章節

第 3 章(3.1–3.10 各節) — 事故、基準、組織、學界、政策制定、隱私、公平性、透明度、資安與代理 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

前往 AI 指數報告 2025 →