所有人都同意 AI 應該安全。但幾乎沒有人用同一套方式衡量它
AI 指數 2025 第 3 章描繪出一個發展並不平均的負責任 AI 生態系。事故數創下新高,學界關注快速上升,政府也在行動 — 但模型開發者之間仍然沒有共通的安全基準,而各組織認知到的風險,遠多於他們實際著手處理的。先看數字:
3.2 — 每個人都回報 MMLU,卻沒有人對安全測試有共識
主要開發者一貫用同一批通用能力基準測試旗艦模型 — MMLU、GPQA、AIME。但在安全與責任面向上並沒有相對應的共識,這讓模型在監管者與買方最在意的那些維度上,真的很難互相比較。
這並不是因為開發者忽視安全 — 許多公司做了大量評測。問題在於這些評測是內部的、專有的、非標準化的,結果無法由更廣泛的社群驗證。Gryphon、Apollo Research 與 METR 等外部評測者只評估部分模型,他們的發現同樣難以被廣泛檢核。
新的基準開始補上這個缺口
- 來自史丹佛基礎模型研究中心的 HELM Safety,以 BBQ(社會偏見)、SimpleSafetyTests(自傷、身體傷害、兒少性剝削素材)、HarmBench(紅隊測試的騷擾、化學武器、假訊息)、AnthropicRedTeam(對抗式對話)與 XSTest(對良性提示的錯誤拒答)測試模型。測得最安全的是 Claude 3.5 Sonnet,得分 0.977,略勝 o1 的 0.976;2022 年的 GPT-3.5 Turbo 為 0.853。
- AIR-Bench 2024 把安全評測建立在真實法規之上:一套四層分類、共 314 項細緻微風險,來自八份政府法規與 16 份企業政策。在 22 個領先模型中,拒答率從 Anthropic Claude 系列的 91% 到 DBRX Instruct 的 25% 不等 — 這樣的落差顯示模型與歐盟 AI 法案等規則普遍存在錯位。
- 在幻覺方面,Hughes 幻覺評估模型排行榜上,GLM-4-9b-Chat 與 Gemini-2.0-Flash-Exp 以 1.3% 並列最低,其後是 o1-mini(1.4%)與 GPT-4o(1.5%)。
- 在事實性方面,OpenAI 的 SimpleQA 由表現最好的 o1-preview 作答,也只有 42.7% 正確。有些模型選擇不答而非亂猜:Claude-3 系列有 75% 的提示拒絕回應。若只看實際嘗試作答的部分,o1-preview 的正確率為 47.0%,Claude 3.5 Sonnet 為 44.5%。
事故持續攀升
AI 事故資料庫在 2024 年記錄了 233 起 AI 相關事故,創下新高,較 2023 年增加 56.4%。由於追蹤仰賴公開的媒體報導,真實數字幾乎確定更高。2024 年的案例涵蓋了本章關注的各類傷害:一名英國購物者被臉部辨識系統誤認為竊賊,遭當眾指控並被禁止進入使用該系統的店家;一名德州高中生遭人以取自她私人帳號的照片,生成不雅影像進行騷擾;一個聊天機器人在家屬不知情下重現了一名被殺害少女的身分;以及一起針對 Character.AI 的訴訟,主張該產品對處於困境的使用者缺乏防護措施,並與一名青少年的死亡有關。2024 年,社群也在爭論究竟該如何定義「嚴重事故」 — 至今仍無共識,而這本身就是問題的一部分。
3.3 — 在企業內部,負責任 AI 既沒有歸屬,也沒有共識
兩份調查 — 一份與麥肯錫合作、橫跨 30 多國,另一份由史丹佛研究者與 Accenture 合作、涵蓋 1,500 家大型組織 — 描繪出同一幅畫面。領導者相信負責任 AI。但關於「該怎麼做」,幾乎沒有一件事有定論。
這件事歸誰管?
- 沒有任何單一部門主導 AI 治理。最常見的答案是涵蓋資安、詐欺與隱私的資訊安全部門,佔 21%,其次是資料與分析部門的 17%。值得注意的是,已有 14% 的受訪者回報設有專責的 AI 治理職位。
- 投資規模隨企業規模上升:營收介於 100 億至 300 億美元的組織有 27%、營收超過 300 億美元的有 21%,每年投入 1,000 萬至 2,500 萬美元把負責任 AI 落地。較小的組織投入的金額較少,但不少人以佔營收比例來看仍屬可觀。
- 法規是最強的外部驅力。65% 的組織表示在負責任 AI 決策上受 GDPR 影響、41% 受歐盟 AI 法案影響、21% 受 OECD AI 原則影響。
- 主要障礙偏向實務而非政治:知識與訓練落差(51%)以及資源或預算限制居首,只有 16% 提到缺乏高層支持。
- 在已有政策的組織中,42% 回報營運改善,例如效率提升與成本下降,34% 回報顧客信任增加。
實際出錯的是什麼
《全球負責任 AI 現況》調查 — 這是第二次進行,涵蓋 20 個國家、19 個產業中 1,500 家營收至少 5 億美元的組織,於 2025 年 1 至 2 月執行 — 詢問了組織實際遭遇過哪些事故。對抗式攻擊與隱私侵害名列前茅。更值得注意的是,51% 的受訪者回報出現非預期的決策行為,47% 回報模型偏誤,這顯示許多組織難以預測與控制自家 AI 系統的行為。在麥肯錫的調查中,只有 8% 的組織回報曾發生任何 AI 相關事故,因此上述數字描述的是那些真的在留意的組織。
一年之間變了什麼
- 2024 到 2025 年間,企業對財務風險的擔憂明顯上升(增加 38 個百分點),品牌與商譽風險(+16)、隱私與資料相關風險(+15)、可靠性風險(+14)也都上升。
- 有兩個類別走向相反:社會風險下降 7 分、社會環境風險下降 8 分 — 最難定價的風險,正是最快失去關注的那些。
- 在幾乎所有理念層面的問題上,答案都大致對半分:開放權重與封閉權重哪個更安全、風險緩解責任屬於模型供應商還是使用者、代理是否風險太高而不宜大規模採用。整個產業並沒有統一的策略方向。
- 唯一明確的例外本身就是個矛盾:64% 的受訪者傾向安全優先,但同時有 58% 已在探索低度監督的代理 — 以目前負責任 AI 的成熟度來看,這樣的組合並不安穩。
3.5 — 治理走向多邊的一年
如果說 2023 年是各國 AI 戰略之年,2024 年就是協調之年。每一個主要國際組織都發布了負責任 AI 框架,而第一個跨國安全網絡也正式成形。
- 2024 年 5 月 · OECD
更新 AI 原則
OECD 修訂其框架以反映 AI 治理的最新發展,強調包容性成長、透明度與可解釋性,以及對法治的尊重。
- 2024 年 5 月 · 歐洲理事會
第一份具法律拘束力的 AI 條約
《人工智慧與人權、民主及法治框架公約》獲得通過,旨在確保 AI 生命週期中的各項活動皆符合人權、民主與法治。
- 2024 年 6 月 · 歐盟
歐盟 AI 法案
這是全球主要經濟體中第一套全面性的 AI 監管框架。它依風險把 AI 系統分類並據以監管,把大部分義務放在高風險系統的供應商與開發者身上。
- 2024 年 7 月 · 非洲聯盟
非洲大陸 AI 戰略
為整個非洲大陸的 AI 發展、倫理與治理提出統一願景,強調在非洲進行合乎倫理、負責任且公平的 AI 發展。
- 2024 年 9 月 · 聯合國
《為人類治理 AI》報告
聯合國 AI 諮詢機構更新了關於建立全球 AI 治理機制的報告,建議制定一份因應 AI 風險的藍圖,並呼籲標準組織、科技公司、公民社會與政策制定者共同合作。
- 2024 年 10 月 · G7 與東協-美國
開放市場與共通標準
G7 數位競爭公報重申對公平開放的 AI 市場與協調一致監管路徑的承諾。第 12 屆東協-美國高峰會後,雙方領袖發表聲明推動安全、可靠、值得信賴的 AI,並承諾在國際治理框架與標準上合作。
- 2024 年 11 月 · 九個國家與歐盟
國際 AI 安全研究院網絡
第一個跨國的 AI 安全研究院網絡成立,集結致力於推進 AI 安全的技術機構,協助政府與社會理解先進 AI 系統的風險,並提出解方。
- 2025 年 2 月 · 阿拉伯聯盟
阿拉伯 AI 對話圈
在阿拉伯聯盟總部啟動的「阿拉伯世界的人工智慧」對話,聚焦創新應用,同時高度重視倫理挑戰。
3.6–3.8 — 資料公共財正在關閉,而偏見轉入地下
本章最具後果的兩項發現,離安全話題的鎂光燈很遠:開放網路正被圍起來、擋在 AI 訓練之外;而通過顯性偏見測試的模型,依然在隱性偏見上失守。
網路正在關上大門
- 一項針對 C4、RefinedWeb 與 Dolma 的同意協定縱向稽核發現,資料使用限制大幅上升,主要透過更新 robots.txt 與服務條款、明文禁止用於 AI 訓練來執行。
- C4 前段網域中受完全限制的 token 比例,從 2017 年的 10% 上升到 2024 年的 48% — 其中光是 2023 到 2024 一年就增加了 25 個百分點。在維護中的網域裡,受限 token 從 5%–7% 跳升到 20%–33%。
- 執行方式既不一致也不平均:OpenAI 的爬蟲遭遇的限制最嚴格,較小的開發者面對的門檻反而較低。robots.txt 這類訊號機制效果不彰,明文政策與實際執行往往對不上。
- 另一項針對逾 1,800 個常用文字資料集的稽核發現,超過 70% 缺乏足夠的授權資訊,50% 的授權標示分類錯誤 — 這讓開發者可能在不知情的狀況下違反著作權或資料使用政策,承受法律與倫理風險。
- 後果不只在法律層面。公開資料變少意味著資料多樣性下降、模型對齊變弱,繼續擴大規模的路也更難走,因為近期許多效能進步正是來自愈來愈大的訓練資料集。
在基準測試中存活下來的偏見
2024 年,研究者用兩種新的偵測方法 — 分析詞彙與概念間自動聯想的「LLM 隱性偏見」,以及捕捉這些聯想所產生行為的「LLM 決策偏見」 — 對包含 GPT-4 與 Claude 3 Sonnet 在內的八個知名模型、橫跨 21 種刻板印象類別進行檢測。這些模型不成比例地把負面詞彙與黑人聯繫在一起,較常把女性與人文而非 STEM 領域連結,並在領導角色上偏好男性。關鍵在於,隨著模型規模擴大,隱性偏見反而增加,而決策偏見與拒答率並沒有。標準基準上的偏見指標確實改善了,製造出中立的假象;底層的聯想卻沒有消失。
在視覺領域,規模擴大同樣讓情況變糟。研究者以芝加哥臉部資料集評測 14 個在 LAION-400M 與 LAION-2B 上訓練的視覺語言模型,發現較大的資料集雖然改善了人類分類 — 減少把人誤判為非人實體 — 卻同時放大了種族偏見。在較大的 ViT-L 模型中,黑人與拉丁裔男性被不成比例地歸類為罪犯,而且當資料集從 4 億筆增加到 20 億筆時,這種分類機率最高上升 69%。作者主張應建立透明的資料集策展、詳盡的超參數文件,以及開放獨立稽核的管道。
透明度與研究社群
- 基礎模型透明度指數 v1.1 在 2024 年 5 月錄得平均 58 分(滿分 100),高於 2023 年 10 月的 37 分,開發者在 100 項指標中的 89 項有所改善。資料取得、著作權狀態與下游影響仍相當不透明;而在上游透明度上,開源開發者的表現勝過封閉開發者,在資料與勞動揭露方面尤其明顯。
- 六個頂尖研討會接受的負責任 AI 論文成長 28.8%,從 2023 年的 992 篇增至 2024 年的 1,278 篇。以比例來看,FAccT(69.14%)與 AIES(63.33%)居首,符合它們的定位;NeurIPS 的比例從 13.8% 降到 9.0%,ICML 則從 3.4% 升到 8.2%。
- 安全與資安類投稿一年內幾乎翻倍,從 276 篇增至 521 篇。公平性與偏見論文約翻倍至 408 篇。透明度與可解釋性達 355 篇,是 2019 年的四倍。隱私與資料治理是唯一的例外,下降 14.5%。
- 以國家來看,美國以 2024 年 669 篇負責任 AI 論文領先,高於中國(268 篇)與德國(80 篇)。自 2019 年累計,美國 3,158 篇、中國 1,100 篇、英國 485 篇。
3.9–3.10 — 五個令人不安的發現
安全與特別主題這幾節,是本章最不讓人安心、也最具體的部分。
安全訓練到底做得有多深?
代理可以被託付真正的工具嗎?
當代理開始彼此交談,會發生什麼事?
AI 假訊息左右了 2024 年的選舉嗎?
有沒有什麼真的能讓模型更穩固?
用五句話看這一章
第 3 章「負責任 AI」的頭條發現。
2024 年通報的 AI 相關事故上升到 233 起 — 創下新高,較 2023 年增加 56.4% — 而由於追蹤仰賴媒體報導,真實數字幾乎確定更高。
主要開發者都用 MMLU 與 GPQA 測試自家模型。但沒有一家在任何一個負責任 AI 基準上取得共識,這讓安全宣稱幾乎無從比較。
C4 前段網域中完全禁止用於 AI 訓練的 token 比例,從 2017 年的 10% 上升到 2024 年的 48% — 其中 25 個百分點只花了一年。
在每一個風險類別中,實際緩解的組織都少於認知到風險的組織:智慧財產權侵權對 57% 的組織有相關性,但只有 38% 積極處理。
明確訓練成無偏見的模型,依然展現出隱性偏見 — 而且隨著模型規模擴大,偏見還會增加,即使標準基準上的分數正在變好。
閱讀完整的負責任 AI 章節
第 3 章(3.1–3.10 各節) — 事故、基準、組織、學界、政策制定、隱私、公平性、透明度、資安與代理 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。
前往 AI 指數報告 2025 →