真實性與可信度
26 個模型的幻覺率橫跨 22%–94%;GPT-4o 對第一人稱錯誤信念掉到 64.4%。
AI 指數 2026 第 3 章追蹤負責任 AI(RAI)的多個面向 — 安全、公平、透明、隱私與真實性。安全基準在擴張,採用 RAI 政策的組織也變多,但前沿模型仍少有揭露 RAI 結果,透明度在 2025 年下滑,而某一面向的進步往往以犧牲另一面向為代價。先看數字:
從評估 RAI 得到的兩個訊號:真實世界的傷害持續攀升;而即使是評估正在成熟的面向 — 真實性 — 失效模式也變得更奇怪。
有記錄的 AI 事件持續上升。AI 事件資料庫(AIID)是一個記錄 AI 系統造成或差點造成傷害的開放資料庫,2025 年記錄了 362 起事件,高於 2024 年的 233 起 — 而在 2022 年以前,每年數量一直低於 100。2025 年的指標性案例包括:xAI 的 Grok 在一次放寬安全過濾的系統更新後生成反猶仇恨言論、冒充演員金東的深偽愛情詐騙,以及 AI 複製、模仿一家破產零售商的釣魚網站。
幾乎所有前沿開發者都會揭露 MMLU、GPQA、AIME、SWE-bench Verified 等能力基準 — 但 RAI 基準(評估偏誤的 BBQ、評估安全的 HarmBench/Cybench/StrongREJECT/WMDP、評估真實性的 SimpleQA)的揭露大多空白。只有 Claude Opus 4.5 揭露超過兩項 RAI 基準的結果,也只有 GPT-5.2 揭露 StrongREJECT。
根據 AI Index 與麥肯錫連續第二年針對企業領導者(不含中國)的調查,RAI 成熟度、治理歸屬與障礙在 2024 到 2025 年間都出現變化。
負責任 AI 的成熟度在各區域都有改善,但仍處於早期階段:四分制下的全球平均從 2.0 升到 2.3,意味多數組織仍在整合 RAI 實務,而非完全落實。AI 治理的歸屬轉向專責的 AI 專屬職位(從 14% 升到 17%),而沒有 RAI 政策的組織占比則從 24% 大幅降到 11%。
第 3 章橫跨負責任 AI 的多個面向,每一個都有自己的量測難題。點任一張卡片看完整樣貌與數字。
26 個模型的幻覺率橫跨 22%–94%;GPT-4o 對第一人稱錯誤信念掉到 64.4%。
AIID 在 2025 年記錄 362 起事件(2024 為 233)— 仇恨言論、深偽詐騙與 AI 複製的釣魚網站。
AI 專屬治理職位成長 17%;沒有 RAI 政策的組織從 24% 降到 11%。
模型在英文表現遠勝其他;在 HELM Arabic 上,一個區域模型勝過 GPT-5.1 與 Gemini。
基礎模型透明度指數平均從 58 降到 40;IBM 以 95 居首,xAI 只有 14。
安全機構擴散到更多國家;在 HELM Safety 上模型群聚在 0.90–0.98,但在越獄下崩潰。
優化某一 RAI 面向可能損害另一面向 — 差分隱私讓準確率最多下降 33 個百分點。
第 3 章「負責任 AI」的頭條發現。
有記錄的 AI 事件持續上升,AI 事件資料庫在 2025 年記錄 362 起,高於 2024 年的 233 起。
在一個新的準確性基準上,幻覺率從 22% 到 94% 不等 — 而模型仍難以區分知識與信念。
2025 年 AI 專屬治理職位成長 17%,沒有負責任 AI 政策的企業從 24% 降到 11%。
基礎模型透明度在 2025 年下滑 — FMTI 平均從 58 降到 40 — 逆轉了前一年的進步。
改善某一負責任 AI 面向可能以另一面向為代價:隱私的提升讓準確率最多下降 33 個百分點。
第 3 章(3.1–3.10 各節)連同所有圖表與引用,皆由史丹佛 HAI 免費提供 — 涵蓋事件、真實性、治理、公平、透明、安全,以及它們之間的取捨。或回到 15 條重點與九大章節總覽。
前往第 3 章:負責任 AI →