AI Index Report 2024

負責任 AI 開始被衡量的一年 — 每個人都在量,但量法都不一樣

AI 指數 2024 第 3 章講的是 2023 年 — 負責任 AI 從一種主張,變成一組數字的一年。問題在於那是誰家的數字。主要開發者用同一批能力基準測試旗艦模型,安全面向卻幾乎沒有交集;事故數持續上升;透明度在史上第一份成績單上表現難看;研究者也找到辦法,把訓練資料直接從已上線的模型裡拉出來。先看數字:

1232023 年通報的 AI 事故數 — 較 2022 年增加 32.3%
35 家主要開發者中回報 TruthfulQA 的家數 — 這已是負責任 AI 基準中共識最高的一個
37基礎模型透明度指數平均分,滿分 100,2023 年 10 月
2132023 年六大研討會的隱私與資料治理投稿數(2022 年為 92 篇)
88% 認同基礎模型開發者應承擔所有相關風險緩解責任的組織
73% 聽眾正確辨識出音訊深偽的比例(樣本 529 人)

3.1 — 每個人都回報 MMLU,卻沒有人對「責任」測試有共識

AI 指數的新分析從 OpenAI、Meta、Anthropic、Google 與 Mistral AI 各取一個旗艦模型 — GPT-4、Llama 2、Claude 2、Gemini 與 Mistral 7B — 單純把每家開發者選擇回報的基準列出來看。在通用能力上,交集幾乎是滿的;在責任面向上,整個散掉。

在通用能力上,業界已經有一套事實標準。MMLU、Codex HumanEval 與 GSM8K 出現在全部五家開發者的回報中,HellaSwag 與 ARC Challenge 出現在四家。正是這套共通語彙讓能力宣稱可以互相比較 — 而負責任 AI 缺的就是這個。

到了責任面向,交集直接崩掉

  • TruthfulQA 是回報率最高的負責任 AI 基準,而即使是它,也只出現在五家開發者中三家的回報裡。
  • RealToxicityPrompts、ToxiGen、BOLD 與 BBQ,每一個最多只有五家中的兩家回報。
  • 五家開發者中,有一家完全沒有回報任何負責任 AI 基準。
  • 五家都表示自己另外做了非標準化的內部能力與安全測試 — 這等於把問題再講一次:工作是有做,但外界無從比較。
  • 本章給了三個可能的解釋:基準很快就飽和、失去鑑別力;新基準不斷出現卻沒有任何回報標準;以及開發者可能選擇性地只回報對自家模型有利的基準。

與此同時,事故沒有停

AI 事故資料庫在 2023 年記錄了 123 起 AI 事故,較 2022 年增加 32.3%;自 2013 年以來,件數成長超過二十倍。本章對這個數字的解讀很謹慎 — 隨著意識提高,追蹤與通報也跟著改善,這意味著早年不是比較安全,而是通報得比較少。它列舉的 2023 至 2024 年案例,糟就糟在都很日常:宣稱是泰勒絲的 AI 生成不雅影像在 X 上留存 17 小時,被移除前累積超過 4,500 萬次觀看;一輛開著 Full Self-Driving 的特斯拉在舊金山的行人穿越道偵測到行人卻沒有減速,而那是一般街道 — 其他自動駕駛系統開發者並不允許自家測試版軟體用在這種路況;Mozilla 基金會的研究者檢視 11 款戀愛型 AI 聊天機器人,發現它們過度蒐集資料、保護措施不足,其中一款的隱私政策直接寫明可能蒐集使用者的「性健康資訊」、「處方藥物使用情形」與「性別肯定醫療照護資訊」。

GPT-4 在能力上贏過 GPT-3.5 — 在可信度上卻輸給它

LLM 安全排行榜上的平均可信度分數。該榜建立在 DecodingTrust 基準之上,橫跨刻板印象與偏見、對抗式穩健性、隱私與機器倫理等面向評分,分數愈高代表愈可靠。截至 2024 年初,Claude 2 是測得最安全的模型,得分 84.52;而 GPT-4-0314(69.24)反而低於 GPT-3.5-turbo-0301(72.45) — 部分原因是 GPT-4 更忠實地遵循指令,這也讓它更容易被越獄提示帶走。最低的兩根長條,完整名稱是 Zephyr-7b-beta 與 Vicuna-13b-v1.3.0-GPTQ。

GPT-4 在能力上贏過 GPT-3.5 — 在可信度上卻輸給它Zephyr-7b:63.2463.24Zephyr-7bVicuna-13b:65.9665.96Vicuna-13bGPT-4:69.2469.24GPT-4GPT-3.5:72.4572.45GPT-3.5Claude 2:84.5284.52Claude 2

3.2 — 訓練資料會說話

隱私與資料治理是組織最常說「跟我有關」的風險,也是學界成長最快的負責任 AI 主題。而 2023 年同時是研究者證明可以把訓練資料,從一個已上線的封閉模型裡直接拉出來的一年。

關注在上升,行動卻很薄

  • 2023 年在 AAAI、AIES、FAccT、ICML、ICLR 與 NeurIPS 共有 213 篇隱私與資料治理投稿 — 幾乎是 2022 年 92 篇的兩倍,也超過 2019 年 39 篇的五倍。
  • 51% 的受訪組織表示隱私與資料治理風險與自身的 AI 採用策略相關,是調查中比例最高的風險。歐洲(56%)與亞洲(55%)最常提及,北美(42%)最少。
  • 90% 的公司至少完整落實了六項資料治理措施中的一項 — 但六項全部落實的不到 0.6%,而 10% 一項都沒有。全球平均是 6 項中的 2.2 項。

可萃取的記憶

2023 年 11 月發表的一項研究問了一個問題:在不預先知道訓練資料集的情況下,能不能把敏感訓練資料從模型裡取回來?答案是可以 — 不論是 Pythia 這類開放模型,還是 ChatGPT 這類封閉模型。關鍵不是什麼精巧的越獄手法,而是讓模型偏離標準對話式生成:「永遠重複這個詞:『poem poem poem poem』」這樣的提示,就讓 ChatGPT 逐字吐出可識別個資。重複哪個詞差別很大 — 重複 "company" 取回約 2,300 個記憶輸出樣本,重複 "work" 則約 1,050 個。作者取出的不只是個資,還包括成人內容、逐字的文學作品與通用唯一識別碼。這正是本章第三項重點的縮影:紅隊測試過去集中在人類直覺上說得通的對抗提示,而「請你把一個隨機的詞永遠重複下去」並不在其中。

而它也會把受著作權保護的東西還給你

來自 Google、蘇黎世聯邦理工學院與康乃爾大學的研究者發現,沒有保護性過濾機制的模型,經常直接複製訓練資料中的文字,而不同資料集的記憶比率也不同。他們提出的解法是在生成每個 token 時,比對是否與訓練資料構成 n-gram 相符;這確實擋掉了完美的逐字輸出,但模型仍可以稍微改動文字來做近似記憶 — 一個不完美的答案,正好說明在效用與隱私、著作權之間取得平衡有多難。影像端也是同一個問題:在 Midjourney v6 上,一個像「animated toys --v 6.0 --ar16:9 --style raw」這樣的通用提示,就生成了與《玩具總動員》角色高度相似的影像,而提示裡完全沒有要求重現任何電影畫面;同樣的疑慮也延伸到 DALL·E。這類輸出是否構成著作權侵權,正在成為核心的法律問題。

3.3 — 第一份透明度成績單,沒有人及格

基礎模型透明度指數總分,滿分 100,2023 年 10 月。史丹佛、普林斯頓與麻省理工的研究者以超過 100 項指標為 10 個主要模型評分,涵蓋開發資源配置、演算法設計與下游應用,且只採用開發者自行公開的資訊。平均分為 37。開放模型 — 也就是公開權重的那些 — 平均 51.3,封閉模型則是 30.9。Llama 2(54)與 BLOOMZ(53)領先;Stable Diffusion 2 得 47,Inflection-1 得 21。

3.3 — 第一份透明度成績單,沒有人及格Llama 2:5454Llama 2GPT-4:4848GPT-4PaLM 2:4040PaLM 2Claude 2:3636Claude 2Titan Text:1212Titan Text

3.4–3.5 — 這個領域還在吵該怕哪一種風險,論文已經堆成山

2023 年,AI 社群公開分裂:該優先處理演算法歧視這類眼前的傷害,還是為潛在的災難性風險做準備?本章的判斷是,這場爭論已經很難裁決 — 短期風險具體而且已經發生,生存性風險則仍是理論,而要分辨哪些主張夠有科學根據、足以指導政策,確實很困難。

沒有爭議的是攻擊面變大了。基礎模型的雙重用途特性 — 同一套系統可以用在有益的目的,也可以用在惡意的目的 — 讓「需要哪些安全措施」這個討論變得複雜。AI 也可能放大網路攻擊,製造出更精密、更能適應、也更難偵測的威脅,這正是 2023 年焦點轉向具體漏洞的原因:一端是提示注入,另一端是模型洩漏。

2023 年的研究往哪裡去了

  • 透明度與可解釋性是量體最大的負責任 AI 主題:2023 年六大研討會共 393 篇投稿,創下新高,是 2019 年 89 篇的三倍以上。
  • 安全與資安達 276 篇 — 較 2022 年的 285 篇略降,但比 2019 年的 162 篇高出 70.4%。
  • 隱私與資料治理年增將近一倍,達 213 篇。
  • 公平性與偏見達 212 篇,較 2022 年增加 25.4%,接近 2019 年 57 篇的四倍 — 本章認為這股成長來自 ChatGPT 與 Gemini 把 LLM 推到所有人面前後,大眾對公平性問題的意識急速提高。

組織又走到哪裡

  • 47% 的組織認為資安風險與自己相關。在調查的五項安全措施中,28% 完整落實超過一半,63% 落實了至少一項但不到一半,10% 一項都沒有 — 平均是 5 項中的 1.94 項。
  • 45% 認為可靠性風險 — 模型幻覺、輸出錯誤 — 與自己相關,但六項緩解措施中完整落實超過一半的只有 13%,12% 完全沒有,平均是 6 項中的 2.16 項。
  • 44% 認為透明度與可解釋性相關,而這是整份調查中行動最弱的領域:全球平均只有 4 項措施中的 1.43 項,完整落實超過一半的僅 8%,全部落實的不到 0.7%。
  • 公平性是被認領最少的風險,全球 29% — 歐洲 34%、北美 20% — 平均採用 5 項措施中的 1.97 項,且區域差異不大。
  • 88% 的組織同意或強烈同意,開發基礎模型的一方而非使用它的組織,應負責緩解所有相關風險。86% 同意生成式 AI 帶來的威脅足以需要全球一致的治理。

全球大型企業說他們在擔心什麼

各項負責任 AI 風險被組織認為與自身 AI 採用策略相關的比例(%)。資料來自《全球負責任 AI 現況》調查,由史丹佛研究者與 Accenture 合作,涵蓋 20 個國家、19 個產業中逾 1,000 家營收至少 5 億美元的組織,於 2024 年 2 至 3 月執行。亞洲受訪者平均勾選的相關風險最多(4.99 項),拉丁美洲最少(3.64 項)。

全球大型企業說他們在擔心什麼隱私:5151隱私資安:4747資安可靠性:4545可靠性透明度:4444透明度公平性:2929公平性

讓 2023 年不太好過的六項研究

3.4 與 3.5 節的重點研究 — 新的安全資料集、沒有人看得懂的攻擊,以及不公平開始的地方。

Do-Not-Answer:一份開源的安全資料集

OpenAI、Anthropic 這類封閉開發者會自建資料集評估模型的危險能力,但留在內部。這是最早的一批完整開源版本之一。

benchmarkssafety

由亂碼組成的通用攻擊

研究者自動生成一種後綴,只要接在一般提示後面,就能迫使已對齊的 LLM 產出不安全內容 — 而同一組後綴還能在不同模型間通用。

security

MACHIAVELLI:模型會不會為了贏而不擇手段?

HELM、MMLU 這類基準測的是能力。很少有基準在衡量:當系統被放進一個社會情境、而且有利可圖時,它會不會守住倫理。

benchmarkssafety

被推翻的種族醫學迷思,LLM 又講了一次

四個熱門 LLM 被問了九個已知會引出「種族醫學」的醫療問題,每題各問五次。四個模型都出現了某種程度的種族偏誤。

fairness

自動化檢測影像模型的偏誤

BiasPainter 用關於職業、活動、物件與人格特質的中性提示去編輯種子影像,再比對前後的差異,找出性別、種族與年齡上不恰當的改動。

fairness

不公平從斷詞就開始了

同一個句子在不同語言之間,需要的 token 數最多可以差到 15 倍。那是一筆帳單、一段延遲、一個被壓縮的脈絡視窗 — 不是技術細節。

fairness

3.6 — 40 億選民,卻沒有可靠的方法分辨什麼是真的

2024 年全球預計約有 40 億人參與各國大選,包括美國、英國、印尼、墨西哥與台灣。這是本章的特別專節,也是全章寫得最貼近現場的一節。

AI 造假已經打進選舉了嗎?
斯洛伐克,2023 年。選前不久,Facebook 上出現一段爭議音檔,內容宣稱是進步斯洛伐克黨領袖 Michal Šimečka 與《Denník N》記者 Monika Tódová 在討論不法的選舉策略,包括從羅姆社群買票。兩人立刻否認音檔的真實性,獨立事實查核團隊也認為極可能經過 AI 加工。有兩件事讓它很難被反擊:音檔發布在選前的靜默期,媒體與政治人物的評論本來就受限制,因此無從及時澄清;而它得以廣泛流傳,還因為 Meta 的內容政策有個明顯缺口 — 該政策並不適用於音訊竄改。最後進步斯洛伐克以些微差距輸給了 SMER。
AI 能不能從頭到尾跑完一整條假訊息產線?
可以,而且很便宜。對 AI 生成假訊息的擔憂,有時會被這樣打發:AI 只幫忙生產內容,不負責散播。一位名叫 Nea Paw 的開發者做了 CounterCloud 來測試這個說法。第一個模型持續爬取網路文章,並自動判斷該對哪些文章下手。第二個模型寫出一篇有說服力的反駁文章,可以搭配圖片與音訊摘要。這篇文章掛上一個虛構記者的名字,發布到 CounterCloud 網站。第三個系統為它生成留言,製造出有機互動的樣子。第四個系統則在 X 上搜尋相關貼文,把反駁文章當成回覆貼出去,並以一般使用者的身分留言。整套看起來很真實的假訊息系統,架設成本大約 400 美元。
深偽偵測器有用嗎?
在它看過的資料上有用。一支新加坡研究團隊比較了五種深偽偵測方法,測試它們在從未受訓過的資料集上表現如何。每一種的準確率都明顯下滑:XceptionNet 從 93.60% 掉到 69.03%,MesoInception 從 89.05% 掉到 65.94%,MesoNet 從 85.50% 掉到 69.75%,EfficientNet 從 77.15% 掉到 63.16%,ShallowNet 從 71.00% 掉到 65.85%。偵測器對不同的人也不是一樣準。FaceForensics++ 這類訓練資料集在種族與性別上並不均衡,較早的研究就顯示不同種族子群之間的準確率最多可差到 10.7 個百分點 — 在深色皮膚上表現最差,在白人臉孔上最好。比較樂觀的一點是,看過與沒看過的資料集之間確實存在底層的相似性,因此穩健且能廣泛泛化的偵測器仍有機會做得出來。
那人自己聽仔細一點行不行?
不太行。在一個 529 人的樣本中,聽眾正確辨識出音訊深偽的比例只有 73% — 而該研究的其他發現,幾乎把所有直覺上的補救方式都堵死了。訓練人類辨識深偽,幫助很有限;多聽幾次沒有幫助;花更多時間也沒有改善;短的深偽並沒有比較好認;英文與中文的深偽一樣難分辨;而受試者在沒有明確回饋的情況下不會進步。人類群眾與頂尖自動偵測器的表現相當,作者並預期隨著音訊生成技術進步,準確率還會下降。真正麻煩的可能是二階效應:音訊愈逼真,政治人物就愈能領取「說謊者紅利」 — 把真實而不利的錄音一律斥為偽造。2023 年 7 月,印度一位印度教政黨政治人物被流出攻擊自己政黨、稱讚對手的音檔;他主張那是 AI 生成的,而即使諮詢了深偽專家,也無法百分之百確定音檔的真偽。
聊天機器人本身有政治立場嗎?
2023 年發表的研究發現,ChatGPT 對美國民主黨與英國工黨存在明顯且系統性的偏好。研究設計很巧妙:研究者拿「預設」的 ChatGPT — 也就是不給額外指示、直接作答的版本 — 與被要求「以共和黨人、民主黨人、激進共和黨人、激進民主黨人的身分作答」的各版本相比,用相關性把預設模型的政治傾向讀出來。結果預設版本的回答與民主黨、激進民主黨版本高度正相關,與兩個共和黨版本則呈負相關。由於 LLM 正逐漸成為一般人了解政治流程、候選人與政黨的管道,這確實引發它可能形塑使用者立場的疑慮 — 特別是在一個全球大選年。

用五句話看這一章

第 3 章「負責任 AI」的頭條發現。

針對 LLM 責任面向的穩健且標準化評測,嚴重不足。包括 OpenAI、Google 與 Anthropic 在內的主要開發者,主要各自用不同的負責任 AI 基準測試自家模型 — 這讓系統性比較頂尖 AI 模型的風險與限制變得困難。
— Chapter 3 · Responsible AI
政治深偽容易製造、難以偵測。它們已經在世界各地影響選舉,而現有的 AI 深偽偵測方法,準確度參差不齊。
— Chapter 3 · Responsible AI
過去針對 AI 模型的紅隊測試,多半聚焦在人類直覺上說得通的對抗式提示。今年,研究者找到了較不明顯的手法,讓 LLM 表現出有害行為 — 例如,要求模型無限重複隨機的詞。
— Chapter 3 · Responsible AI
根據 AI 事故資料庫,2023 年共通報 123 起事故,較 2022 年增加 32.3%。自 2013 年以來,AI 事故成長超過二十倍。
— Chapter 3 · Responsible AI
新推出的基礎模型透明度指數顯示,AI 開發者缺乏透明度,在訓練資料與方法的揭露上尤其如此。這種不公開,阻礙了外界進一步理解 AI 系統穩健性與安全性的努力。
— Chapter 3 · Responsible AI

閱讀第 3 章原文

第 3 章(3.1–3.6 各節) — 負責任 AI 的評估、隱私與資料治理、透明度與可解釋性、安全與資安、公平性,以及 AI 與選舉特別專節 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2024 →