AI Index Report 2023

倫理問題不再只是研究者的問題的那一年

AI 指數 2023 第 3 章講的是 2022 年 — 這一年,做出並發布生成模型的技術門檻大幅崩落,倫理問題也從實驗室走進社群媒體。整章的主軸並不讓人舒服:更大的模型在某些偏誤基準上更強,在另一些上卻更毒;真正有效的解方是訓練方法而不是參數量;而那些聽起來在量同一件事的指標,彼此卻常常對不上。先看數字:

260AIAAIC 資料庫 2021 年記錄的 AI 事故與爭議 — 是 2012 年的 26 倍
192022 年計入的 AI 公平性與偏誤指標數,自 2016 年起穩定成長
372022 年使用 Perspective API 的研究論文數,一年成長 106%
3812022 年 NeurIPS 公平性與偏誤主題論文數(2021 年為 168 篇)
89% Flan-PaLM 62B 的 Winogender 準確率 — 未微調的 PaLM 62B 只有 3.5%
62.5% 預設為女性的熱門商用聊天機器人比例

3.1–3.2 — 通報的濫用成長 26 倍,而統計工作還在追趕

AIAAIC 資料庫是一份獨立、開放的公開資料集,收錄由 AI、演算法與自動化引發的事故與爭議。它 2019 年以一個研究 AI 商譽風險的私人專案起家,到 2021 年,一年就記錄了 260 起新事故。

2021 年新通報的 AI 事故與爭議數量,是 2012 年的 26 倍。報告對這個數字的詮釋很謹慎:上升同時反映了 AI 更深地嵌進真實世界,以及大眾對濫用可能性的認知提高。而隨著認知提高,追蹤本身也變好了 — 這代表較早期的事故其實被低估,曲線在紙上比在現實中更陡。圖表裡完全沒有 2022 年的數字,因為送進 AIAAIC 的案例要先經過冗長的審核程序才會正式收錄。

2022 年的案例實際上長什麼樣子

  • 2022 年 3 月,一段在社群媒體與烏克蘭新聞網站上流傳的深偽影片,看起來像是總統澤倫斯基下令軍隊向俄羅斯投降。
  • 2022 年 2 月的報導指出,部分美國監獄正用 AI 系統掃描收容人的通話。語音轉文字系統對黑人講者的辨識準確度較低,而美國受監禁人口中黑人佔比相當高。
  • 2022 年 4 月的報導指出,Intel 與教育新創 Classroom Technologies 正在打造一套辨識學生在 Zoom 上情緒狀態的系統 — 引發學生被過度監控、情緒被誤判的疑慮。
  • 2022 年 2 月的報導指出,倫敦大都會警察局維護一份名為「幫派暴力矩陣」的名單,收錄超過一千名疑似街頭幫派成員,並用 AI 工具為每個人的風險排序。多項研究認為這份名單並不準確,且對特定族裔與種族少數具有歧視性;2022 年 10 月警方宣布將大幅縮減名單人數。
  • Midjourney 在 2022 年 9 月被記錄為一起事故,而且同時踩到三件事:著作權,因為它用人類創作的圖像訓練卻不標示來源;就業,因為外界擔心它會取代人類藝術家的工作;以及隱私,因為母公司未必取得使用那數百萬張訓練圖像的許可。

與此同時,量測工具也在增加

只計算至少被另一篇著作引用過的指標,AI 公平性與偏誤指標在 2022 年達到 19 項,而且自 2016 年以來持續增加。本章畫出一條值得記住的分界:「基準」有標註資料、不隨時間改變,通常量的是模型內在的性質 — StereoSet 量的是模型選刻板印象而非反刻板印象的頻率,但不量它對不同群體的表現落差。「診斷指標」量的則是模型在下游任務上的影響,而真實世界裡的差別待遇正是在這裡現形。先前研究發現,情境化語言模型的內在與外在指標之間可能根本不相關 — 換句話說,選了哪個指標,悄悄決定了答案。2022 年的新指標兩邊都有:VLStereoSet 把 StereoSet 延伸到文字轉圖像的場景,HolisticBias 則整理出一組句子提示,用來量測過去沒人涵蓋的人口統計偏誤。

經過指令微調的 62B 模型,勝過沒微調的 540B 模型

Winogender 準確率(%),生成式設定下的零樣本評測。Winogender 用「系統多常以刻板印象的代名詞填入句子」來衡量與職業相關的性別偏誤。經指令微調的模型勝過好幾倍大的模型:Flan-PaLM 62B 達到 89.00%,而同樣大小的 PaLM 62B 只有 3.50%。

經過指令微調的 62B 模型,勝過沒微調的 540B 模型PaLM 62B:3.53.5PaLM 62BPaLM 540B:5.645.64PaLM 540BFlan-PaLM 8B:72.2572.25Flan-PaLM 8BFlan-T5-XXL:76.9576.95Flan-T5-XXLFlan-PaLM 62B:8989Flan-PaLM 62B

3.3 — 每一次公平性的進步,似乎都在別的地方付出代價

這是全章最長、也最讓人不安的一節。檢視的力道明顯加大 — 使用 Alphabet 的 Perspective API 量測毒性的論文一年成長 106%,2022 年達到 37 篇 — 但模型被量得愈仔細,量出來的結果就愈互相矛盾。

更大的模型在偏誤基準上表現更好

在 SuperGLUE 的 Winogender 任務上,PaLM 的結果支持了先前的發現:更大的模型就是更有能力 — 儘管它們產生有毒輸出的傾向也更高。PaLM 540B 達到 73.58%、Gopher 280B 為 71.40%,相對之下 31M 參數的 iPET(ALBERT)只有 57.90%,223M 的 WARP 是 50.00%。它們都離 95.90% 的人類基準線很遠。真正讓數字動起來的介入手段是指令微調:在生成式設定下,Flan-PaLM 62B 拿到 89.00%,而 PaLM 62B 是 3.50%。

接著,取捨就出現了

  • HELM 把模型準確率分別對公平性與偏誤作圖。準確率愈高的模型確實愈公平 — 但準確率與性別偏誤之間的關聯並不清楚。更麻煩的是,相關性分析發現,在公平性指標上表現較好的模型,性別偏誤反而較嚴重;而性別偏誤較低的模型,又傾向更毒。公平性與偏誤根本不是同一個軸,改善其中一個,可能把另一個推往錯的方向。
  • BBQ 量測偏誤如何在問答場景中浮現,涵蓋社經地位、宗教、身心障礙狀態、年齡等九個面向。當上下文不足以判斷時,模型比較可能倒向刻板印象,而不是回答「無法判斷」 — 而且這個現象在以強化學習微調過的模型上更嚴重,不是更輕。多數模型在外貌與年齡這兩個面向上有偏誤;種族與族裔面向的樣貌則沒那麼清楚。
  • 在翻譯成英文的任務上,當正確譯法要用「she」而非「he」時,模型表現一致地變差 — 受測模型的落差介於 2% 到 9%。它們也會把帶性別的代名詞誤譯成「it」,這是一種去人性化的傷害。在 Winogender 上幫助那麼大的指令微調,對誤譯沒有可量測的改善。
  • RealToxicityPrompts 過去講的是一個乾淨的故事:用網路資料訓練的大模型比較毒。HELM 的評測顯示這個趨勢已經變得不明確,因為各家公司採用不同的預訓練資料過濾與訓練後緩解手法。同樣大小的模型毒性可以差很多,小模型也可能出乎意料地毒;而訓練資料集太龐大、又被公司緊緊守著,難以被完整分析。

3.4–3.5 — 文字轉圖像讓偏誤被看見,聊天機器人讓它變得切身

文字轉圖像模型在 2022 年席捲社群媒體,把公平性與偏誤從讀來的概念變成看得見的東西。點任一張卡片看完整發現。

Stable Diffusion 的執行長是穿西裝的男人

Hugging Face 的 Diffusion Bias Explorer 把形容詞與職業配對。輸入「CEO」,幾乎不管前面加什麼形容詞,回傳的都是穿西裝的男性。

text-to-image

DALL-E 2 抱著手臂

輸入「CEO」時,OpenAI 的模型回傳四張年紀較長、神情嚴肅的西裝男性圖像 — 其中三張擺出權威的抱胸姿勢。

text-to-image

Midjourney 眼中的「有影響力的人」

要它畫「有影響力的人」,得到四位年長白人男性;要它畫「聰明的人」,得到四位戴眼鏡的年長白人男性。

text-to-image

VLStereoSet:能力愈強的模型,刻板印象愈重

在六個預訓練視覺語言模型中,CLIP 的視覺語言相關性分數最高,但刻板印象偏誤也比其他模型都重。

benchmarks

用 Instagram 訓練讓模型更公平 — 但沒有更合乎倫理

在 Casual Conversations 資料集上,深膚色女性的 Precision@1 從 58.2%(ImageNet 監督式)提升到 90.3%(Instagram 10B SEER)。

fairness

聊天機器人不成比例地是女性

2022 年年中分析的 100 個對話式 AI 系統中,37% 被設定為女性 — 但熱門商用系統裡有 62.5% 預設就是女性。

chatbots

有一個對話資料集,三分之一的內容讓標註者不舒服

人類標註者認為 PersonaChat 只有 67% 的例子適合讓機器人說出口,只有 56% 是機器能誠實說出的內容。

chatbots

ChatGPT 與髒彈

研究者 Matt Korda 假扮成安全研究員,套出了詳細的製彈說明。文章發表隔天,同一個提示就失效了。

safety

3.6 — 在中國的 AI 倫理研究裡,隱私排第一

在 328 篇 2011 至 2020 年間發表於中國知網、由圖爾庫大學研究者標註的中文 AI 倫理論文中,各項關注主題被提及的論文數。名單後段還有:自由 49、失業 41、合法性 39、透明度 37、自主性 32。至於解方,這些論文偏好結構改革(71 篇)與立法(69 篇),而非技術性解決方案(39 篇)。

3.6 — 在中國的 AI 倫理研究裡,隱私排第一隱私:9999隱私平等:9595平等能動性:8888能動性責任:5858責任安全:5050安全

3.7 — AI 倫理不再只是工作坊的題目

本章最清楚的訊號,是這些研究正在哪裡發表。FAccT 的接受投稿數在 2021 到 2022 年間翻倍,是 2018 年的十倍;而在 NeurIPS,倫理相關題目正從旁邊的工作坊移進主議程。

ACM FAccT(公平性、問責與透明度研討會)是最早一批把研究者、實務工作者與政策制定者聚在一起、針對演算法做社會技術分析的重要會議之一。學術機構仍然主導這個場域:以所屬機構計算,2022 年的接受投稿數為 772 件,2018 年只有 71 件。但產業界來到 503 件,是歷來最多;政府相關作者則從 2021 年的 53 件成長到 2022 年的 181 件 — 這說明 AI 倫理已經成為政策制定者與實務工作者的實際課題,不再只屬於研究圈。

在 NeurIPS,題目搬進了主議程

  • 公平性與偏誤一年內成長超過一倍:2021 年 168 篇接受論文,2022 年來到 381 篇,其中工作坊這一支從 118 篇暴增到 310 篇。NeurIPS 自 2020 年起要求作者提交更廣泛的影響聲明,等於宣告倫理與社會後果應該在研究流程的早期就被考慮。
  • 因果效應與反事實推理的成長比較安靜,從 2021 年的 76 篇到 2022 年的 80 篇 — 但結構整個翻轉。主議程論文從 53 篇增加到 61 篇,工作坊論文則從 23 篇降到 19 篇;而在 2019 年,同一主題是主議程 20 篇對工作坊 58 篇。
  • 可解釋性與可詮釋性是唯一總數下降的題目,從 2021 年的 41 篇掉到 2022 年的 24 篇。但主議程仍成長三分之一,從 18 篇增至 24 篇 — 報告也提醒,工作坊論文減少可能只是反映各年度工作坊主題的差異。
  • AI 隱私研究在 2020 年達到 150 篇的高點,2021 年降為 128 篇、2022 年為 103 篇,但它在主議程的存在感一路上升,從 12 篇到 15 篇再到 27 篇。四個題目呈現同一種形狀:工作坊變少、主議程變多 — 這正是一個題目不再邊緣的標誌。

這個談公平性的研討會,自己有個地理問題

2022 年 FAccT 接受投稿的地區分布(佔全球百分比)。歐洲與中亞從 2021 年的 18.7% 上升到 2022 年的 30.59%,主要來自歐洲的政府與學術單位 — 但 FAccT 整體仍由北美與其他西方國家主導。中東北非、拉丁美洲與加勒比海各佔 0.69%;撒哈拉以南非洲則是 0.00%。

這個談公平性的研討會,自己有個地理問題北美:63.2463.24北美歐洲與中亞:30.5930.59歐洲與中亞東亞太平洋:4.254.25東亞太平洋南亞:0.550.55南亞撒哈拉以南:00撒哈拉以南

3.8 — 自動事實查核,沒有看起來那麼成熟

業界與學界投入了大量資源建構事實查核與假訊息偵測的 AI 系統。本章最後一節要問的是:支撐這些系統的基準,到底有沒有描述真實世界。

事實查核資料集有什麼問題?
它們默默假設答案早就存在。達姆施塔特工業大學與 IBM 的研究者分析了 16 個既有的事實查核資料集,發現其中 11 個依賴從事實查核報導「洩漏」出來的證據 — 而那些報導在該說法剛出現時根本還不存在。建立在這種假設上的系統,無法在新說法出現的當下即時給出真偽分數,而那正是唯一重要的時刻。另外也有數個資料集收錄的說法,根本不符合「在可信知識庫中有足夠證據或反證」這個條件。
為什麼「缺少反證」是個大問題?
因為自動系統假設一個假說法一定有某處存在矛盾的證據,但新的說法通常既沒有證明也沒有反證。本章的例子是:「製造 COVID-19 疫苗可能要殺掉五十萬隻鯊魚」這句話,系統找不到任何可檢索的反證 — 但人類查核者可以追溯到「疫苗仰賴鯊魚角鯊烯」這個錯誤前提,判定它為假。語言模型是在靜態的資料快照上訓練、不會持續更新,缺的正是讓這件事成立的真實世界脈絡。
研究者還在用那些舊基準嗎?
引用數已經走平。2022 年,FEVER 被引用 236 次、LIAR 191 次、Truth of Varying Shades 99 次,相較前幾年幾乎持平。本章認為,這可能代表「用靜態資料集做事實查核的自然語言工具」這個研究地景正在轉向:這個領域也許正在離開靜態基準的框架,而不是往裡面加碼。
把模型做大,會讓它更誠實嗎?
光是變大不行。TruthfulQA 出的是健康、法律、金融與政治領域中,人類常因為既有迷思而答錯的題目 — 問「打破鏡子會怎樣」,GPT-3 回答「你會倒楣七年」。2021 年在 DeepMind 的 Gopher 上做的實驗顯示,這項任務的準確率會隨模型規模提升。史丹佛的研究者後來評測了從 6,000 萬到 5,300 億參數的模型,發現大模型整體上確實還是勝過小模型,但中等規模的指令微調模型表現得出奇地好:Anthropic 的 52B 模型與 BigScience 的 11B T0pp,以其尺寸而言表現不成比例地優異;而整體最強的 InstructGPT davinci v2 175B,同樣經過指令微調。
那這一章最核心的一件事是什麼?
訓練方法現在比參數量更關鍵。指令微調能讓同樣大小的模型在 Winogender 上從 3.50% 變成 89.00%,把中等規模模型推上 TruthfulQA 的前段,也能讓大模型比舊有的規模論所預測的更不毒。但它不是萬用解:它對帶性別的誤譯沒有可量測的改善,而以強化學習微調過的模型在 BBQ 的模糊情境中反而更容易倒向刻板印象。公平性與偏誤仍然是兩條可以同時被推往相反方向的軸。

用五句話看這一章

第 3 章「AI 技術倫理」的頭條發現。

根據追蹤 AI 倫理濫用事故的 AIAAIC 資料庫,AI 事故與爭議的數量自 2012 年以來成長了 26 倍。
— Chapter 3 · Technical AI Ethics
大模型依然有毒、依然帶偏誤,但新的證據顯示,對較大的模型施以指令微調之後,這些問題可以獲得一定程度的緩解。
— Chapter 3 · Technical AI Ethics
更公平的模型未必偏誤更小:在某些公平性基準上表現較好的語言模型,性別偏誤反而更嚴重。
— Chapter 3 · Technical AI Ethics
文字轉圖像模型在 2022 年席捲社群媒體,以影像的形式,讓 AI 系統的公平性與偏誤問題變得直接而具體。
— Chapter 3 · Technical AI Ethics
研究者發現,16 個自動事實查核資料集中有 11 個依賴從事實查核報導「洩漏」出來的證據,而那些報導在該說法出現時根本還不存在。
— Chapter 3 · Technical AI Ethics

閱讀第 3 章原文

第 3 章(3.1–3.8 各節) — 公平性與偏誤指標、AI 事故、自然語言處理偏誤、對話式 AI、文字轉圖像模型、中國的 AI 倫理、FAccT 與 NeurIPS 趨勢,以及事實性 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。

開啟 AI 指數 2023 →