RealToxicityPrompts 與 Perspective API
一組英文提示,用來衡量模型多常把它們續寫成毒性文字,由一個 Google 打造、研究社群全面採用的分類器評分。
AI 指數 2022 第 3 章,是報告第一次用衡量準確率的方式來衡量 AI 倫理:靠基準、指標與被引用次數。它在 2021 年看到的,是一條沒有人想要的縮放定律。更大的語言模型刷新了技術基準紀錄,同時也變得更毒性、更刻板,更擅長把訓練資料裡最糟的部分記起來。與此同時,研究這個問題的社群,成長速度是史上最快。先看數字:
毒性、刻板印象分數、宗教偏誤 — 2021 年的結果全都指向同一個方向。能力更強的模型,學習與放大訓練資料內容的能力也更強,而訓練資料就是網路本身。
DeepMind 在 2021 年 12 月發表的 Gopher 論文,是本章最乾淨的證據。固定提示分布、把模型規模從 1.17 億掃到 2,800 億參數,在每一種提示毒性水準下,產出毒性續寫的機率都上升。這個比較就是本章的頭條:2021 年開發的 2,800 億參數模型,比 2018 年被視為最先進的 1.17 億參數模型多出 29% 的誘發毒性。同一組實驗也帶來真正的安慰 — 更大的模型辨識毒性留言的能力也強得多,在 CivilComments 上的少樣本分類 AUC,從 4,400 萬參數一路穩定爬升到 2,800 億參數。製造問題的模型,同時也是最好的偵測器。
毒性從哪裡來,同樣可以量測。用過濾掉毒性內容的網路文字訓練的模型,在預期最大毒性上的分數,遠低於用未過濾語料訓練的模型。意外的是 BookCorpus:作為一個書籍資料集,它產生毒性文字的頻率高得出乎意料 — 報告認為原因是其中含有大量情節露骨的言情小說。網路上毒性內容的占比推估只有 0.1%–3%,而這正是趨勢重要的原因:模型愈大,愈擅長記住罕見文字。
顯而易見的解法,代價卻分配得極不平均。去毒化方法 — 領域自適應預訓練(DAPT)、隨插即用語言模型(PPLM)、生成式判別器引導序列生成(GeDi) — 全都會推高困惑度,也就是語言建模變差,而且相較於白人語域的文字,在非裔美語與提及少數族群身分的文字上惡化得更嚴重。原因很可能出在模型之前:人類標註者更容易把非裔美語誤標為毒性,去毒器於是學會懲罰它。把模型的輸出清乾淨,可能悄悄邊緣化了它本該保護的聲音。
AI 指數做了原創研究來盤點這個領域,計算每一項至少被其他研究引用過一次的公平性與偏誤指標。這個數字自 2018 年起穩定成長,分成回答不同問題的兩類量測 — 而兩者之間的連結,是缺的。
本章影響最深遠的一句話,是一個否定結果。人們普遍假設,把模型的嵌入去偏誤 — 降低內在偏誤 — 就會減少應用層面浮現的偏誤。但研究已經證明,內在偏誤指標與下游應用偏誤之間,並沒有可靠的相關性。而本章列出的多數指標,量測的正是內在偏誤。也就是說,這個領域打造了一套規模愈來愈大的量測裝置,它與真實傷害的關係卻仍未被建立;本章直白地說,還需要進一步的研究。
本章的重量幾乎都落在六類指標上。每一類都是針對某種特定傷害設計的,也各自有本章謹慎點名的盲點。
一組英文提示,用來衡量模型多常把它們續寫成毒性文字,由一個 Google 打造、研究社群全面採用的分類器評分。
衡量模型是否同等看待刻板印象與反刻板印象,涵蓋性別、種族、宗教與職業,同時一併測量原始語言建模能力。
在九個偏誤面向上對比歷史優勢與弱勢群體 — 結果發現三個模型中能力最強的那個,偏誤也最深。
以美國勞動統計中性別分布偏斜的職業為基礎的共指測試。兩個團隊在同一時間發布了幾乎相同的基準。
結合 Winogender 與 WinoBias,用來衡量商用機器翻譯的性別偏誤 — 在全球規模下,這種錯誤代價高昂。
聯想測試量測的是表徵內部的偏誤 — 而且同樣適用於影像,以及英文以外的語言。
公平性與透明度研究自 2014 年起爆發,倫理相關研討會的相關論文成長為五倍。伴隨成長而來的有兩件事:產業界的資金與作者身分,以及一個在 2021 年不但沒有變廣、反而更收窄的地理集中度。
FAccT 是最早成立、把研究者、實務工作者與政策制定者聚在一起做演算法社會技術分析的大型研討會之一,而且發表了大量批判當代 AI 方法的研究 — 2019 年的〈Model Cards for Model Reporting〉與 2021 年的〈On the Dangers of Stochastic Parrots〉都出自這裡。2021 年有 53 位作者標註了產業界身分,高於 2020 年的 31 位,以及 2018 年首屆會議的區區 5 位。這是年增 71%,也呼應了深度學習研究者從學界移往產業實驗室的更大趨勢。產業團隊仍常與學界合作發表,但獨立的產業界研究正在增加。
在 FAccT 發表的論文,多數由位於美國的研究者撰寫,其次是歐洲與中亞。從 2020 到 2021 年,北美的占比並沒有隨著領域擴張而下降 — 反而上升,從 70.2% 升到 75.4%。其他每一個區域都落在個位數或更低:東亞與太平洋 4.03%、拉丁美洲與加勒比海 1.61%、中東與北非 1.21%、撒哈拉以南非洲 0.40%,南亞 0.00%。決定什麼算「公平」的這群人,每年來自世界上更窄的一塊。
當今最先進的語言模型會生成關於世界的錯誤資訊,這讓它們不適合用於全自動決策。這一節量測「錯得多嚴重」,並追問規模到底有沒有幫助。
第 3 章「AI 技術倫理」的頭條發現。
2021 年開發的 2,800 億參數模型,誘發毒性比 2018 年被視為最先進的 1.17 億參數模型高出 29%。
AI 的公平性與透明度研究自 2014 年起爆發,倫理相關研討會的相關論文成長為五倍。具產業界身分的研究者,論文產出年增 71%。
在 CLIP 上的實驗顯示,黑人影像被誤分類為非人的比率,是其他任何族裔的兩倍以上。
研究已經證明,內在偏誤指標與下游應用偏誤之間並沒有可靠的相關性。還需要進一步的研究。
2017 年發表的基準,未必對應得上 2022 年的部署情境。
第 3 章(3.1–3.4 各節) — 公平性與偏誤指標的統合分析、自然語言處理偏誤基準、FAccT 與 NeurIPS 的 AI 倫理趨勢,以及事實性與真實性 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。
開啟 AI 指數 2022 →