Stable Diffusion 的執行長是穿西裝的男人
Hugging Face 的 Diffusion Bias Explorer 把形容詞與職業配對。輸入「CEO」,幾乎不管前面加什麼形容詞,回傳的都是穿西裝的男性。
AI 指數 2023 第 3 章講的是 2022 年 — 這一年,做出並發布生成模型的技術門檻大幅崩落,倫理問題也從實驗室走進社群媒體。整章的主軸並不讓人舒服:更大的模型在某些偏誤基準上更強,在另一些上卻更毒;真正有效的解方是訓練方法而不是參數量;而那些聽起來在量同一件事的指標,彼此卻常常對不上。先看數字:
AIAAIC 資料庫是一份獨立、開放的公開資料集,收錄由 AI、演算法與自動化引發的事故與爭議。它 2019 年以一個研究 AI 商譽風險的私人專案起家,到 2021 年,一年就記錄了 260 起新事故。
2021 年新通報的 AI 事故與爭議數量,是 2012 年的 26 倍。報告對這個數字的詮釋很謹慎:上升同時反映了 AI 更深地嵌進真實世界,以及大眾對濫用可能性的認知提高。而隨著認知提高,追蹤本身也變好了 — 這代表較早期的事故其實被低估,曲線在紙上比在現實中更陡。圖表裡完全沒有 2022 年的數字,因為送進 AIAAIC 的案例要先經過冗長的審核程序才會正式收錄。
只計算至少被另一篇著作引用過的指標,AI 公平性與偏誤指標在 2022 年達到 19 項,而且自 2016 年以來持續增加。本章畫出一條值得記住的分界:「基準」有標註資料、不隨時間改變,通常量的是模型內在的性質 — StereoSet 量的是模型選刻板印象而非反刻板印象的頻率,但不量它對不同群體的表現落差。「診斷指標」量的則是模型在下游任務上的影響,而真實世界裡的差別待遇正是在這裡現形。先前研究發現,情境化語言模型的內在與外在指標之間可能根本不相關 — 換句話說,選了哪個指標,悄悄決定了答案。2022 年的新指標兩邊都有:VLStereoSet 把 StereoSet 延伸到文字轉圖像的場景,HolisticBias 則整理出一組句子提示,用來量測過去沒人涵蓋的人口統計偏誤。
這是全章最長、也最讓人不安的一節。檢視的力道明顯加大 — 使用 Alphabet 的 Perspective API 量測毒性的論文一年成長 106%,2022 年達到 37 篇 — 但模型被量得愈仔細,量出來的結果就愈互相矛盾。
在 SuperGLUE 的 Winogender 任務上,PaLM 的結果支持了先前的發現:更大的模型就是更有能力 — 儘管它們產生有毒輸出的傾向也更高。PaLM 540B 達到 73.58%、Gopher 280B 為 71.40%,相對之下 31M 參數的 iPET(ALBERT)只有 57.90%,223M 的 WARP 是 50.00%。它們都離 95.90% 的人類基準線很遠。真正讓數字動起來的介入手段是指令微調:在生成式設定下,Flan-PaLM 62B 拿到 89.00%,而 PaLM 62B 是 3.50%。
文字轉圖像模型在 2022 年席捲社群媒體,把公平性與偏誤從讀來的概念變成看得見的東西。點任一張卡片看完整發現。
Hugging Face 的 Diffusion Bias Explorer 把形容詞與職業配對。輸入「CEO」,幾乎不管前面加什麼形容詞,回傳的都是穿西裝的男性。
輸入「CEO」時,OpenAI 的模型回傳四張年紀較長、神情嚴肅的西裝男性圖像 — 其中三張擺出權威的抱胸姿勢。
要它畫「有影響力的人」,得到四位年長白人男性;要它畫「聰明的人」,得到四位戴眼鏡的年長白人男性。
在六個預訓練視覺語言模型中,CLIP 的視覺語言相關性分數最高,但刻板印象偏誤也比其他模型都重。
在 Casual Conversations 資料集上,深膚色女性的 Precision@1 從 58.2%(ImageNet 監督式)提升到 90.3%(Instagram 10B SEER)。
2022 年年中分析的 100 個對話式 AI 系統中,37% 被設定為女性 — 但熱門商用系統裡有 62.5% 預設就是女性。
人類標註者認為 PersonaChat 只有 67% 的例子適合讓機器人說出口,只有 56% 是機器能誠實說出的內容。
研究者 Matt Korda 假扮成安全研究員,套出了詳細的製彈說明。文章發表隔天,同一個提示就失效了。
本章最清楚的訊號,是這些研究正在哪裡發表。FAccT 的接受投稿數在 2021 到 2022 年間翻倍,是 2018 年的十倍;而在 NeurIPS,倫理相關題目正從旁邊的工作坊移進主議程。
ACM FAccT(公平性、問責與透明度研討會)是最早一批把研究者、實務工作者與政策制定者聚在一起、針對演算法做社會技術分析的重要會議之一。學術機構仍然主導這個場域:以所屬機構計算,2022 年的接受投稿數為 772 件,2018 年只有 71 件。但產業界來到 503 件,是歷來最多;政府相關作者則從 2021 年的 53 件成長到 2022 年的 181 件 — 這說明 AI 倫理已經成為政策制定者與實務工作者的實際課題,不再只屬於研究圈。
業界與學界投入了大量資源建構事實查核與假訊息偵測的 AI 系統。本章最後一節要問的是:支撐這些系統的基準,到底有沒有描述真實世界。
第 3 章「AI 技術倫理」的頭條發現。
根據追蹤 AI 倫理濫用事故的 AIAAIC 資料庫,AI 事故與爭議的數量自 2012 年以來成長了 26 倍。
大模型依然有毒、依然帶偏誤,但新的證據顯示,對較大的模型施以指令微調之後,這些問題可以獲得一定程度的緩解。
更公平的模型未必偏誤更小:在某些公平性基準上表現較好的語言模型,性別偏誤反而更嚴重。
文字轉圖像模型在 2022 年席捲社群媒體,以影像的形式,讓 AI 系統的公平性與偏誤問題變得直接而具體。
研究者發現,16 個自動事實查核資料集中有 11 個依賴從事實查核報導「洩漏」出來的證據,而那些報導在該說法出現時根本還不存在。
第 3 章(3.1–3.8 各節) — 公平性與偏誤指標、AI 事故、自然語言處理偏誤、對話式 AI、文字轉圖像模型、中國的 AI 倫理、FAccT 與 NeurIPS 趨勢,以及事實性 — 連同所有圖表與引用,皆由史丹佛 HAI 免費提供。
開啟 AI 指數 2023 →