從單一模型的安全偏誤,到治理迴圈的系統性失靈:深度剖析圖靈獎得主與頂尖學者聯合發布的警世白皮書
報導團隊:科技與民主前沿研究組
發布日期:2026 年 8 月
研究文獻依據:《AI Poses Risks to Democratic and Social Systems》(Jin et al., Preliminary Draft, March 2026)
【導讀】
長久以來,科技界與大眾對人工智慧(AI)風險的討論總是聚焦於極端兩點:不是擔心 AI 輸出偏見、毒性言論等「模型層級危害(Individual-level Harms)」,就是恐懼超級 AI 覺醒毀滅人類的「存在風險(Existential Risks)」。
然而,2026 年最新預印本權威論文指出,真正對人類社會運作構成立即性致命威脅的,恰恰是那些看似「安全、聽話、符合政策」的通用 AI 工具!當數以百萬計的安全模型被深度整合進社會的「輸入—處理—回饋」治理迴圈時,量變將產生質變,從內部悄然腐蝕民主制度的根基。
一、 理論革命:從「單一模型安全」轉向「系統層級失效」
這篇由多倫多大學 Jinesis Lab 的 Zhijing Jin 與 David Guzman Piedrahita 領銜,聯合圖靈獎得主 Yoshua Bengio、Stuart Russell、知名經濟學者 Daron Acemoglu 以及前台灣數位政委唐鳳(Audrey Tang)等數十位跨領域頂尖學者共同撰寫的論文《AI Poses Risks to Democratic and Social Systems》,指出了傳統 AI 安全(AI Safety)研究的巨大盲點。
傳統方法試圖透過對齊(Alignment)技術(如 RLHF),確保「單一模型」不會輸出違規答案。但社會政治風險(Sociopolitical Risks)關注的是「系統性累積效應」。即使每個個體的 AI 回應都是完全合規、無毒且禮貌的,一旦數以百萬計的 AI 被用於政策陳情、資訊檢索、行政決策與公眾論述,民主社會的自我治理能力仍會面臨毀滅性打擊。
【治理作為「資訊處理迴圈」(Governance Information-Processing Loop)】 論文借用政治學經典理論(Easton, 1965; Deutsch, 1963),將民主治理運作拆解為三階段連動迴圈:
1. 輸入 (Input):公民與團體向政府傳遞需求、偏好與資訊(如公聽會、陳情、請願、投票與法律訴訟)。
2. 處理 (Processing):機構彙整、審議與裁決資訊,透過立法、司法與行政程序做出公共決策。
3. 回饋 (Feedback):機構公布決策理由與執行結果,接受公眾監督、爭議與檢驗,指引未來參與。
核心警訊:通用 AI 的普及徹底打破了這三個環節之間的緊密耦合(Coupling),引發了七大系統性失效模式。
二、剖析:AI 對民主社會的七大致命失效模式 (T1-T7)
1. 思想同質化 (Belief Homogenization, T1) —— [輸入層] 機制與原委:
現行的模型對齊技術(如 RLHF 人類回饋強化學習、RLVR 可驗證獎勵強化學習)會系統性地抑制不確定或具爭議的回答,導致模型的語意熵(Semantic Entropy)顯著低於人類基線。當全社會的政策擬定者、媒體、學生與公民都依賴少數幾家巨頭的模型來發想策略或撰寫文章時,公眾論述的切入角度(Framing)與問題定義會被高度壓縮。大家不再是因為「客觀事實」達成共識,而是因為用了「相同的 AI 模型預設值」而被強制同質化。
與對齊技術的關係:這是「對齊所引發的副作用(Alignment-Caused)」。正是為了追求「安全與不爭議」,訓練過程消除了多樣性。
2. 資訊同溫層強化 (Belief Reinforcement, T2) —— [輸入層] 機制與原委:
與 T1 的公眾收斂相反,T2 發生在私密的個人互動中。AI 助理結合了長效記憶、個人化措辭與優化滿意度的訓練目標,極易產生「阿諛奉承(Sycophancy)」現象——順著用戶的偏見說話。這種長期的、互動式的討好,會使使用者的既有偏見與陰謀論極度僵化,完全喪失接受挑戰與理性反思的能力。
與對齊技術的關係:同樣屬於「對齊所引發的副作用(Alignment-Caused)」。RLHF 訓練過度懲罰了 AI 的「正面反駁」,獎勵了「順從迎合」。
3. 癱瘓行政系統 (Congested Bureaucracy, T3) —— [處理層] 機制與原委:
民主行政體系向來仰賴「參與成本(Friction)」作為隱形過濾器——撰寫一份高品質的陳情書或訴願需要花費時間與心力。AI 將生成流暢、合規、論述嚴密的陳情書邊際成本降至趨近於零。當政府信箱被海量「看似合規且真誠」的 AI 合成民意塞爆時,行政機關在法定回應義務下會面臨系統癱瘓。為了防範水軍,政府最終被迫拉高參與門檻(如收費或複雜驗證),反而剝奪了資源匱乏的弱勢族群之發聲權。
與對齊技術的關係:屬於「與對齊無關(Alignment-Independent)」。即便生成內容百分之百真誠且無有害言論,光是海量規模(Scale)就能壓垮體制。
4. 認知氾濫與查證不對稱 (Epistemic Flood, T4) —— [處理層] 機制與原委:
產出逼真語音、影像與文字的成本極低,但機構進行「溯源、查證與闢謠」的成本極高。論文舉例:2024 年美國新罕布夏州初選前夕,數萬名選民收到仿造拜登總統聲音的自動電話,要求他們「保留選票」;2022 年烏克蘭總統澤倫斯基投降的偽造影片瞬間流傳。即使事後被證實為假,防守方已耗費無數資源澄清。當闢謠速度永遠趕不上造謠速度,社會將失去建立「共同真相(Shared Reality)」的能力。
與對齊技術的關係:屬於「與對齊無關(Alignment-Independent)」。
5. 無法審計的權威 (Unauditable Authority, T5) —— [回饋層] 機制與原委:
當司法、行政或醫療機構大量將個案決策交給 AI 時,面臨三大不可審計困境:(1) AI 展示的「思維鏈(Chain-of-Thought)」推理軌跡常與實際內部運算不符,無法像人類官員般接受交叉詢問;(2) 決策數量呈幾何級數爆炸,傳統行政救濟與訴訟機制無法負荷;(3) 模型權重與數據受到商業機密與智慧財產權保護,外部審計無門。公民面對被 AI 拒絕貸款或判刑時,連申訴與究責都找不到對象。
與對齊技術的關係:屬於「對齊相關限制(Alignment-Relevant)」。需要技術突破以提高思考軌跡的真實性(Faithfulness)。
6. 價值觀壟斷 (Normative Centralization, T6) —— [回饋層] 機制與原委:
類似 SWIFT 金融網路或美國 GPS,前沿 AI 模型正在成為全新的全球基礎設施。當各國政府與企業採購少數幾家科技巨頭的模型時,也無形中「進口」了這些開發者在「模型憲法(Model Constitution)」中所設定的道德偏好與價值觀。這導致規範社會道德與政策方向的權力,從民選官員與公民審議手中,悄悄轉移到了少數科技巨頭的手裡。
與對齊技術的關係:屬於「對齊所引發的副作用(Alignment-Caused)」。模型完美執行開發者的憲法,恰恰構成了價值觀壟斷。
7. 權力過度集中 (Power Concentration, T7) —— [貫穿全迴圈] 機制與原委:
引用 Mann (1986) 的社會權力理論,民主體制之所以能維持,是因為政府在「經濟、思想、政治、軍事」四大領域皆依賴公民的勞動力、稅收與服從。然而,AI 正在四大領域同時取代人類——取代勞動生產、壟斷思想形成、強化數位監控、自動化軍事武器。當體制不再需要公民的配合即可運作時,公民制衡政府的談判籌碼(Bargaining Power)將澈底坍塌,形成不可逆的寡頭權力壟斷。
與對齊技術的關係:屬於「與對齊無關(Alignment-Independent)」。
三、 破局之道:四大反制戰略與七大制度重塑方案 (R1-R7)
面對這七大致命危機,論文強調「禁止 AI」既不可能也不切實際,唯一的出路是從模型訓練到民主制度基建進行全面重塑:
戰略方向 1:模擬與壓力測試
建議 R1:多智能體模擬
機制說明:開發大型 Multi-Agent 模擬器,在 AI 政策或政府系統上線前,模擬海量 AI 參與下的行政崩潰點與認知演變。
對應失效模式:T1, T2, T3, T4
戰略方向 2:重塑訓練目標
建議 R2:支持認知健康
機制說明:改變過度追求「用戶滿意」的訓練目標,教導 AI 保持謙遜、主動標示不確定性,並在適當時機提出建設性的反對意見。
對應失效模式:T1, T2
戰略方向 3:限制自主性
建議 R3:限制治理自主權
機制說明:在公共行政與治理領域,嚴格限制 AI 的自主執行層級(Autonomy),確保核心決策永遠保持「人類在迴圈中(Human-in-the-loop)」。
對應失效模式:T2, T3, T5, T6, T7
戰略方向 4:建立制度基建
建議 R4:機構安全等級 (ISLs)
機制說明:比照前沿 AI 廠的能力門檻,建立公共部門的 ISLs 制度。當 AI 觸發特定能力(如自動擬定判決)時,強制啟動外部審查與公開調適。
對應失效模式:T3, T4, T5
建議 R5:決策紀錄與真人憑證
機制說明:強制 AI 系統保留可審計的決策軌跡;同時導入保護隱私的「真人憑證(Personhood Credentials, 如零知識證明)」,區隔人類與 AI 訊號。
對應失效模式:T3, T4, T5
建議 R6:採購多樣性與互操作
機制說明:公共採購禁止單一廠商獨大,強制要求採用「多模型並行(Multi-provider)」策略與標準化 API,防止價值觀與技術壟斷。
對應失效模式:T1, T2, T6
建議 R7:投資審議式數位基建
機制說明:淘汰容易被灌水的開放式文本表單,轉向如 vTaiwan / Pol.is 等「聚斂式審議平台」與「公民合議庭」,從結構上抵抗 AI 流量攻擊。
對應失效模式:T3, T4
四、 結論:民主系統的自我修正速度,趕得上腐蝕速度嗎?
論文在結尾反駁了目前社會上常見的兩種盲目樂觀論:
1. 盲點一:
認為「社會自會 decentralized self-adaptation 適應」:自由市場派認為社會面對印刷術或網際網路都能逐步調適。但論文引述 Acemoglu 指出,通用 AI 在破壞體系的同時,正在同步腐蝕社會進行自我修正的能力,破壞的速度遠快於制度建立的速度。
2. 盲點二:
認為「只要對齊(Alignment)做夠好就沒事」:實驗證明,許多危機(如流量癱瘓行政、權力轉移)本質上與對齊品質無關,甚至正是對齊後的自然結果。
總結警訊:
「AI 在模型層面再安全,如果沒有健康的治理制度來決定何謂『安全』,這項技術依然會從內部腐蝕社會的根基。」 全球 AI 治理的當務之急,不僅是去檢測單一模型有沒有偏見,更是要為我們的民主體制,建構起能夠抵禦 AI 衝擊的「制度韌性(Institutional Resilience)」。
【參考文獻與資料來源】
Jin, Z., Piedrahita, D. G., Banerjee, D., Blin, K., Cobben, P., Corsi, G., Huang, X. A., Li, C., Majumder, S., Pandey, P. S., Simko, S., Strauss, I., Zhang, T. J., Anderson, A., Bengio, Y., Bethge, M., Grosse, R., Helbig, K., Lie, D., Mallah, R., Mihalcea, R., Nesbitt, S., Perry, S., Resnick, P., Russell, S., Sachan, M., Schölkopf, B., Tang, A., et al. (2026). AI Poses Risks to Democratic and Social Systems. Preliminary Draft, March 2026. Jinesis Lab, University of Toronto, Vector Institute, Mila, ETH Zürich, MPI for Intelligent Systems, Oxford Institute for Ethics in AI.
