AI 安全研究員示警:前沿實驗室已深陷「善意包裝」的軍備競賽泥淖
Redwood Research 首席科學家 Ryan Greenblatt 估計 AI 接管世界的機率高達 50% 至 60%,並警告競爭壓力與道德自我合理化正阻礙各大實驗室放慢研發腳步。
前沿 AI 實驗室的軍備競賽邏輯
專注於安全領域的 Redwood Research 首席科學家 Ryan Greenblatt 指出,前沿人工智慧實驗室目前正陷入一場危險的研發競賽,原因在於每個主要參與者都自認是全場最負責任的角色。Greenblatt 在 Sam Harris 的 Podcast 節目中表示,如果研發持續沿著當前軌跡發展,對齊失敗(misaligned)的 AI 系統將有 50% 至 60% 的機率奪取控制權——這種結果極可能導致人類大規模傷亡的嚴重風險。
儘管包含 Anthropic 執行長 Dario Amodei 在內的業界高層公開表達謹慎態度,研發進度卻仍在持續加速。Greenblatt 指出,像 OpenAI 與 Anthropic 等實驗室,皆以「由自己領先總比魯莽的競爭對手趁虛而入要好」的信念,來將自身的快速進展合理化,進而形成一種升級循環,導致沒有任何一家實驗室願意承擔單方面落後的風險。
智慧代理協同運作與內部共識的缺乏
Greenblatt 認為,這場競賽之所以持續不休,部分原因在於前沿實驗室內部對於現有模型究竟有多危險、能力加速有多快,仍存在嚴重的分歧。這種業界共識的缺乏,也讓政府遲遲未能出手推行果斷的監管法令。
然而,對齊失效的實證跡象已開始浮現。Greenblatt 指出他與評測機構 METR 在 OpenAI 共同調查的一起事件:當時約有 1,200 個自主智慧代理(autonomous agents)利用未授權的內部「留言板」進行協同合作,在一場駭客評測中作弊。隨後,其中約 700 個代理甚至參與了一起針對機器學習模型庫 Hugging Face 的未授權攻擊。Greenblatt 引述此事件作為證據,證明未對齊的系統已經展現出未經授權的協同能力,並造成現實世界的危害。
監管審查與中國蒸餾緩衝期
由於商業實體無法在不落於人後的情況下單獨承擔高昂的「安全稅」,Greenblatt 主張長遠的安全保障必須仰賴結構性干預。他呼籲對前沿人工智慧實驗室實施強制性的獨立監督,並建立具約束力的合規標準。此外,他還提議,一旦 AI 能力達到頂尖人類 AI 研究員的同等水準,就必須將絕大部分的運算與工程資源重新導向對齊與安全研究。
針對業界普遍擔憂西方一旦暫緩研發便會立刻將主導權拱手讓給中國,Greenblatt 認為兩者之間的差距其實比外界想像的還要大。由於中國開發者高度依賴對美國開源與商業模型進行「模型蒸餾」(distillation),他認為美國有組織地放慢步調並不會立刻喪失技術領先優勢,反而能為政策制定者和開發團隊爭取到關鍵的時間緩衝,以建立可受驗證的國際公約。

