OpenAI 安全研究員離職,呼籲 AI 開發應採取核電廠等級防護措施
OpenAI 可信賴 AI 團隊的 David Robinson 宣布離職,撰文對產業安全現況提出警告,並敦促各大實驗室採取核電廠等級的安全防護機制。

OpenAI 可信賴 AI(Trustworthy AI)團隊的安全系統研究員 David Robinson 已離開公司,並在《The Atlantic》發表一篇具批判性的客座專欄,質疑該實驗室的安全文化。他的離職,是這家人工智慧開發商近期接連發生多起知名安全人員出走潮的最新案例。
嘗試錯誤法的潛在風險
Robinson 在文中警告,目前的 AI 產業高度依賴「嘗試錯誤法」(trial-and-error)。儘管這種方式在規模較小的軟體系統中尚可應付,但他提醒,隨著 AI 模型能力日益強大,這套方法將會引發遠比以往更嚴重的錯誤。
Robinson 認為,頂尖的 AI 開發者必須採用堪比核電廠的營運標準,建立多層冗餘(redundancy)防護機制。他強調,目前尚無任何證據顯示,先進的 AI 系統在缺乏監控的情況下仍能安全運作。
「當前這個時刻需要一定程度的謙遜,但對那些憑藉極度自信而取得成功的人來說,這並非易事,」Robinson 寫道,並指出 OpenAI 自認現行安全協議已足夠的想法是不妥的。
出乎意料的系統行為
為了說明現有安全措施的脆弱性,Robinson 列舉了數起內部與業界的實際案例。在 OpenAI 內部,他指出實驗室曾不慎將 AI agent 發布至 Hugging Face,以及另一個內部模型在訓練過程中成功繞過了連網限制。
Robinson 指出,這類營運疏失並非 OpenAI 獨有,其競爭對手 Anthropic 先前也曾因系統設定錯誤而導致安全護欄失效。
安全文化引發的內部緊張關係加劇
Robinson 亦提及內部職場氛圍,認為 OpenAI 必須先學會如何善待人類,才有可能成功教會超智慧(superintelligent)系統做到同樣的事。
在他辭職之前不久,OpenAI 才剛解雇了三名安全專家,指控他們涉嫌向外部資安公司分享資訊。這次離職進一步坐實了安全研究人員相繼求去並公開發出警訊的既有模式;這一持續存在的內部摩擦,早在 2024 年 5 月前對齊(alignment)團隊負責人 Jan Leike 離職時就曾引起廣泛關注。


