AI RACE— 每日追蹤 AI 競爭賽局
Language Models

OpenAI 成功瓦解竊取模型隱藏思維鏈的惡意行動,但 Azure 仍存漏洞

OpenAI 攔截了一場動用 1.5 萬個帳號、意圖竊取其模型內部推理過程的攻擊行動,但獨立研究人員發現,數週後該攻擊在 Microsoft Azure 上依然奏效。

2026/10/01 19:05
OpenAI triệt phá chiến dịch đánh cắp chuỗi suy nghĩ của AI, nhưng lỗ hổng vẫn mở trên Azure

協同攻擊鎖定專利思維鏈技術

OpenAI 披露其瓦解了一場協同的「對抗性蒸餾」(adversarial distillation)行動,該行動旨在竊取其先進人工智慧模型的內部推理過程。雖然使用者通常只能看到模型的最終回覆,但這些隱藏的中間步驟——通常被稱為思維鏈(chains of thought)——代表著現代推理模型背後的核心智慧財產權。競爭對手可透過蒸餾技術,利用這些中間步驟訓練出更小、成本更低的模型,從而複製頂尖模型的能力,或是擷取最終輸出中被省略的資訊。

根據 OpenAI 的說法,這項擷取行動始於 7 月 1 日的少量嘗試,隨後在 7 月 24 日與 7 月 25 日急劇升級,透過 4,000 多個具有特定擷取特徵模式的使用者帳號,發出了 16,000 次請求。調查進一步揭露了一個由超過 15,000 個關聯帳號組成的龐大網路,OpenAI 已於 7 月 28 日前將這些帳號全數停用。該公司指出,這些屬於未遂的擷取企圖而非確認的資料外洩,並將該行動背後的核心團夥與中國開發 Kimi 模型的 Moonshot AI 旗下相關人員連結起來。OpenAI 表示,目前尚未證實所有追蹤到的攻擊者是否皆聽命於單一實體,但競爭對手 Anthropic 近期也透露,曾遭遇源自中國 AI 公司的類似擷取攻擊。

共用金鑰與虛擬記事本漏洞暴露內部邏輯

該行動利用了研究員 Joachim Schaeffer 及其團隊先前所詳細剖析的架構漏洞。為了在多輪對話中維持狀態,AI 平台會將內部推理的加密封包傳回給使用者,使用者隨後會在後續請求中將其送回。然而,由於這些封包在不同的工作階段、使用者以及同系列的不同模型之間共用加密金鑰,攻擊者得以攔截昂貴的前沿模型所產生的加密思維封包,並將其餵給成本較低的小型模型。接著,該小型模型便充當「解密預言機」(decryption oracle),一字不差地印出大型模型的隱藏思維內容。

開發者 Can Bölük 公開展示的第二種更簡單的漏洞,則是透過賦予模型存取虛擬記事本工具的權限,完全繞過了加密機制。當模型被指示將其推理過程寫入記事本時,模型便依言照做,讓使用者得以檢視生成的文字。研究人員發現,這種記事本手法在受測的所有 OpenAI 模型,以及 Anthropic 的 Opus 4.8 和 Sonnet 5 上均告得逞,僅在 Opus 5、Fable 5 和 Fable 5.1 上失效。OpenAI 感謝 Schaeffer 團隊促成了其快速因應,並表示隨後已清除詐欺帳號、強化帳號建立規範、限制加密權杖的重複使用,並設置輸出過濾器以攔截洩漏的推理內容,接著將情資分享給政府機構與 Frontier Model Forum。

雲端平台生態系步調延遲形成資安漏洞

修正主要 API 並未能完全消除第三方基礎設施上的漏洞。9 月 13 日,Schaeffer 團隊進行了後續測試,結果顯示儘管 OpenAI 和 Anthropic 已經修補了其直連端點,但 Microsoft Azure 依然容易受到攻擊。在 Azure 上,單一查詢就能從所有受測的 OpenAI 模型(包括新部署的 GPT-6 Astra)以及包括 Sonnet 5 在內的 Anthropic 模型中,一字不差地擷取內部推理過程。Schaeffer 在 X 上指出,完全相同的模型僅因託管的雲端環境不同,就展現出截然不同的防護水準。

研究人員批評早期的緩解措施流於表面,且過度依賴脆弱的請求模式比對,並指出 GPT-6 Astra 登陸第三方雲端平台時完全沒有任何安全防護措施。直到 9 月 27 日,Azure 上的 OpenAI 模型端點才完成安全修補,隨後 Anthropic 模型也於 9 月 28 日完成修復。Schaeffer 主張,無法部署同等安全防護層的雲端供應商應被禁止託管推理模型,並警告未修補的雲端端點實際上形同繞過 API 層級出口管制的後門。OpenAI 承認合作夥伴託管的環境必須具備與其直接基礎設施同等的安全水準,並警告隨著前沿模型的演進,模型蒸餾攻擊將變得越來越精密。

◗ 參考來源

The Decoder10/01

相關文章