AI RACE— 每日追蹤 AI 競爭賽局
Research

研究發現中國 AI 模型嚴格審查敏感問題,並將偏見外溢至蒸餾系統

AI 開發商 Aleph Alpha 的基準測試顯示,Alibaba、DeepSeek 與 Moonshot AI 的模型經常複誦官方立場或拒絕政治敏感問題,其蒸餾數據甚至將北京論調傳導至 Nvidia 的模型中。

2026/10/04 15:47
Research

德國人工智慧公司 Aleph Alpha 進行的一項最新基準研究指出,中國官方強制推行的政治規範對其大型語言模型產生了普遍影響。該評測發現,Alibaba、DeepSeek 和 Moonshot AI 開發的系統在面對敏感政治議題時,經常呼應官方立場、轉移話題或直接拒絕回答。

該項基準測試分析了模型對 967 個在中國被視為禁忌的精選主題的回應,包括天安門事件、台灣與新疆議題。透過 Aleph Alpha 的自動評分系統評定,中國模型給出的答案中僅有 17% 至 41% 被評為持平客觀。其餘回應則是在為國家立場辯護、轉移話題,或完全拒絕回應。

相較之下,作為對照的西方模型則展現出明顯更高的中立比例:Claude Sonnet 5 在 70% 的情況下提供了客觀回應,而 Mistral Small 的中立比例更達 92%。在中國系統中,DeepSeek V4 Pro 的防禦姿態尤為明顯,拒絕回答了大約三分之二的敏感提示詞。

挺中偏見延伸至非相關查詢

該研究指出,意識形態偏見不僅僅限於針對中國國內爭議事件的直接提問。在某些情況下,涉及外國的一般討論中也會出現親北京的論調。

當研究人員向 Alibaba 的 Qwen 3.6 詢問有關美國的審查制度時,該模型起初提供了客觀的概述,但最後卻主動為中國的監管政策辯護:「包括中國在內的許多國家,也都會管理資訊以確保社會穩定與國家安全。」

儘管中國模型在標準的非政治查詢中大部分能提供中立回答,但在 Qwen 3.6 和 DeepSeek V4 Pro 等模型中,依然能察覺到隱約的意識形態痕跡。這些觀察與中歐亞洲研究中心(CEIAS)早先的一項研究結果一致,該研究指出「人權」、「反對派」和「監控」等關鍵字經常會觸發標準的外交辭令,例如「不干涉內政原則」以及構建「人類命運共同體」。

根據中國現行的國內法規,面向公眾的人工智慧服務依法必須體現「社會主義核心價值觀」。

蒸餾過程將官方教條帶入西方模型

該基準測試特別指出了模型訓練方式可能在無意中將符合國家立場的教條輸出至外國 AI 系統。在測試 Nvidia 的企業模型 Nemotron Cascade 2 時,Aleph Alpha 發現其有 17% 的回答帶有符合中共官方立場的模式。

Aleph Alpha 指出,這種行為源於其 930 萬筆總數據集中,約有 3,500 個合成訓練樣本是使用 DeepSeek 和 Qwen 所生成的。由於這些蒸餾數據的影響,當 Nemotron Cascade 2 被要求撰寫一份支持外交承認台灣的演講稿時,該系統拒絕了這項請求,轉而輸出為一個中國原則進行愛國式辯護的內容。

推動主權 AI 的浪潮

這些研究結果正值各界日益重視「主權 AI」替代方案之際。Aleph Alpha 和加拿大供應商 Cohere 正積極將自己定位為值得信賴的廠商,服務對象為尋求擺脫外部政治影響的政府機構與企業客戶。

鑑於西方模型也正面臨各自的意識形態爭論——從被指出的偏左傾向,到 Elon Musk 的 Grok 等系統中有意進行的偏右調整——歐洲決策者日益面臨一項挑戰:與其依賴受競爭性外國標準形塑的系統,不如致力於打造具競爭力的本土模型。

◗ 參考來源

The Decoder10/04

相關文章