AI RACE— 每日追蹤 AI 競爭賽局
Research

研究發現 AI 可取得性大幅降低「I Don’t Know」回應,同時提升過度自信

在超過 3,000 名參與者的五項實驗中,僅僅提供語言模型即使人們幾乎不再承認不確定性,卻導致答案正確率急劇下降。

2026/09/26 23:56
Truy cập AI làm người dùng gần như không còn nói “Tôi không biết”, nghiên cứu mới tiết lộ

1. 事件發生、涉及人物與時間

Matthias Bastian 領導的研究團隊於 2026 年 9 月 26 日發表新發現,該研究執行了五項實驗,總計 3,132 名志願者參與。研究探討了僅僅提供對話式 AI 的可取得性,如何影響人們承認不確定性的意願。

2. 主要發現與實驗細節

  • 設計: 參與者需回答需要細緻視覺知識的電影相關問答(例如《Bend It Like Beckham》中球隊制服的顏色)。主要提供的模型為 Step 3.5 Flash,特意選擇其在幾乎所有此類問題上皆答錯,以此作為對 AI 依賴的壓力測試。其他模型——GPT‑5.5、Claude 4.6 Sonnet 與 Gemini 3.5 Flash——在較易題目上表現良好,但在最難的題目上亦會失誤。
  • 對「I don’t know」回應的影響: 在前兩項實驗(1a 與 1b)中,參與者可自行決定是否諮詢 AI。若無 AI 可用,他們分別在 36 % 與 44 % 的題目上選擇保留判斷。當 AI 可取得時,這兩個比例分別跌至 6 % 與 3 %。
  • 信心與正確率的關係: 在 Study 2 中,信心分數(滿分 100)在有 AI 可用時躍升至 75.9,無 AI 時僅為 29.6,超過兩倍。同時,正確率從 27.6 % 降至僅 10 %。在全部五項研究中,未受激勵且可查詢 AI 的參與者正確回答率僅為 9.2 %,而 AI 被封鎖時則為 27.5 %。
  • 金錢誘因: Study 3‑4 引入了小額酬勞(每答對一題獲得 0.10 美元,答錯扣除 0.10 美元,對「I don’t know」不予獎勵)。事前註冊的假設預期誘因會促使更多「I don’t know」回應,但與 AI 可取得性的交互作用未達統計顯著。誘因略為抑制了 AI 查詢——在 Study 3 中,參與者平均在六次可能的請求中詢問 4.53 次,未受誘因時為 5.27 次。雖然有誘因時正確率略有提升,但判斷保留仍遠低於無 AI 的基線。
  • 自動 AI 建議: Study 4 自動顯示 AI 答案,模擬現代搜尋引擎與寫作助理在未經提示下呈現 AI 生成內容的方式。結果仍呈相同趨勢:在無誘因情況下,判斷保留率從約 35 %(無 AI)下降至 1 %(自動顯示 AI),有誘因時則從約 39 % 降至 7 %。
  • 詮釋: 作者將此現象稱為「Epistemia」,即因 AI 輸出聽起來具權威性而被接受的傾向,即使模型本身沒有承認無知的機制。此現象與傳統「建議使用」文獻相左,後者指出人們通常保守地權衡外部建議,僅向顧問立場移動約三分之一。而本研究中,參與者卻朝相反方向偏移,有時因跟隨 AI 而將正確答案變成錯誤。
  • 更廣泛的研究: 論文引用了相關研究,包括瑞士商學院對 666 名受訪者的調查,發現 AI 依賴度與批判性思考分數之間存在顯著負相關;以及微軟的研究指出,短暫的 AI 輔助會削弱後續任務的問題解決持續性。兩者皆暗示 AI 使用會消耗後設認知資源,儘管較高的教育程度可能緩衝此效應。

3. 產業背景與影響

隨著 AI 生成的答案逐漸嵌入日常工具——搜尋引擎已開始呈現大型語言模型的摘要,寫作助理也會主動提供建議——本研究結果應時而出。研究警告,此類無所不在的 AI 可能侵蝕承認不確定性的習慣,而這是良好決策的基石。雖然提升模型準確度仍是首要任務,作者認為維持使用者說「I don’t know」的意願,同樣關鍵,以保有人類判斷力於日益 AI 增強的世界中。

◗ 參考來源

The Decoder09/26

相關文章