AI RACE— The AI Race
Research

研究:AIへのアクセスが「わからない」回答を激減させ、過信を増幅させることが判明

3,000人以上の参加者を対象に5つの実験を行った結果、言語モデルが手元にあるだけで人々は不確かさを認めることをほぼやめ、正答率は大幅に低下した。

2026/09/26 23:56
Truy cập AI làm người dùng gần như không còn nói “Tôi không biết”, nghiên cứu mới tiết lộ

1. 何が起き、誰が関わり、いつ行われたか

Matthias Bastian率いる研究チームは、2026年9月26日に3,132人のボランティアを対象とした5つの実験を実施した上で新たな知見を発表した。これらの研究は、対話型AIが単に利用可能であることが、人々の不確実性を認める意欲にどのように影響するかを検証した。

2. 主な発見と実験の詳細

  • 設計: 参加者は映画に関する細部の視覚知識を要するトリビア問題に挑んだ(例:Bend It Like Beckhamにおけるチームユニフォームの色)。主要モデルとして提供された Step 3.5 Flash は、ほぼすべての質問で誤答するよう意図的に選択され、AIへの依存度を測るストレステストとなった。他のモデル—GPT‑5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash—は容易な項目では良好な成績を示したが、最難関の問題でもつまずいた。
  • 「わからない」回答への影響: 最初の2つの実験(1a と 1b)では、参加者はAIに相談するかどうかを自由に選択できた。AIが利用できない場合、判断を保留した割合はそれぞれ 36 % と 44 % だった。AIが利用可能になると、これらの割合はそれぞれ 6 % と 3 % にまで急減した。
  • 自信と正確性の関係: Study 2では、AIが利用できる条件での自信スコア(100点満点)が 75.9 に上昇したのに対し、モデルが利用できない場合は 29.6 で、2倍以上の差となった。同時に正答率は 27.6 % からわずか 10 % に低下した。5つの実験全体を通じて、インセンティブがない状態でAIに問い合わせ可能だった参加者の正答率は 9.2 % にとどまったが、AIがブロックされた場合は 27.5 % に上昇した。
  • 金銭的インセンティブ: Study 3 と 4では、正解ごとに $0.10 の獲得、誤答ごとに $0.10 の減少、そして「わからない」には報酬なしという控えめな報酬体系を導入した。事前登録された仮説では、インセンティブが「わからない」回答を増やすと予想されたが、AI利用可否との相互作用は統計的に有意ではなかった。インセンティブはAIへの問い合わせ回数をやや抑制し、Study 3では最大6回の問い合わせ可能回数のうち平均 4.53 回に留まったが、インセンティブなしでは 5.27 回だった。インセンティブがあると正答率は僅かに向上したものの、判断保留率はAI未使用時のベースラインに比べて依然として低いままだった。
  • 自動AI提案: Study 4では、AIの回答を自動的に提示し、現代の検索エンジンや執筆支援ツールがプロンプトなしでAI生成コンテンツを表示する様相を再現した。結果は同様で、インセンティブなしの場合、判断保留率は約 35 %(AI未使用)から 1 %(自動表示AI)に低下し、インセンティブありでは約 39 % から 7 % に減少した。
  • 解釈: 著者らはこの現象を「Epistemia」と呼び、モデルに無知を認める仕組みがなくても、権威的に聞こえるAI出力を受け入れる傾向を指す。この傾向は、外部助言を保守的に評価し、助言者の立場へは約3分の1しかシフトしないという古典的な「助言利用」文献と正反対である。本研究では、参加者は逆方向にシフトし、AIに従うことで正解を誤答に変えるケースも見られた。
  • 広範な研究: 本稿は、スイスのビジネススクールが実施した666人を対象とした調査で、AI依存と批判的思考スコアが強く負の相関にあること、またMicrosoftの研究で、短時間のAI支援セッションがその後の課題における問題解決の持続性を低下させることを報告している点を引用している。いずれも、AI利用がメタ認知資源を消耗させる可能性を示唆しているが、教育水準が高いほどその影響は緩和される可能性がある。

3. 業界的背景と示唆

本研究の結果は、AI生成回答が日常ツールに組み込まれつつある時期に提示された。検索エンジンは大規模言語モデルの要約を表示し、執筆支援ツールは未要求の提案を提示するようになっている。研究者は、このような普及が不確実性を認める習慣—健全な意思決定の基盤—を蝕む恐れがあると警告している。モデル精度の向上が依然として重要課題である一方で、ユーザーが「わからない」と言える意欲を維持することも、AIがますます拡大する世界で人間の判断を保つ上で同等に重要であると主張している。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

一昨日