AI RACE— The AI Race
Research

AI支援型モデル開発においても、人間が依然として主導権を握っていることが判明

復旦大学のチームが700件以上のタスクログを分析した結果、AIエージェントが日常的な作業の大半を担う一方で、戦略的な意思決定は圧倒的に人間が行っていることが明らかになった。

2026/09/27 22:18
Các tác nhân AI thực hiện phần lớn công việc trong phát triển mô hình, nhưng quyết định cuối vẫn do con người đưa ra

何が起き、誰が関わり、いつだったか

2026年9月27日、中国・復旦大学の研究者らは、人間参加者とAIエージェントが新しいエージェント型言語モデル「Atria Dawn Preview」の構築でどのように協働したかを検証した研究を発表した。本調査は、モデル開発パイプラインで作業した56名の参加者が生成した700件以上のタスクログを対象とした。

本研究の主な発見

  • AIの関与はほぼ全域に及ぶ:レビュー対象タスクの96.5%でAIエージェントが使用された。
  • エージェントへの依存度の増大:4週間にわたる期間で、エージェントのアクション数と人間の入力数の中央値比率が11から28.5に上昇した。これは、プロジェクトが進行するにつれて参加者がより多くの作業をエージェントに委譲したことを示す。
  • AIが可能にしたタスク:AI支援で完了した455件のタスクのうち、151件(約3分の1)はAIなしでは実現不可能と判断され、56名の参加者のうち27名が同様の認識を示した。
  • 意思決定の分担:手法やパラメータの選択においては「AIが提案し、人間が選択する」形が55.4%を占めた。手法・パラメータに関する意思決定は人間が85.5%、目標やスコープに関する最終決定は人間が93.4%を占め、AIの貢献は手法・パラメータ決定でわずか9.2%、最終選択でも一桁の割合にとどまった。
  • 問題タスクにおける人間の介入:難易度が記録された588件のタスクのうち、76%で人間が介入し、主にコンテキスト追加(35.2%)や問題診断・手法変更(34.7%)が行われた。エージェント単独で解決した難易度タスクは23%であった。完全な人間による引き継ぎは0.7%に過ぎず、部分的な編集は3.2%にとどまった。
  • フィードバックループ:人間からのフィードバックを受けた後、AIは自身の出力を75.4%のケースで修正した。これは、判断よりも実行がボトルネックであることを示唆している。
  • AI役割の進化:著者らは、AIが研究対象、タスクレベルのツール、プロジェクトパートナーという三段階を経て、現在は人間が設定した目標内で計画を草案・調整する段階にあると整理した。仮説的な第四段階として再帰的自己改善が挙げられるが、現行モデルは訓練タスクでの性能向上は可能でも、後継モデル設計においては向上しないことが指摘された。
  • ゴム押しリスク:本稿は、エージェントが長い作業チェーンを担うにつれ、人間の監視が単なる「ゴム押し」へと退化する恐れがあると警告している。特に参加者が利便性のためにエージェントを自律的に走らせる場合に顕著である。

業界の背景と関連動向

本研究結果は、再帰的自己改善を巡る激しい議論の最中に提示された。AnthropicのCEOであるダリオ・アモデイは、AI研究に速度制限を設けるべきだと呼びかけ、同社では研究方針の決定における人間の関与が一桁の割合にまで低下していると指摘した。OpenAIは開発サイクル全体でGPT‑5.6 Solを使用していると報じられ、GoogleとDeepMindはDream‑RSIなどのエージェントを用いて代替検索戦略を探索しているが、モデル自体の再設計には至っていない。最近、千人以上のAI業界従業員が、自社がAI研究の完全自動化の瀬戸際にあると警告した。プリンストン大学と英国AIセキュリティ研究所による別の研究も、復旦の結果と一致し、最先端モデルは研究エンジニアリングに優れる一方で、最終的に重要となる高次判断には弱いことを示している。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

一昨日