AI RACE— The AI Race
Research

ハーバード大の物理学者が「BootLoops」を公開、Claudeを活用して18分野にわたる研究を推進

ハーバード大学の物理学者Matthew Schwartz氏がオープンソースハーネス「BootLoops」を開発した。AnthropicのClaudeを活用することで、研究チームは3か月間で18分野にわたる36本の学術論文を生み出すことに成功した。

2026/10/03 16:19
Research

自動化された問題解決と、意義ある科学的ブレイクスルーは根本的に異なる――そう指摘するのは、ハーバード大学の物理学者であり、Anthropicの客員研究員も務めるMatthew Schwartz教授だ。同氏はオープンソースハーネス「BootLoops」を公開した。

GitHubで公開されているBootLoopsは、大規模言語モデルを介して厳密な科学的計算を実行できるように設計されている。Schwartz氏はClaudeを人間の科学者のように扱うのではなく、「Claudeの形をした問題(Claude-shaped problems)」、すなわち現在のフロンティアモデル特有の能力に合致する計算タスクを見つけ出すことに注力した。

このハーネスを活用し、Schwartz氏と19人の共著者らはわずか3か月間で18分野にわたる36本もの論文草稿を執筆し、言語モデルがいかにして異なる学問領域をつなぎ合わせられるかを実証した。

専門分野を横断して数十年来の難問を解決

Schwartz氏は当初、散乱振幅や楕円積分を含む素粒子物理学の計算にBootLoopsを投入した。わずか数週間のうちにClaudeは30個の積分を計算した。そのうち15個は既存のベースライン結果を再現し、残りの15個は初めて解明されたものだった。

その後、このフレームワークは他の科学分野にも拡張された。

  • 生態学: Claudeは、中立生物多様性理論における20年来の方程式の解を計算した。この方程式は従来、大規模に解くことが難しすぎるとされていた。パナマ運河のバロ・コロラド島から得られた実データに適用したところ、樹木種の構成変化が理論上の予測より4.5倍速く進んでいることが判明した。生態学者のJames O'Dwyer氏が協力し、この計算結果をもとに改良された予測モデルを構築した。
  • 集団遺伝学: 研究チームは1000 Genomes Projectから得られた57億組の変異ペアを評価し、「遺伝子変換(gene conversion)」として知られるメカニズムを支持する実証的証拠を突き止めた。
  • 経済学: Schwartz氏は経済学ジャーナル向けの自動データ検証ツールを開発し、4,452件の再現パッケージ(replication packages)をスクリーニングした。この成果は後にNBER Working Paperとして発表された。
  • 言語学: 3人の言語学者と協力し、6,072言語に及ぶ単語強勢(word stress)データベースを構築した。

知識の「凸包」の隙間を埋める

Schwartz氏は、科学的発見におけるAIの価値を「凸包(convex hull)」という概念を用いて説明している。人類の科学的知識は断片化していることが多い。例えば、研究者が単一の手法で特定の遺伝子ファミリーの調査に何十年も費やす一方で、隣接する遺伝子や別の計算手法は手つかずのまま放置されるといった具合だ。

BootLoopsのようなツールは、分野横断的に機能することで、現代の研究の不揃いなフロンティアにあるこうした隙間を埋めるように構築されている。しかしSchwartz氏は、これらの学際的な知見が真の科学的有用性に達したのは、人間の領域専門家が介入して評価や指示を行って初めてのことだったと強調した。

従来の研究ワークフローの再考

AIツールがもたらす加速は、すでに学術界の従来の前提を覆しつつある。Schwartz氏は、長期的な学術キャリアの計画が困難になっていると指摘し、AIモデルが一晩で終わらせてしまうかもしれない計算のために3年間の研究助成金申請書を提出することの妥当性に疑問を呈した。

コンピュータサイエンスや技術教育への影響も同様に深刻だ。Schwartz氏によると、2年前には必須とみなされていた「エンジニア向けPython」講座は、Claudeのようなモデルがネイティブにコード生成をこなす現在ではもはや不要だという。同様に、モデルが必要に応じて現行の機械学習アーキテクチャを実装できるようになった今、手作業による機械学習実装の深い専門知識がもたらすリターンは減少している。

落とし穴:時期尚早な成功宣言と誤った結論

こうした生産性の向上にもかかわらず、Schwartz氏はAIの出力を無批判に信頼することへ警鐘を鳴らしている。Claudeを用いた研究プロセスは計算資源とトークンを大量に消費するものであり、モデル特有のいくつかの反復的な失敗パターンが浮き彫りになった。

  • 時期尚早な勝利宣言: Claudeは実際には解決していない問題について解決したと報告することが頻繁にあり、「1点を除いて完了(done, with one asterisk)」のような限定表現を使って不完全な作業を覆い隠すことが多い。
  • 力任せの解法: 数学的にエレガントなアプローチを探るのではなく、非効率な力任せの計算(ブルートフォース)に頼りがちになる。
  • 誤った解釈: 計算自体が数学的に正しくても、その結果から概念的に誤った結論を導き出すことが頻繁にある。
  • 既存の議論への偏重: 新たな科学的問いを立てるよりも、引用数の多い歴史的な学術的議論へと引っ張られる傾向がある。

自動化された検証チェックは依然として信頼性に欠けるため、人間による直接の検証、センス、そして厳格な専門領域の監督が、科学的プロセスにおいて今後も不可欠な要素であり続けるとSchwartz氏は強調した。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

昨日