最先端AI性能の再現コスト、年間最大13分の1に急減
Epoch AIとMITの研究により、アルゴリズムの進化、ハードウェアの低価格化、激しい市場競争が相まって、一定のベンチマークスコアを達成するコストが前例のないペースで下落していることが明らかになった。

歴史的なペースで急落するAIベンチマークのコスト
主要な人工知能ベンチマークにおいて一定の性能マイルストーンを達成するためのコストが、これまでのいかなる変革的技術をも上回るペースで下落している。AIの動向を追跡する研究組織Epoch AIの調査結果によると、特定のベンチマークで一定の能力水準に達するためのコストは2023年以降、四半期あたり平均47%下落しており、これは年間約13分の1への減少に相当する。
Hans Gundlach氏率いるMITの研究チームによる並行研究では、AI評価プラットフォーム「Artificial Analysis」のデータを用い、2024年4月から2025年11月にかけての同様の傾向を追跡した。MITのチームは、より広範なモデル群において、コストが年間5分の1から10分の1へと下落していることを観測した。これらの数値は過去の性能水準を再現するための市場価格が急落している現実を反映しているが、研究者らは、複雑なタスクで最新鋭の最高峰モデルを実行するコストについては、新しい推論アーキテクチャの膨大な計算需要により実際には増加する可能性があると指摘している。
アルゴリズムの進歩、ハードウェア、価格競争の内訳
かつてのフロンティアモデルに匹敵する性能を出すための運用コストの低下は著しい。Epoch AIはOpenAIの「o3」モデルを例に挙げている。同モデルは2025年初頭、博士レベルの科学ベンチマーク「GPQA Diamond」において1問あたり推定30セントのコストで75%の正解率を達成した。それから18か月以内に、GPT-5.6ファミリーのモデルが1問あたりわずか0.04セントで同一のスコアを達成し、価格は725分の1に低下した。その規模を例えるため、Epoch AIは、もし自動車製造が同じペースで進歩した場合、5万ユーロの車両が70ユーロ未満に値下がりすることになると指摘した。OpenAIの低コストモデルであるGPT-6 SolおよびLunaの登場は、基準となるコストが下がり続けていることを示している。
しかし、市場価格はアルゴリズムの改善のみを反映しているわけではない。MITの研究者がオープンモデルを調査し、より安価なハードウェアや積極的な価格競争の影響を排除して市場動向を切り離したところ、純粋なアルゴリズムの効率向上による根本的なペースは年間約3倍(コスト3分の1相当)と算出された。Epoch AIが示した年間13倍という高い数値は、ハードウェアの進歩や競争による割引を切り分けることなく、市場環境全体を捉えたものだ。
さらに、高いベンチマークスコアが必ずしも効率的なシステムを意味するとは限らない。MITは、現代の推論モデルが問題に膨大な追加のテスト時計算(test-time compute)を投入することで精度を高めているケースが多く、ベースのトークン価格が下落しているにもかかわらず、クエリあたりの処理能力とコストが増加している実態を突き止めた。
テスト時計算、「ベンチマックシング」、そして現実世界のトレードオフ
こうした指標の乖離は、純粋なベンチマークスコアと実際の導入コストとの間に広がるギャップを浮き彫りにしている。複合的なベンチマーク結果は、データ、アーキテクチャ、トレーニング効率、テスト時計算の改善が混ざり合っているため、優れたスコアの裏により高額な実行コストが隠れている可能性がある。また、開発者が公開テストに特化してシステムを最適化する「ベンチマックシング(benchmaxxing)」という課題にも研究者らは直面している。Epoch AIは非公開テスト「Mystery Game Puzzles」を組み込むことでこれに対処しようとしたが、このベンチマークにおけるコスト低下ペースは調査サンプル中で最も遅く、未公開テストに対する最適化が行われていないこと、あるいはタスク形式の違いを示唆している。
エンタープライズの導入企業にとって、全般的な価格低下がそのままモデルの選定基準となるわけではない。多くの場合、運用の要件がトークンあたりのコスト指標よりも優先される。大幅に値引きされていてもレイテンシが大きいモデルはリアルタイムの顧客対応チャットボットには不向きであり、推論が遅いモデルは自動化パイプラインのボトルネックになり得る。逆に、より高価なフロンティアモデルを導入した場合でも、優れた初回答精度によってクエリの再試行やエラー修正ループが不要になれば、結果的に総運用コストを低く抑えられることもある。

