AI RACE— 每日追蹤 AI 競爭賽局
Research

追平頂尖 AI 效能成本崩跌:年降幅最高達 13 倍

來自 Epoch AI 與 MIT 的研究顯示,在演算法進步、硬體成本下降與激烈市場競爭的推動下,達到特定基準測試分數的成本正以史無前例的速度驟降。

2026/09/24 23:00
Chi phí hiệu năng AI đang lao dốc với tốc độ chưa từng có trong lịch sử công nghệ

AI 基準測試成本出現歷史性暴跌

在關鍵人工智慧基準測試中達到特定效能里程碑的成本,其下降速度超越以往任何變革性技術。根據追蹤 AI 趨勢的研究機構 Epoch AI 的研究發現,自 2023 年以來,在特定基準測試上達到既定能力水準的成本,平均每季下降 47%——相當於每年減少約 13 倍。

另一項由 Hans Gundlach 領導的 MIT 研究團隊進行的平行研究,利用 AI 評測平台 Artificial Analysis 在 2024 年 4 月至 2025 年 11 月期間的數據,追蹤了類似趨勢。MIT 團隊觀察到,在更廣泛的模型組合中,成本每年下降 5 到 10 倍。儘管這些數據反映了複製過往能力所需的市場價格大幅下跌,但研究人員指出,由於新型推論架構帶來龐大的運算需求,在複雜任務上運行頂尖的前沿模型(state-of-the-art),其成本實際上反而可能增加。

解析演算法進展、硬體升級與價格戰

追平以往前沿模型的營運成本降幅相當驚人。Epoch 特別點出 OpenAI 的 o3 模型:該模型在 2025 年初於博士級 GPQA Diamond 科學基準測試中達到 75% 的準確率,預估每題成本為 30 美分。在 18 個月內,GPT-5.6 系列的一款模型僅需每題 0.04 美分便達到相同分數——成本降至原本的 725 分之一。為了具體說明這個幅度,Epoch 指出,如果汽車製造業以相同速度進步,一輛 50,000 歐元的汽車售價將降至 70 歐元以下。而 OpenAI 推出成本更低的 GPT-6 Sol 與 Luna 模型,更顯示出基準成本仍在持續探底。

然而,市場價格並非僅反映了演算法的改進。當 MIT 研究人員透過分析開放模型,排除更便宜的硬體與激進價格競爭的影響來隔離市場動態時,他們計算出純粹演算法效率提升的底層速率約為每年 3 倍。Epoch 估算出的 13 倍較高數值,則反映了未拆解硬體與競爭折扣的整體市場環境。

此外,更高的基準測試分數並不一定代表系統更精簡。MIT 發現,現代推論模型通常透過在解決問題時投入大量額外的「測試階段運算」(test-time compute)來提高準確率,這使得每次查詢的運算資源與成本增加,即使基礎 Token 價格已有所下降。

測試階段運算、「刷榜特化」與現實世界的權衡

這些分歧的指標突顯出原始基準測試分數與實際部署成本之間日益擴大的脫節。由於綜合基準測試結果融合了資料、架構、訓練效率以及測試階段運算的改進,頂尖的高分可能掩蓋了更高的執行開銷。研究人員還必須面對「刷榜特化」(benchmaxxing)現象,即開發者專門針對公開測試來最佳化系統。Epoch 試圖透過納入非公開測試「Mystery Game Puzzles」來解決此問題;在該基準測試中,成本下降的速度是樣本中最慢的,這顯示出未公開測試缺乏特化最佳化,或歸因於任務格式的差異。

對於企業導入者而言,整體價格下跌並不直接決定模型選擇。營運需求往往比每 Token 成本指標更為關鍵:大幅降價但延遲顯著的模型並不適合即時客服聊天機器人,而反應緩慢的推論模型則可能成為自動化流程的瓶頸。相反地,如果頂尖前沿模型具備更優異的首次命中準確率(first-pass accuracy),能夠免除重複查詢與錯誤修正迴圈的需求,那麼採用價格更高的前沿模型反而能帶來更低的總營運成本。

◗ 參考來源

The Decoder09/24

相關文章