AI RACE— The AI Race
← ランキング一覧

🤖 AI Agents (Autonomous AI)

An AI's ability to autonomously execute multi-step actions to complete a task — beyond just answering questions. For example, given "book flights + hotel for a weekend trip to Da Nang, budget under 5 million" — the AI must search flights, compare prices, fill forms, and resolve errors on its own without step-by-step guidance. Measured via τ²-bench (dialogue + tool use) and Terminal-Bench v2 (multi-step terminal/computer tasks).

100/100 件のモデル
#アクセス
199.3試す
298.0試す
3
China Mobile
97.1–
496.9試す
5
Anthropic
96.5試す
6
SpaceXAI
96.1–
795.9試す
895.8試す
995.4試す
1094.6試す
11
Z AI
94.5試す
1294.3試す
1394.3試す
1493.9試す
1593.8試す
1693.7試す
1793.6試す
1892.6試す
1992.5–
2092.5試す
2192.3試す
2292.1試す
2392.0試す
2491.5試す
2591.4試す
26
China Mobile
91.3–
27
91.2–
2891.2試す
29
OpenAI
91.1試す
3091.1–
3191.1試す
3291.0試す
33
90.2–
3490.2試す
3589.8試す
3689.2–
37
SpaceXAI
89.2試す
3889.1試す
39
InclusionAI
88.7–
40
88.6–
4188.5試す
4288.3試す
4388.2試す
4488.2試す
4588.1試す
4688.0試す
4788.0試す
4887.5試す
4987.1試す
5086.9試す
5186.8試す
5286.6–
5386.3試す
5485.8試す
5585.7試す
5685.6試す
5785.4試す
58
OpenAI
84.5試す
5984.4試す
6084.3–
6183.9試す
6283.7試す
63
Motif Technologies
83.6–
6483.4試す
6583.3試す
66
Korea Telecom
83.3–
6783.1試す
6883.1試す
69
83.1–
7082.7–
7182.7試す
72
MiniMax
82.6試す
7382.5試す
7482.4–
7582.1–
7682.0試す
7781.9試す
78
OpenAI
81.8試す
7981.7試す
8081.7試す
8181.5試す
82
Institute of Foundation Models
81.2–
83
MiniMax
80.9試す
8480.7試す
8580.4試す
8680.3試す
87
Xiaomi
80.2–
88
Trillion Labs
79.7–
8979.7試す
9079.6試す
91
79.1–
92
Nex AGI
79.0–
9378.6試す
94
Multiverse Computing
78.3–
9578.2–
9678.1試す
9777.7試す
9877.6試す
9975.7試す
10075.2試す

スコア算出方法 — AIM Index

● 能力 85%● 最新性 15%
τ²-benchTerminal-Bench v2

データソース (1)