Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
29.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 201 | Magistral Small 2506 magistral-small-2506 textinference | Mistral AI | 22.7 overall | 22.7 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 202 | GLM-4.5-Air glm-4.5-air codeprogrammingtool use | Zhipu AI | 22.3 overall | 25.7 | 0.0 | 24.2 | 16.0 | 0.0 | N/A |
| 203 | GPT-4o gpt-4o-2024-08-06 multimodalvisionmulti-input reasoning | OpenAI | 22.0 overall | 29.1 | 39.6 | 14.9 | 3.7 | 31.2 | |
| 204 | GLM-4.7-Flash glm-4.7-flash codeprogrammingtool use | Zhipu AI | 21.9 overall | 36.4 | 0.0 | 9.0 | 17.7 | 0.0 | N/A |
| 205 | Mistral Large 3 (675B Base) mistral-large-3-675b-base-2512 multimodalvisionmulti-input reasoning | Mistral AI | 21.9 overall | 21.9 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 206 | Mistral Large 3 (675B Instruct 2512 Eagle) mistral-large-3-675B-instruct-2512-eagle multimodalvisionmulti-input reasoning | Mistral AI | 21.9 overall | 21.9 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 207 | Mistral Large 3 (675B Instruct 2512 NVFP4) mistral-large-3-675b-instruct-2512-nvfp4 multimodalvisionmulti-input reasoning | Mistral AI | 21.9 overall | 21.9 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 208 | Gemini 1.5 Flash gemini-1.5-flash multimodalvisionmulti-input reasoning | Google | 21.8 overall | 21.8 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 209 | MiniMax M1 40K minimax-m1-40k codeprogrammingtool use | MiniMax | 21.4 overall | 21.3 | 0.0 | 26.8 | 15.5 | 0.0 | N/A |
| 210 | Llama-3.3 Nemotron Super 49B v1 llama-3.3-nemotron-super-49b-v1 textinference | NVIDIA | 21.3 overall | 21.3 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 211 | Phi 4 Reasoning phi-4-reasoning textinference | Microsoft | 21.3 overall | 21.3 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 212 | GPT-3.5 Turbo gpt-3.5-turbo-0125 multimodalvisionmulti-input reasoning | OpenAI | 21.3 overall | 2.3 | 30.1 | 0.0 | 0.0 | 60.7 | |
| 213 | Magistral Medium magistral-medium multimodalvisionmulti-input reasoning | Mistral AI | 20.6 overall | 20.6 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 214 | Devstral Medium devstral-medium-2507 codeprogrammingtool use | Mistral AI | 20.6 overall | 0.0 | 0.0 | 0.0 | 20.6 | 0.0 | N/A |
| 215 | Sarvam-30B sarvam-30b codeprogrammingtool use | Sarvam AI | 20.4 overall | 44.9 | 0.0 | 6.4 | 4.4 | 0.0 | N/A |
| 216 | Min istral 3 (3B Reasoning 2512) ministral-3b-latest multimodalvisionmulti-input reasoning | Mistral AI | 20.4 overall | 20.4 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 217 | MiniMax M1 80K minimax-m1-80k codeprogrammingtool use | MiniMax | 20.2 overall | 22.8 | 0.0 | 20.9 | 16.2 | 0.0 | N/A |
| 218 | GPT-5 nano gpt-5-nano-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 20.0 overall | 25.2 | 0.0 | 0.0 | 13.3 | 0.0 | |
| 219 | Phi 4 Mini Reasoning phi-4-mini-reasoning textinference | Microsoft | 19.9 overall | 19.9 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 220 | DeepSeek-R1-0528 deepseek-r1-0528 codeprogrammingtool use | DeepSeek | 19.8 overall | 47.9 | 0.0 | 0.0 | 5.7 | 0.0 | N/A |
Magistral Small 2506
Mistral AI
22.7
N/A
GLM-4.5-Air
Zhipu AI
22.3
N/A
GPT-4o
OpenAI
22.0
$2.5 in / $10 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $2.5 in / $10 out |
| N/A |
| N/A |
| N/A |
| N/A |
| $0.5 in / $1.5 out |
| N/A |
| N/A |
| N/A |
GLM-4.7-Flash
Zhipu AI
21.9
N/A
Mistral Large 3 (675B Base)
Mistral AI
21.9
N/A
Mistral Large 3 (675B Instruct 2512 Eagle)
Mistral AI
21.9
N/A
Mistral Large 3 (675B Instruct 2512 NVFP4)
Mistral AI
21.9
N/A
Gemini 1.5 Flash
21.8
N/A
MiniMax M1 40K
MiniMax
21.4
N/A
Llama-3.3 Nemotron Super 49B v1
NVIDIA
21.3
N/A
Phi 4 Reasoning
Microsoft
21.3
N/A
GPT-3.5 Turbo
OpenAI
21.3
$0.5 in / $1.5 out
Magistral Medium
Mistral AI
20.6
N/A
Devstral Medium
Mistral AI
20.6
N/A
Sarvam-30B
Sarvam AI
20.4
N/A
Min istral 3 (3B Reasoning 2512)
Mistral AI
20.4
N/A
MiniMax M1 80K
MiniMax
20.2
N/A
GPT-5 nano
OpenAI
20.0
N/A
Phi 4 Mini Reasoning
Microsoft
19.9
N/A
DeepSeek-R1-0528
DeepSeek
19.8
N/A