Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
15.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 121 | DeepSeek-R1-0528 deepseek-r1-0528 codeprogrammingtool use | DeepSeek | 5.7 Programming | 47.9 | 0.0 | 0.0 | 5.7 | 0.0 | N/A |
| 122 | o1 o1-2024-12-17 multimodalvisionmulti-input reasoning | OpenAI | 5.6 Programming | 41.9 | 0.0 | 44.7 | 5.6 | 0.0 | N/A |
| 123 | GPT-4.5 gpt-4.5 multimodalvisionmulti-input reasoning | OpenAI | 5.2 Programming | 41.1 | 0.0 | 35.8 | 5.2 | 0.0 | N/A |
| 124 | Sarvam-30B sarvam-30b codeprogrammingtool use | Sarvam AI | 4.4 Programming | 44.9 | 0.0 | 6.4 | 4.4 | 0.0 | N/A |
| 125 | Nemotron 3 Nano (30B A3B) nemotron-3-nano-30b-a3b codeprogrammingtool use | NVIDIA | 3.8 Programming | 43.6 | 32.9 | 3.0 | 3.8 | 100.0 | $0.06 in / $0.24 out |
| 126 | GPT-4o gpt-4o-2024-08-06 multimodalvisionmulti-input reasoning | OpenAI | 3.7 Programming | 29.1 | 39.6 | 14.9 | 3.7 | 31.2 | |
| 127 | Gemini 2.5 Flash-Lite gemini-2.5-flash-lite multimodalvisionmulti-input reasoning | Google | 2.9 Programming | 20.3 | 0.0 | 0.0 | 2.9 | 0.0 | |
| 128 | GPT-4.1 mini gpt-4.1-mini-2025-04-14 multimodalvisionmulti-input reasoning | OpenAI | 2.2 Programming | 19.2 | 84.6 | 8.9 | 2.2 | 69.5 | |
| 129 | Gemini Diffusion gemini-diffusion codeprogrammingtool use | Google | 1.5 Programming | 6.5 | 0.0 | 0.0 | 1.5 | 0.0 | N/A |
| 130 | DeepSeek-V2.5 deepseek-v2.5 codeprogrammingtool use | DeepSeek | 0.7 Programming | 0.0 | 0.0 | 0.0 | 0.7 | 0.0 | N/A |
| 131 | ChatGPT-4o Latest chatgpt-4o-latest multimodalvisionmulti-input reasoning | OpenAI | 0.0 Programming | 53.0 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 132 | Claude 3.5 Sonnet claude-3-5-sonnet-20240620 multimodalvisionmulti-input reasoning | Anthropic | 0.0 Programming | 23.3 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 133 | Claude 3 Haiku claude-3-haiku-20240307 multimodalvisionmulti-input reasoning | Anthropic | 0.0 Programming | 5.3 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 134 | Claude 3 Opus claude-3-opus-20240229 multimodalvisionmulti-input reasoning | Anthropic | 0.0 Programming | 17.7 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 135 | Claude 3 Sonnet claude-3-sonnet-20240229 multimodalvisionmulti-input reasoning | Anthropic | 0.0 Programming | 9.2 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 136 | Codestral-22B codestral-22b textinference | Mistral AI | 0.0 Programming | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 137 | Command R+ command-r-plus-04-2024 textinference | Cohere | 0.0 Programming | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 138 | DeepSeek-V3.2 (Non-thinking) deepseek-chat textinference | DeepSeek | 0.0 Programming | 0.0 | 52.0 | 0.0 | 0.0 | 82.7 | $0.28 in / $0.42 out |
| 139 | DeepSeek-R1 deepseek-r1 textinference | DeepSeek | 0.0 Programming | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 140 | DeepSeek R1 Distill Llama 70B deepseek-r1-distill-llama-70b textinference | DeepSeek | 0.0 Programming | 26.4 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
DeepSeek-R1-0528
DeepSeek
5.7
N/A
o1
OpenAI
5.6
N/A
GPT-4.5
OpenAI
5.2
N/A
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $2.5 in / $10 out |
| N/A |
| $0.4 in / $1.6 out |
| N/A |
| N/A |
| N/A |
| N/A |
| N/A |
Sarvam-30B
Sarvam AI
4.4
N/A
Nemotron 3 Nano (30B A3B)
NVIDIA
3.8
$0.06 in / $0.24 out
GPT-4o
OpenAI
3.7
$2.5 in / $10 out
Gemini 2.5 Flash-Lite
2.9
N/A
GPT-4.1 mini
OpenAI
2.2
$0.4 in / $1.6 out
Gemini Diffusion
1.5
N/A
DeepSeek-V2.5
DeepSeek
0.7
N/A
ChatGPT-4o Latest
OpenAI
0.0
N/A
Claude 3.5 Sonnet
Anthropic
0.0
N/A
Claude 3 Haiku
Anthropic
0.0
N/A
Claude 3 Opus
Anthropic
0.0
N/A
Claude 3 Sonnet
Anthropic
0.0
N/A
Codestral-22B
Mistral AI
0.0
N/A
Command R+
Cohere
0.0
N/A
DeepSeek-V3.2 (Non-thinking)
DeepSeek
0.0
$0.28 in / $0.42 out
DeepSeek-R1
DeepSeek
0.0
N/A
DeepSeek R1 Distill Llama 70B
DeepSeek
0.0
N/A