Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
15.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 81 | GPT-5.2 Codex gpt-5.2-codex multimodalvisionmulti-input reasoning | OpenAI | 30.9 Programming | 0.0 | 31.1 | 0.0 | 30.9 | 22.0 | $1.75 in / $14 out |
| 82 | Qwen3.5-35B-A3B qwen3.5-35b-a3b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 30.2 Programming | 53.4 | 0.0 | 38.3 | 30.2 | 0.0 | N/A |
| 83 | MiniMax M2.7 minimax-m2.7 codeprogrammingtool use | MiniMax | 29.0 Programming | 0.0 | 19.5 | 26.3 | 29.0 | 73.2 | $0.3 in / $1.2 out |
| 84 | o4-mini o4-mini multimodalvisionmulti-input reasoning | OpenAI | 28.7 Programming | 46.2 | 0.0 | 36.1 | 28.7 | 0.0 | N/A |
| 85 | o3 o3-2025-04-16 multimodalvisionmulti-input reasoning | OpenAI | 27.7 Programming | 42.9 | 0.0 | 17.9 | 27.7 | 0.0 | N/A |
| 86 | MiMo-V2.5 mimo-v2.5 multimodalvisionmulti-input reasoning | Xiaomi | 27.2 Programming | 47.7 | 84.8 | 0.0 | 27.2 | 92.7 | $0.168 in / $0.336 out |
| 87 | Nova 2 Lite nova-2-lite multimodalvisionmulti-input reasoning | Amazon | 26.0 Programming | 41.1 | 62.8 | 13.0 | 26.0 | 59.1 | $0.3 in / $2.5 out |
| 88 | Gemini 2.5 Pro Preview 06-05 gemini-2.5-pro-preview-06-05 multimodalvisionmulti-input reasoning | Google | 25.8 Programming | 50.2 | 0.0 | 0.0 | 25.8 | 0.0 | |
| 89 | DeepSeek-V3.1 deepseek-v3.1 codeprogrammingtool use | DeepSeek | 25.4 Programming | 36.7 | 0.0 | 13.6 | 25.4 | 0.0 | N/A |
| 90 | Qwen3.6-35B-A3B qwen3.6-35b-a3b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 25.2 Programming | 51.1 | 0.0 | 9.8 | 25.2 | 0.0 | N/A |
| 91 | LongCat-Flash-Lite longcat-flash-lite codeprogrammingtool use | Meituan | 23.9 Programming | 22.8 | 72.8 | 30.1 | 23.9 | 95.6 | $0.1 in / $0.4 out |
| 92 | GPT-5 mini gpt-5-mini-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 22.2 Programming | 39.4 | 77.4 | 0.0 | 22.2 | 68.5 | |
| 93 | Nemotron 3 Super (120B A12B) nemotron-3-super-120b-a12b codeprogrammingtool use | NVIDIA | 22.0 Programming | 45.5 | 0.0 | 7.6 | 22.0 | 0.0 | N/A |
| 94 | Gemini 3.5 Flash gemini-3.5-flash multimodalvisionmulti-input reasoning | Google | 21.8 Programming | 60.2 | 84.8 | 67.3 | 21.8 | 31.7 | |
| 95 | Gemini 2.5 Pro gemini-2.5-pro multimodalvisionmulti-input reasoning | Google | 21.4 Programming | 42.5 | 51.0 | 0.0 | 21.4 | 29.8 | |
| 96 | MAI-Code-1-Flash mai-code-1-flash codeprogrammingtool use | Microsoft | 21.4 Programming | 32.2 | 0.0 | 0.0 | 21.4 | 0.0 | N/A |
| 97 | Devstral Medium devstral-medium-2507 codeprogrammingtool use | Mistral AI | 20.6 Programming | 0.0 | 0.0 | 0.0 | 20.6 | 0.0 | N/A |
| 98 | GPT-5.4 Mini gpt-5.4-mini texttext-to-textlanguage | OpenAI | 20.0 Programming | 51.1 | 44.5 | 15.0 | 20.0 | 42.7 | |
| 99 | Gemini 2.5 Flash gemini-2.5-flash multimodalvisionmulti-input reasoning | Google | 19.5 Programming | 38.2 | 0.0 | 0.0 | 19.5 | 0.0 | |
| 100 | North Mini Code 1.0 north-mini-code-1.0 codeprogrammingtool use | Cohere | 18.6 Programming | 0.0 | 0.0 | 0.0 | 18.6 | 0.0 | N/A |
GPT-5.2 Codex
OpenAI
30.9
$1.75 in / $14 out
Qwen3.5-35B-A3B
Alibaba Cloud / Qwen Team
30.2
N/A
MiniMax M2.7
MiniMax
29.0
$0.3 in / $1.2 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| $0.25 in / $2 out |
| $1.5 in / $9 out |
| $1.25 in / $10 out |
| $0.75 in / $4.5 out |
| N/A |
o4-mini
OpenAI
28.7
N/A
o3
OpenAI
27.7
N/A
MiMo-V2.5
Xiaomi
27.2
$0.168 in / $0.336 out
Nova 2 Lite
Amazon
26.0
$0.3 in / $2.5 out
Gemini 2.5 Pro Preview 06-05
25.8
N/A
DeepSeek-V3.1
DeepSeek
25.4
N/A
Qwen3.6-35B-A3B
Alibaba Cloud / Qwen Team
25.2
N/A
LongCat-Flash-Lite
Meituan
23.9
$0.1 in / $0.4 out
GPT-5 mini
OpenAI
22.2
$0.25 in / $2 out
Nemotron 3 Super (120B A12B)
NVIDIA
22.0
N/A
Gemini 3.5 Flash
21.8
$1.5 in / $9 out
Gemini 2.5 Pro
21.4
$1.25 in / $10 out
MAI-Code-1-Flash
Microsoft
21.4
N/A
Devstral Medium
Mistral AI
20.6
N/A
Gemini 2.5 Flash
19.5
N/A
North Mini Code 1.0
Cohere
18.6
N/A