Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
28.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 101 | Claude 3.7 Sonnet claude-3-7-sonnet-20250219 multimodalvisionmulti-input reasoning | Anthropic | 42.3 Benchmarks | 42.3 | 0.0 | 49.1 | 37.7 | 0.0 | N/A |
| 102 | Qwen3-Next-80B-A3B-Thinking qwen3-next-80b-a3b-thinking textinference | Alibaba Cloud / Qwen Team | 42.3 Benchmarks | 42.3 | 0.0 | 41.7 | 0.0 | 0.0 | N/A |
| 103 | o1 o1-2024-12-17 multimodalvisionmulti-input reasoning | OpenAI | 41.9 Benchmarks | 41.9 | 0.0 | 44.7 | 5.6 | 0.0 | N/A |
| 104 | GPT-5.4 nano gpt-5.4-nano multimodalvisionmulti-input reasoning | OpenAI | 41.8 Benchmarks | 41.8 | 44.5 | 6.9 | 8.2 | 76.8 | $0.2 in / $1.25 out |
| 105 | Qwen3 VL 32B Thinking qwen3-vl-32b-thinking multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 41.2 Benchmarks | 41.2 | 0.0 | 31.1 | 0.0 | 0.0 | |
| 106 | GPT-4.5 gpt-4.5 multimodalvisionmulti-input reasoning | OpenAI | 41.1 Benchmarks | 41.1 | 0.0 | 35.8 | 5.2 | 0.0 | N/A |
| 107 | Nova 2 Lite nova-2-lite multimodalvisionmulti-input reasoning | Amazon | 41.1 Benchmarks | 41.1 | 62.8 | 13.0 | 26.0 | 59.1 | $0.3 in / $2.5 out |
| 108 | Sarvam-105B sarvam-105b codeprogrammingtool use | Sarvam AI | 41.1 Benchmarks | 41.1 | 0.0 | 16.7 | 10.3 | 0.0 | N/A |
| 109 | Kimi K2 0905 kimi-k2-0905 textinference | Moonshot AI | 41.0 Benchmarks | 41.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 110 | Qwen3-235B-A22B-Instruct-2507 qwen3-235b-a22b-instruct-2507 textinference | Alibaba Cloud / Qwen Team | 40.7 Benchmarks | 40.7 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 111 | o1-preview o1-preview codeprogrammingtool use | OpenAI | 40.2 Benchmarks | 40.2 | 0.0 | 0.0 | 8.1 | 0.0 | N/A |
| 112 | GPT-5 mini gpt-5-mini-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 39.4 Benchmarks | 39.4 | 77.4 | 0.0 | 22.2 | 68.5 | |
| 113 | Claude Sonnet 4 claude-sonnet-4-20250514 multimodalvisionmulti-input reasoning | Anthropic | 39.3 Benchmarks | 39.3 | 0.0 | 49.4 | 42.8 | 0.0 | |
| 114 | MiniMax M2.1 minimax-m2.1 codeprogrammingtool use | MiniMax | 39.1 Benchmarks | 39.1 | 68.9 | 45.7 | 47.6 | 72.9 | $0.3 in / $1.2 out |
| 115 | Gemini 2.5 Flash gemini-2.5-flash multimodalvisionmulti-input reasoning | Google | 38.2 Benchmarks | 38.2 | 0.0 | 0.0 | 19.5 | 0.0 | |
| 116 | QvQ-72B-Preview qvq-72b-preview multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 37.6 Benchmarks | 37.6 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 117 | DeepSeek R1 Zero deepseek-r1-zero textinference | DeepSeek | 36.8 Benchmarks | 36.8 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 118 | DeepSeek-V3.1 deepseek-v3.1 codeprogrammingtool use | DeepSeek | 36.7 Benchmarks | 36.7 | 0.0 | 13.6 | 25.4 | 0.0 | N/A |
| 119 | GLM-4.7-Flash glm-4.7-flash codeprogrammingtool use | Zhipu AI | 36.4 Benchmarks | 36.4 | 0.0 | 9.0 | 17.7 | 0.0 | N/A |
| 120 | Qwen3.5-9B qwen3.5-9b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 36.3 Benchmarks | 36.3 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
Claude 3.7 Sonnet
Anthropic
42.3
N/A
Qwen3-Next-80B-A3B-Thinking
Alibaba Cloud / Qwen Team
42.3
N/A
o1
OpenAI
41.9
N/A
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| $0.25 in / $2 out |
| N/A |
| N/A |
GPT-5.4 nano
OpenAI
41.8
$0.2 in / $1.25 out
Qwen3 VL 32B Thinking
Alibaba Cloud / Qwen Team
41.2
N/A
GPT-4.5
OpenAI
41.1
N/A
Nova 2 Lite
Amazon
41.1
$0.3 in / $2.5 out
Sarvam-105B
Sarvam AI
41.1
N/A
Kimi K2 0905
Moonshot AI
41.0
N/A
Qwen3-235B-A22B-Instruct-2507
Alibaba Cloud / Qwen Team
40.7
N/A
o1-preview
OpenAI
40.2
N/A
GPT-5 mini
OpenAI
39.4
$0.25 in / $2 out
Claude Sonnet 4
Anthropic
39.3
N/A
MiniMax M2.1
MiniMax
39.1
$0.3 in / $1.2 out
Gemini 2.5 Flash
38.2
N/A
QvQ-72B-Preview
Alibaba Cloud / Qwen Team
37.6
N/A
DeepSeek R1 Zero
DeepSeek
36.8
N/A
DeepSeek-V3.1
DeepSeek
36.7
N/A
GLM-4.7-Flash
Zhipu AI
36.4
N/A
Qwen3.5-9B
Alibaba Cloud / Qwen Team
36.3
N/A