Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
29.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 241 | Qwen2.5 VL 72B Instruct qwen2.5-vl-72b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 14.6 overall | 22.7 | 0.0 | 5.2 | 0.0 | 0.0 | N/A |
| 242 | Phi 4 phi-4 textinference | Microsoft | 14.4 overall | 14.4 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 243 | Qwen2.5 14B Instruct qwen-2.5-14b-instruct textinference | Alibaba Cloud / Qwen Team | 13.4 overall | 13.4 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 244 | Qwen3.5-2B qwen3.5-2b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 13.2 overall | 13.2 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 245 | Mistral Small 3 24B Instruct mistral-small-24b-instruct-2501 textinference | Mistral AI | 13.0 overall | 13.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 246 | Mistral Small 3.1 24B Base mistral-small-3.1-24b-base-2503 multimodalvisionmulti-input reasoning | Mistral AI | 12.9 overall | 12.9 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 247 | Nova Lite nova-lite multimodalvisionmulti-input reasoning | Amazon | 12.9 overall | 12.9 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 248 | Gemini 2.5 Flash-Lite gemini-2.5-flash-lite multimodalvisionmulti-input reasoning | Google | 12.7 overall | 20.3 | 0.0 | 0.0 | 2.9 | 0.0 | |
| 249 | Devstral Small 1.1 devstral-small-2507 codeprogrammingtool use | Mistral AI | 12.5 overall | 0.0 | 0.0 | 0.0 | 12.5 | 0.0 | N/A |
| 250 | Qwen2.5 VL 32B Instruct qwen2.5-vl-32b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 11.2 overall | 19.4 | 0.0 | 1.5 | 0.0 | 0.0 | N/A |
| 251 | Qwen2 72B Instruct qwen2-72b-instruct textinference | Alibaba Cloud / Qwen Team | 11.0 overall | 11.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 252 | Llama 3.1 70B Instruct llama-3.1-70b-instruct textinference | Meta | 10.3 overall | 10.3 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 253 | Gemini 1.5 Flash 8B gemini-1.5-flash-8b multimodalvisionmulti-input reasoning | Google | 9.9 overall | 9.9 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 254 | Grok-1.5V grok-1.5v multimodalvisionmulti-input reasoning | xAI | 9.7 overall | 9.7 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 255 | Claude 3 Sonnet claude-3-sonnet-20240229 multimodalvisionmulti-input reasoning | Anthropic | 9.2 overall | 9.2 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 256 | Mistral Large 3 mistral-large-3-2509 multimodalvisionmulti-input reasoning | Mistral AI | 8.8 overall | 8.8 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 257 | Gemma 3 12B gemma-3-12b-it multimodalvisionmulti-input reasoning | Google | 8.6 overall | 8.6 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 258 | Gemma 4 E2B gemma-4-e2b-it multimodalvisionmulti-input reasoning | Google | 8.5 overall | 8.5 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 259 | Nova Micro nova-micro textinference | Amazon | 8.4 overall | 8.4 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 260 | Grok-1.5 grok-1.5 multimodalvisionmulti-input reasoning | xAI | 8.2 overall | 8.2 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
Qwen2.5 VL 72B Instruct
Alibaba Cloud / Qwen Team
14.6
N/A
Phi 4
Microsoft
14.4
N/A
Qwen2.5 14B Instruct
Alibaba Cloud / Qwen Team
13.4
N/A
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| N/A |
| N/A |
| N/A |
| N/A |
Qwen3.5-2B
Alibaba Cloud / Qwen Team
13.2
N/A
Mistral Small 3 24B Instruct
Mistral AI
13.0
N/A
Mistral Small 3.1 24B Base
Mistral AI
12.9
N/A
Nova Lite
Amazon
12.9
N/A
Gemini 2.5 Flash-Lite
12.7
N/A
Devstral Small 1.1
Mistral AI
12.5
N/A
Qwen2.5 VL 32B Instruct
Alibaba Cloud / Qwen Team
11.2
N/A
Qwen2 72B Instruct
Alibaba Cloud / Qwen Team
11.0
N/A
Llama 3.1 70B Instruct
Meta
10.3
N/A
Gemini 1.5 Flash 8B
9.9
N/A
Grok-1.5V
xAI
9.7
N/A
Claude 3 Sonnet
Anthropic
9.2
N/A
Mistral Large 3
Mistral AI
8.8
N/A
Gemma 3 12B
8.6
N/A
Gemma 4 E2B
8.5
N/A
Nova Micro
Amazon
8.4
N/A
Grok-1.5
xAI
8.2
N/A