Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
28.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 121 | MiMo-V2.5-Pro mimo-v2.5-pro codeprogrammingtool use | Xiaomi | 36.2 Benchmarks | 36.2 | 84.8 | 0.0 | 56.3 | 78.0 | $0.435 in / $0.87 out |
| 122 | Nova 2 Omni nova-2-omni multimodalvisionmulti-input reasoning | Amazon | 36.1 Benchmarks | 36.1 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 123 | Claude Opus 4 claude-opus-4-20250514 multimodalvisionmulti-input reasoning | Anthropic | 35.8 Benchmarks | 35.8 | 0.0 | 57.4 | 47.0 | 0.0 | |
| 124 | Ministral 3 (14B Reasoning 2512) ministral-14b-latest multimodalvisionmulti-input reasoning | Mistral AI | 35.4 Benchmarks | 35.4 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 125 | Command A+ command-a-plus-05-2026 multimodalvisionmulti-input reasoning | Cohere | 35.2 Benchmarks | 35.2 | 0.0 | 0.0 | 15.3 | 0.0 | |
| 126 | Qwen3 VL 235B A22B Thinking qwen3-vl-235b-a22b-thinking multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 35.2 Benchmarks | 35.2 | 0.0 | 36.2 | 0.0 | 0.0 | |
| 127 | Kimi-k1.5 kimi-k1.5 multimodalvisionmulti-input reasoning | Moonshot AI | 34.7 Benchmarks | 34.7 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 128 | Mistral Medium 3.5 mistral-medium-3-5 multimodalvisionmulti-input reasoning | Mistral AI | 34.6 Benchmarks | 34.6 | 23.2 | 15.4 | 59.0 | 34.8 | |
| 129 | Qwen3 VL 235B A22B Instruct qwen3-vl-235b-a22b-instruct multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 34.3 Benchmarks | 34.3 | 0.0 | 51.0 | 0.0 | 0.0 | |
| 130 | GPT OSS 120B gpt-oss-120b textinference | OpenAI | 33.7 Benchmarks | 33.7 | 0.0 | 26.8 | 0.0 | 0.0 | N/A |
| 131 | Llama 3.1 Nemotron Ultra 253B v1 llama-3.1-nemotron-ultra-253b-v1 textinference | NVIDIA | 33.0 Benchmarks | 33.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 132 | Qwen3 VL 8B Thinking qwen3-vl-8b-thinking multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 32.8 Benchmarks | 32.8 | 0.0 | 21.1 | 0.0 | 0.0 | |
| 133 | Qwen3 VL 30B A3B Thinking qwen3-vl-30b-a3b-thinking multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 32.7 Benchmarks | 32.7 | 0.0 | 19.2 | 0.0 | 0.0 | |
| 134 | Gemma 4 12B gemma-4-12b-it multimodalvisionmulti-input reasoning | Google | 32.6 Benchmarks | 32.6 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 135 | Llama 4 Maverick llama-4-maverick multimodalvisionmulti-input reasoning | Meta | 32.6 Benchmarks | 32.6 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 136 | MAI-Code-1-Flash mai-code-1-flash codeprogrammingtool use | Microsoft | 32.2 Benchmarks | 32.2 | 0.0 | 0.0 | 21.4 | 0.0 | N/A |
| 137 | Claude 3.5 Sonnet claude-3-5-sonnet-20241022 multimodalvisionmulti-input reasoning | Anthropic | 32.0 Benchmarks | 32.0 | 0.0 | 38.7 | 11.1 | 0.0 | |
| 138 | Gemini 2.0 Flash gemini-2.0-flash multimodalvisionmulti-input reasoning | Google | 31.7 Benchmarks | 31.7 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 139 | GLM-4.5 glm-4.5 codeprogrammingtool use | Zhipu AI | 31.5 Benchmarks | 31.5 | 0.0 | 36.0 | 36.1 | 0.0 | N/A |
| 140 | Mistral Small 4 mistral-small-latest multimodalvisionmulti-input reasoning | Mistral AI | 31.3 Benchmarks | 31.3 | 23.2 | 0.0 | 0.0 | 81.7 |
MiMo-V2.5-Pro
Xiaomi
36.2
$0.435 in / $0.87 out
Nova 2 Omni
Amazon
36.1
N/A
Claude Opus 4
Anthropic
35.8
N/A
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| N/A |
| N/A |
| N/A |
| $1.5 in / $7.5 out |
| N/A |
| N/A |
| N/A |
| N/A |
| N/A |
| $0.15 in / $0.6 out |
Ministral 3 (14B Reasoning 2512)
Mistral AI
35.4
N/A
Command A+
Cohere
35.2
N/A
Qwen3 VL 235B A22B Thinking
Alibaba Cloud / Qwen Team
35.2
N/A
Kimi-k1.5
Moonshot AI
34.7
N/A
Mistral Medium 3.5
Mistral AI
34.6
$1.5 in / $7.5 out
Qwen3 VL 235B A22B Instruct
Alibaba Cloud / Qwen Team
34.3
N/A
GPT OSS 120B
OpenAI
33.7
N/A
Llama 3.1 Nemotron Ultra 253B v1
NVIDIA
33.0
N/A
Qwen3 VL 8B Thinking
Alibaba Cloud / Qwen Team
32.8
N/A
Qwen3 VL 30B A3B Thinking
Alibaba Cloud / Qwen Team
32.7
N/A
Gemma 4 12B
32.6
N/A
Llama 4 Maverick
Meta
32.6
N/A
MAI-Code-1-Flash
Microsoft
32.2
N/A
Claude 3.5 Sonnet
Anthropic
32.0
N/A
Gemini 2.0 Flash
31.7
N/A
GLM-4.5
Zhipu AI
31.5
N/A
Mistral Small 4
Mistral AI
31.3
$0.15 in / $0.6 out