Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
29.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 81 | GPT-5 mini gpt-5-mini-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 46.3 overall | 39.4 | 77.4 | 0.0 | 22.2 | 68.5 | $0.25 in / $2 out |
| 82 | Claude Opus 4 claude-opus-4-20250514 multimodalvisionmulti-input reasoning | Anthropic | 46.1 overall | 35.8 | 0.0 | 57.4 | 47.0 | 0.0 | |
| 83 | Qwen3.5-27B qwen3.5-27b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 46.0 overall | 57.8 | 32.9 | 41.3 | 39.1 | 61.0 | $0.3 in / $2.4 out |
| 84 | Mercury 2 mercury-2 codeprogrammingtool use | Inception | 45.8 overall | 42.7 | 68.9 | 0.0 | 15.3 | 84.4 | $0.25 in / $0.75 out |
| 85 | Claude Haiku 4.5 claude-haiku-4-5-20251001 multimodalvisionmulti-input reasoning | Anthropic | 45.8 overall | 30.8 | 53.3 | 50.8 | 53.9 | 45.6 | |
| 86 | Qwen3.5-397B-A17B qwen3.5-397b-a17b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 45.1 overall | 54.5 | 0.0 | 24.7 | 55.3 | 0.0 | N/A |
| 87 | Qwen3.6-27B qwen3.6-27b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 45.0 overall | 54.7 | 32.9 | 0.0 | 39.4 | 49.4 | $0.6 in / $3.6 out |
| 88 | Claude Sonnet 4.6 claude-sonnet-4-6 multimodalvisionmulti-input reasoning | Anthropic | 44.9 overall | 62.3 | 12.6 | 41.0 | 65.6 | 12.0 | |
| 89 | Gemini 2.0 Flash Thinking gemini-2.0-flash-thinking multimodalvisionmulti-input reasoning | Google | 44.9 overall | 44.9 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 90 | GPT-5 gpt-5-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 44.5 overall | 59.9 | 0.0 | 24.3 | 47.1 | 0.0 | N/A |
| 91 | MiniMax M2 minimax-m2 codeprogrammingtool use | MiniMax | 44.2 overall | 29.8 | 62.8 | 40.2 | 40.0 | 73.2 | $0.3 in / $1.2 out |
| 92 | GLM-4.7 glm-4.7 multimodalvisionmulti-input reasoning | Zhipu AI | 44.1 overall | 60.3 | 0.0 | 26.6 | 42.5 | 0.0 | N/A |
| 93 | GPT OSS 120B High gpt-oss-120b-high multimodalvisionmulti-input reasoning | OpenAI | 44.1 overall | 44.1 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 94 | o1-pro o1-pro multimodalvisionmulti-input reasoning | OpenAI | 44.1 overall | 44.1 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 95 | K-EXAONE-236B-A23B k-exaone-236b-a23b multimodalvisionmulti-input reasoning | LG AI Research | 43.9 overall | 43.9 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 96 | Claude Sonnet 4 claude-sonnet-4-20250514 multimodalvisionmulti-input reasoning | Anthropic | 43.6 overall | 39.3 | 0.0 | 49.4 | 42.8 | 0.0 | |
| 97 | Claude 3.7 Sonnet claude-3-7-sonnet-20250219 multimodalvisionmulti-input reasoning | Anthropic | 43.1 overall | 42.3 | 0.0 | 49.1 | 37.7 | 0.0 | |
| 98 | GPT-5.3 Chat gpt-5.3-chat-latest multimodalvisionmulti-input reasoning | OpenAI | 43.0 overall | 0.0 | 50.2 | 0.0 | 0.0 | 31.5 | |
| 99 | GLM-5.1 glm-5.1 codeprogrammingtool use | Zhipu AI | 42.9 overall | 62.6 | 15.9 | 35.2 | 47.2 | 40.2 | $1.4 in / $4.4 out |
| 100 | Kimi K2.7 Code kimi-k2.7-code multimodalvisionmulti-input reasoning | Moonshot AI | 42.7 overall | 0.0 | 32.9 | 47.2 | 0.0 | 47.6 |
GPT-5 mini
OpenAI
46.3
$0.25 in / $2 out
Claude Opus 4
Anthropic
46.1
N/A
Qwen3.5-27B
Alibaba Cloud / Qwen Team
46.0
$0.3 in / $2.4 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| $1 in / $5 out |
| $3 in / $15 out |
| N/A |
| N/A |
| N/A |
| N/A |
| $1.75 in / $14 out |
| $0.74 in / $3.5 out |
Mercury 2
Inception
45.8
$0.25 in / $0.75 out
Claude Haiku 4.5
Anthropic
45.8
$1 in / $5 out
Qwen3.5-397B-A17B
Alibaba Cloud / Qwen Team
45.1
N/A
Qwen3.6-27B
Alibaba Cloud / Qwen Team
45.0
$0.6 in / $3.6 out
Claude Sonnet 4.6
Anthropic
44.9
$3 in / $15 out
Gemini 2.0 Flash Thinking
44.9
N/A
GPT-5
OpenAI
44.5
N/A
MiniMax M2
MiniMax
44.2
$0.3 in / $1.2 out
GLM-4.7
Zhipu AI
44.1
N/A
GPT OSS 120B High
OpenAI
44.1
N/A
o1-pro
OpenAI
44.1
N/A
K-EXAONE-236B-A23B
LG AI Research
43.9
N/A
Claude Sonnet 4
Anthropic
43.6
N/A
Claude 3.7 Sonnet
Anthropic
43.1
N/A
GPT-5.3 Chat
OpenAI
43.0
$1.75 in / $14 out
GLM-5.1
Zhipu AI
42.9
$1.4 in / $4.4 out
Kimi K2.7 Code
Moonshot AI
42.7
$0.74 in / $3.5 out