Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
29.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 21 | Gemini 3 Pro gemini-3-pro-preview multimodalvisionmulti-input reasoning | Google | 61.0 overall | 70.3 | 0.0 | 58.0 | 52.3 | 0.0 | N/A |
| 22 | GPT-5.1 Codex High gpt-5.1-codex-high multimodalvisionmulti-input reasoning | OpenAI | 61.0 overall | 61.0 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 23 | Qwen3.7 Max qwen3.7-max multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 60.8 overall | 64.7 | 62.8 | 49.6 | 74.2 | 43.9 | $1.25 in / $3.75 out |
| 24 | Nova 2 Sonic nova-2-sonic multimodalvisionmulti-input reasoning | Amazon | 60.7 overall | 0.0 | 62.8 | 0.0 | 0.0 | 57.3 | $0.33 in / $2.75 out |
| 25 | GPT-5.5 Pro gpt-5.5-pro multimodalvisionmulti-input reasoning | OpenAI | 60.1 overall | 61.1 | 0.0 | 69.2 | 48.8 | 0.0 | N/A |
| 26 | DeepSeek-V4-Pro-Max deepseek-v4-pro-max codeprogrammingtool use | DeepSeek | 59.9 overall | 64.9 | 84.8 | 51.0 | 52.0 | 45.1 | |
| 27 | Qwen3.7-Plus qwen3.7-plus multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 59.6 overall | 62.9 | 62.8 | 48.1 | 61.1 | 69.5 | $0.32 in / $1.28 out |
| 28 | Gemini 3.6 Flash gemini-3.6-flash multimodalvisionmulti-input reasoning | Google | 59.0 overall | 57.8 | 84.8 | 0.0 | 52.6 | 34.8 | |
| 29 | Kimi K2-Thinking-0905 kimi-k2-thinking-0905 codeprogrammingtool use | Moonshot AI | 58.8 overall | 66.2 | 0.0 | 50.8 | 58.0 | 0.0 | |
| 30 | Grok 4.3 grok-4.3 textinference | xAI | 58.8 overall | 0.0 | 62.8 | 0.0 | 0.0 | 52.4 | $1.25 in / $2.5 out |
| 31 | Grok 4.5 grok-4.5 multimodalvisionmulti-input reasoning | xAI | 58.7 overall | 69.3 | 38.2 | 0.0 | 70.8 | 35.6 | $2 in / $6 out |
| 32 | Gemini 3.1 Flash-Lite gemini-3.1-flash-lite-preview multimodalvisionmulti-input reasoning | Google | 58.3 overall | 52.6 | 62.8 | 0.0 | 0.0 | 67.1 | |
| 33 | Gemini 3.1 Pro gemini-3.1-pro-preview multimodalvisionmulti-input reasoning | Google | 57.9 overall | 72.3 | 58.3 | 52.6 | 60.9 | 22.7 | |
| 34 | MiMo-V2.5-Pro mimo-v2.5-pro codeprogrammingtool use | Xiaomi | 57.7 overall | 36.2 | 84.8 | 0.0 | 56.3 | 78.0 | $0.435 in / $0.87 out |
| 35 | GPT-5.1 Thinking gpt-5.1-thinking-2025-11-12 multimodalvisionmulti-input reasoning | OpenAI | 57.6 overall | 62.4 | 0.0 | 0.0 | 51.4 | 0.0 | |
| 36 | Claude Opus 4.1 claude-opus-4-1-20250805 multimodalvisionmulti-input reasoning | Anthropic | 57.3 overall | 46.0 | 0.0 | 67.4 | 60.8 | 0.0 | |
| 37 | Muse Spark muse-spark multimodalvisionmulti-input reasoning | Meta | 57.0 overall | 67.1 | 0.0 | 64.4 | 36.2 | 0.0 | N/A |
| 38 | ERNIE 5.0 ernie-5.0 multimodalvisionmulti-input reasoning | Baidu | 56.8 overall | 56.8 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 39 | DeepSeek-V4-Flash-Max deepseek-v4-flash-max codeprogrammingtool use | DeepSeek | 56.7 overall | 56.2 | 84.8 | 35.3 | 41.4 | 98.8 | |
| 40 | Claude Opus 4.7 claude-opus-4-7 multimodalvisionmulti-input reasoning | Anthropic | 56.5 overall | 75.1 | 28.3 | 54.2 | 77.9 | 8.0 |
Gemini 3 Pro
61.0
N/A
GPT-5.1 Codex High
OpenAI
61.0
N/A
Qwen3.7 Max
Alibaba Cloud / Qwen Team
60.8
$1.25 in / $3.75 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| $1.6 in / $3.2 out |
| $1.5 in / $7.5 out |
| N/A |
| $0.25 in / $1.5 out |
| $2.5 in / $15 out |
| N/A |
| N/A |
| $0.1 in / $0.2 out |
| $5 in / $25 out |
Nova 2 Sonic
Amazon
60.7
$0.33 in / $2.75 out
GPT-5.5 Pro
OpenAI
60.1
N/A
DeepSeek-V4-Pro-Max
DeepSeek
59.9
$1.6 in / $3.2 out
Qwen3.7-Plus
Alibaba Cloud / Qwen Team
59.6
$0.32 in / $1.28 out
Gemini 3.6 Flash
59.0
$1.5 in / $7.5 out
Kimi K2-Thinking-0905
Moonshot AI
58.8
N/A
Grok 4.3
xAI
58.8
$1.25 in / $2.5 out
Grok 4.5
xAI
58.7
$2 in / $6 out
Gemini 3.1 Flash-Lite
58.3
$0.25 in / $1.5 out
Gemini 3.1 Pro
57.9
$2.5 in / $15 out
MiMo-V2.5-Pro
Xiaomi
57.7
$0.435 in / $0.87 out
GPT-5.1 Thinking
OpenAI
57.6
N/A
Claude Opus 4.1
Anthropic
57.3
N/A
Muse Spark
Meta
57.0
N/A
ERNIE 5.0
Baidu
56.8
N/A
DeepSeek-V4-Flash-Max
DeepSeek
56.7
$0.1 in / $0.2 out
Claude Opus 4.7
Anthropic
56.5
$5 in / $25 out