Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
373
Tracked models
34
Providers
310
Benchmarked
30.2
Avg. index
373 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Muse Spark 1.2 muse-spark-1.2 multimodalvisionmulti-input reasoning | Meta | 87.0 overall | 0.0 | 81.9 | 0.0 | 0.0 | 95.1 | $0.1 in / $0.2 out |
| 2 | DeepSeek-V4-Flash-Vision-Exp deepseek-v4-flash-vision-exp multimodalvisionmulti-input reasoning | DeepSeek | 79.5 overall | 0.0 | 81.9 | 0.0 | 0.0 | 75.7 | |
| 3 | Muse Spark 1.3 muse-spark-1.3 multimodalvisionmulti-input reasoning | Meta | 78.4 overall | 70.4 | 81.9 | 0.0 | 0.0 | 95.1 | $0.1 in / $0.2 out |
| 4 | Claude Mythos Preview claude-mythos-preview multimodalvisionmulti-input reasoning | Anthropic | 75.8 overall | 79.5 | 0.0 | 64.8 | 83.0 | 0.0 | |
| 5 | DeepSeek-V4-Flash-0731 deepseek-v4-flash-0731 textinference | DeepSeek | 73.0 overall | 0.0 | 81.9 | 56.3 | 0.0 | 99.0 | $0.09 in / $0.18 out |
| 6 | GLM-5.3-Flash glm-5.3-flash multimodalvisionmulti-input reasoning | Zhipu AI | 72.7 overall | 64.0 | 81.9 | 72.6 | 0.0 | 82.5 | $0.15 in / $0.5 out |
| 7 | DeepSeek-V4-Pro-0813 deepseek-v4-pro-0813 textinference | DeepSeek | 71.2 overall | 67.4 | 81.9 | 68.1 | 0.0 | 72.3 | $0.435 in / $0.87 out |
| 8 | Kimi K3 kimi-k3 multimodalvisionmulti-input reasoning | Moonshot AI | 69.6 overall | 75.3 | 81.9 | 78.2 | 0.0 | 13.1 | $3 in / $15 out |
| 9 | GPT-6 Astra gpt-6-astra multimodalvisionmulti-input reasoning | OpenAI | 69.6 overall | 74.8 | 95.2 | 74.6 | 0.0 | 1.9 | $10 in / $50 out |
| 10 | Hy4 preview hy4-preview codeprogrammingtool use | Tencent | 69.2 overall | 67.2 | 0.0 | 70.3 | 70.6 | 0.0 | N/A |
| 11 | GPT-5.6 Sol gpt-5.6-sol multimodalvisionmulti-input reasoning | OpenAI | 68.7 overall | 77.6 | 95.2 | 63.1 | 72.7 | 5.8 | $5 in / $30 out |
| 12 | Grok-4 Heavy grok-4-heavy multimodalvisionmulti-input reasoning | xAI | 68.1 overall | 68.1 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 13 | Qwen3.8 Max qwen3.8-max multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 67.2 overall | 70.3 | 81.9 | 62.7 | 72.0 | 35.0 | $1.65 in / $4.951 out |
| 14 | Grok-4.1 Fast Non-Reasoning grok-4-1-fast-non-reasoning multimodalvisionmulti-input reasoning | xAI | 66.9 overall | 0.0 | 63.2 | 0.0 | 0.0 | 72.7 | |
| 15 | Grok-4.1 Fast Reasoning grok-4-1-fast-reasoning multimodalvisionmulti-input reasoning | xAI | 66.9 overall | 0.0 | 63.2 | 0.0 | 0.0 | 72.7 | |
| 16 | Grok-4 Fast Reasoning grok-4-fast-reasoning multimodalvisionmulti-input reasoning | xAI | 66.9 overall | 0.0 | 63.2 | 0.0 | 0.0 | 72.7 | |
| 17 | GPT-5.1 High gpt-5.1-high-2025-11-12 multimodalvisionmulti-input reasoning | OpenAI | 66.2 overall | 66.2 | 0.0 | 0.0 | 0.0 | 0.0 | |
| 18 | Gemini 3.7 Flash gemini-3.7-flash multimodalvisionmulti-input reasoning | Google | 66.1 overall | 65.3 | 81.9 | 0.0 | 0.0 | 43.2 | |
| 19 | GPT-5.6 Terra gpt-5.6-terra multimodalvisionmulti-input reasoning | OpenAI | 66.0 overall | 72.5 | 95.2 | 54.6 | 69.3 | 21.4 | |
| 20 | GPT-5.6 Luna gpt-5.6-luna multimodalvisionmulti-input reasoning | OpenAI | 66.0 overall | 62.7 | 95.2 | 48.5 | 65.8 | 70.4 | $0.2 in / $1.2 out |
Muse Spark 1.2
Meta
87.0
$0.1 in / $0.2 out
DeepSeek-V4-Flash-Vision-Exp
DeepSeek
79.5
$0.22 in / $0.66 out
Muse Spark 1.3
Meta
78.4
$0.1 in / $0.2 out
Page 1 of 19 · 373 models
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $0.22 in / $0.66 out |
| N/A |
| $0.2 in / $0.5 out |
| $0.2 in / $0.5 out |
| $0.2 in / $0.5 out |
| N/A |
| $0.75 in / $3.75 out |
| $2 in / $12 out |
Claude Mythos Preview
Anthropic
75.8
N/A
DeepSeek-V4-Flash-0731
DeepSeek
73.0
$0.09 in / $0.18 out
GLM-5.3-Flash
Zhipu AI
72.7
$0.15 in / $0.5 out
DeepSeek-V4-Pro-0813
DeepSeek
71.2
$0.435 in / $0.87 out
Kimi K3
Moonshot AI
69.6
$3 in / $15 out
GPT-6 Astra
OpenAI
69.6
$10 in / $50 out
Hy4 preview
Tencent
69.2
N/A
GPT-5.6 Sol
OpenAI
68.7
$5 in / $30 out
Grok-4 Heavy
xAI
68.1
N/A
Qwen3.8 Max
Alibaba Cloud / Qwen Team
67.2
$1.65 in / $4.951 out
Grok-4.1 Fast Non-Reasoning
xAI
66.9
$0.2 in / $0.5 out
Grok-4.1 Fast Reasoning
xAI
66.9
$0.2 in / $0.5 out
Grok-4 Fast Reasoning
xAI
66.9
$0.2 in / $0.5 out
GPT-5.1 High
OpenAI
66.2
N/A
Gemini 3.7 Flash
66.1
$0.75 in / $3.75 out
GPT-5.6 Terra
OpenAI
66.0
$2 in / $12 out
GPT-5.6 Luna
OpenAI
66.0
$0.2 in / $1.2 out