Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
373
Tracked models
34
Providers
310
Benchmarked
28.2
Avg. index
373 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Mythos Preview claude-mythos-preview multimodalvisionmulti-input reasoning | Anthropic | 79.5 Benchmarks | 79.5 | 0.0 | 64.8 | 83.0 | 0.0 | N/A |
| 2 | GPT-5.6 Sol gpt-5.6-sol multimodalvisionmulti-input reasoning | OpenAI | 77.6 Benchmarks | 77.6 | 95.2 | 63.1 | 72.7 | 5.8 | |
| 3 | Kimi K3 kimi-k3 multimodalvisionmulti-input reasoning | Moonshot AI | 75.3 Benchmarks | 75.3 | 81.9 | 78.2 | 0.0 | 13.1 | |
| 4 | GPT-6 Astra gpt-6-astra multimodalvisionmulti-input reasoning | OpenAI | 74.8 Benchmarks | 74.8 | 95.2 | 74.6 | 0.0 | 1.9 | $10 in / $50 out |
| 5 | Claude Opus 4.7 claude-opus-4-7 multimodalvisionmulti-input reasoning | Anthropic | 74.3 Benchmarks | 74.3 | 26.7 | 52.9 | 77.5 | 9.5 | |
| 6 | GPT-5.5 gpt-5.5 multimodalvisionmulti-input reasoning | OpenAI | 74.2 Benchmarks | 74.2 | 95.2 | 54.9 | 49.2 | 5.8 | $5 in / $30 out |
| 7 | Claude Opus 4.8 claude-opus-4-8 multimodalvisionmulti-input reasoning | Anthropic | 72.5 Benchmarks | 72.5 | 26.7 | 68.7 | 81.8 | 9.5 | |
| 8 | GPT-5.6 Terra gpt-5.6-terra multimodalvisionmulti-input reasoning | OpenAI | 72.5 Benchmarks | 72.5 | 95.2 | 54.6 | 69.3 | 21.4 | |
| 9 | Claude Opus 4.6 claude-opus-4-6 multimodalvisionmulti-input reasoning | Anthropic | 72.2 Benchmarks | 72.2 | 26.7 | 48.8 | 71.9 | 9.5 | |
| 10 | Claude Fable 5.1 claude-fable-5-1 multimodalvisionmulti-input reasoning | Anthropic | 71.6 Benchmarks | 71.6 | 58.6 | 0.0 | 0.0 | 1.9 | |
| 11 | Claude Opus 5 claude-opus-5 multimodalvisionmulti-input reasoning | Anthropic | 70.5 Benchmarks | 70.5 | 58.6 | 69.4 | 0.0 | 9.2 | |
| 12 | Gemini 3.1 Pro gemini-3.1-pro-preview multimodalvisionmulti-input reasoning | Google | 70.5 Benchmarks | 70.5 | 57.5 | 46.2 | 62.9 | 21.9 | |
| 13 | Muse Spark 1.3 muse-spark-1.3 multimodalvisionmulti-input reasoning | Meta | 70.4 Benchmarks | 70.4 | 81.9 | 0.0 | 0.0 | 95.1 | $0.1 in / $0.2 out |
| 14 | Qwen3.8 Max qwen3.8-max multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 70.3 Benchmarks | 70.3 | 81.9 | 62.7 | 72.0 | 35.0 | $1.65 in / $4.951 out |
| 15 | GPT-5.2 gpt-5.2-2025-12-11 multimodalvisionmulti-input reasoning | OpenAI | 69.8 Benchmarks | 69.8 | 58.9 | 34.3 | 66.3 | 28.7 | |
| 16 | Claude Fable 5 claude-fable-5 multimodalvisionmulti-input reasoning | Anthropic | 69.5 Benchmarks | 69.5 | 58.6 | 0.0 | 84.2 | 1.9 | |
| 17 | GPT-5.4 gpt-5.4 texttext-to-textlanguage | OpenAI | 69.3 Benchmarks | 69.3 | 35.4 | 43.6 | 49.4 | 17.6 | |
| 18 | Grok 4.5 grok-4.5 multimodalvisionmulti-input reasoning | xAI | 69.1 Benchmarks | 69.1 | 37.9 | 0.0 | 69.2 | 33.5 | $2 in / $6 out |
| 19 | Gemini 3 Pro gemini-3-pro-preview multimodalvisionmulti-input reasoning | Google | 68.8 Benchmarks | 68.8 | 0.0 | 51.0 | 52.9 | 0.0 | |
| 20 | GLM-5.3 glm-5.3 textinference | Zhipu AI | 68.8 Benchmarks | 68.8 | 81.9 | 59.9 | 0.0 | 37.4 | $1.4 in / $4.4 out |
Claude Mythos Preview
Anthropic
79.5
N/A
GPT-5.6 Sol
OpenAI
77.6
$5 in / $30 out
Kimi K3
Moonshot AI
75.3
$3 in / $15 out
Page 1 of 19 · 373 models
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $5 in / $30 out |
| $3 in / $15 out |
| $5 in / $25 out |
| $5 in / $25 out |
| $2 in / $12 out |
| $5 in / $25 out |
| $10 in / $50 out |
| $5 in / $25 out |
| $2.5 in / $15 out |
| $1.75 in / $14 out |
| $10 in / $50 out |
| $2.5 in / $15 out |
| N/A |
GPT-6 Astra
OpenAI
74.8
$10 in / $50 out
Claude Opus 4.7
Anthropic
74.3
$5 in / $25 out
GPT-5.5
OpenAI
74.2
$5 in / $30 out
Claude Opus 4.8
Anthropic
72.5
$5 in / $25 out
GPT-5.6 Terra
OpenAI
72.5
$2 in / $12 out
Claude Opus 4.6
Anthropic
72.2
$5 in / $25 out
Claude Fable 5.1
Anthropic
71.6
$10 in / $50 out
Claude Opus 5
Anthropic
70.5
$5 in / $25 out
Gemini 3.1 Pro
70.5
$2.5 in / $15 out
Muse Spark 1.3
Meta
70.4
$0.1 in / $0.2 out
Qwen3.8 Max
Alibaba Cloud / Qwen Team
70.3
$1.65 in / $4.951 out
GPT-5.2
OpenAI
69.8
$1.75 in / $14 out
Claude Fable 5
Anthropic
69.5
$10 in / $50 out
Grok 4.5
xAI
69.1
$2 in / $6 out
Gemini 3 Pro
68.8
N/A
GLM-5.3
Zhipu AI
68.8
$1.4 in / $4.4 out