Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
373
Tracked models
34
Providers
310
Benchmarked
15.4
Avg. index
373 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 claude-fable-5 multimodalvisionmulti-input reasoning | Anthropic | 84.2 Programming | 69.5 | 58.6 | 0.0 | 84.2 | 1.9 | $10 in / $50 out |
| 2 | Claude Mythos Preview claude-mythos-preview multimodalvisionmulti-input reasoning | Anthropic | 83.0 Programming | 79.5 | 0.0 | 64.8 | 83.0 | 0.0 | |
| 3 | Claude Opus 4.8 claude-opus-4-8 multimodalvisionmulti-input reasoning | Anthropic | 81.8 Programming | 72.5 | 26.7 | 68.7 | 81.8 | 9.5 | |
| 4 | Claude Opus 4.7 claude-opus-4-7 multimodalvisionmulti-input reasoning | Anthropic | 77.5 Programming | 74.3 | 26.7 | 52.9 | 77.5 | 9.5 | |
| 5 | Claude Sonnet 5 claude-sonnet-5 multimodalvisionmulti-input reasoning | Anthropic | 75.5 Programming | 64.0 | 26.7 | 53.4 | 75.5 | 21.6 | |
| 6 | Claude Sonnet 4.5 claude-sonnet-4-5-20250929 multimodalvisionmulti-input reasoning | Anthropic | 74.6 Programming | 50.7 | 11.6 | 69.9 | 74.6 | 12.6 | |
| 7 | Qwen3.7 Max qwen3.7-max multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 74.4 Programming | 64.0 | 58.6 | 48.0 | 74.4 | 40.8 | $1.25 in / $3.75 out |
| 8 | GPT-5.6 Sol gpt-5.6-sol multimodalvisionmulti-input reasoning | OpenAI | 72.7 Programming | 77.6 | 95.2 | 63.1 | 72.7 | 5.8 | $5 in / $30 out |
| 9 | Claude Opus 4.5 claude-opus-4-5-20251101 multimodalvisionmulti-input reasoning | Anthropic | 72.5 Programming | 52.6 | 0.0 | 34.2 | 72.5 | 0.0 | |
| 10 | Qwen3.8 Max qwen3.8-max multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 72.0 Programming | 70.3 | 81.9 | 62.7 | 72.0 | 35.0 | $1.65 in / $4.951 out |
| 11 | Claude Opus 4.6 claude-opus-4-6 multimodalvisionmulti-input reasoning | Anthropic | 71.9 Programming | 72.2 | 26.7 | 48.8 | 71.9 | 9.5 | |
| 12 | Hy4 preview hy4-preview codeprogrammingtool use | Tencent | 70.6 Programming | 67.2 | 0.0 | 70.3 | 70.6 | 0.0 | N/A |
| 13 | Kimi K2.6 kimi-k2.6 texttext-to-textlanguage | Moonshot AI | 70.0 Programming | 61.8 | 30.5 | 40.9 | 70.0 | 44.7 | |
| 14 | GPT-5.6 Terra gpt-5.6-terra multimodalvisionmulti-input reasoning | OpenAI | 69.3 Programming | 72.5 | 95.2 | 54.6 | 69.3 | 21.4 | |
| 15 | Grok 4.5 grok-4.5 multimodalvisionmulti-input reasoning | xAI | 69.2 Programming | 69.1 | 37.9 | 0.0 | 69.2 | 33.5 | $2 in / $6 out |
| 16 | MiniMax M3 minimax-m3 multimodalvisionmulti-input reasoning | MiniMax | 66.5 Programming | 50.1 | 58.6 | 34.9 | 66.5 | 65.0 | $0.3 in / $1.2 out |
| 17 | GPT-5.2 gpt-5.2-2025-12-11 multimodalvisionmulti-input reasoning | OpenAI | 66.3 Programming | 69.8 | 58.9 | 34.3 | 66.3 | 28.7 | |
| 18 | Claude Sonnet 4.6 claude-sonnet-4-6 multimodalvisionmulti-input reasoning | Anthropic | 65.8 Programming | 61.6 | 11.6 | 40.3 | 65.8 | 12.6 | |
| 19 | GPT-5.6 Luna gpt-5.6-luna multimodalvisionmulti-input reasoning | OpenAI | 65.8 Programming | 62.7 | 95.2 | 48.5 | 65.8 | 70.4 | |
| 20 | Gemini 3.1 Pro gemini-3.1-pro-preview multimodalvisionmulti-input reasoning | Google | 62.9 Programming | 70.5 | 57.5 | 46.2 | 62.9 | 21.9 |
Claude Fable 5
Anthropic
84.2
$10 in / $50 out
Claude Mythos Preview
Anthropic
83.0
N/A
Claude Opus 4.8
Anthropic
81.8
$5 in / $25 out
Page 1 of 19 · 373 models
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| N/A |
| $5 in / $25 out |
| $5 in / $25 out |
| $2 in / $10 out |
| $3 in / $15 out |
| N/A |
| $5 in / $25 out |
| $0.75 in / $3.5 out |
| $2 in / $12 out |
| $1.75 in / $14 out |
| $3 in / $15 out |
| $0.2 in / $1.2 out |
| $2.5 in / $15 out |
Claude Opus 4.7
Anthropic
77.5
$5 in / $25 out
Claude Sonnet 5
Anthropic
75.5
$2 in / $10 out
Claude Sonnet 4.5
Anthropic
74.6
$3 in / $15 out
Qwen3.7 Max
Alibaba Cloud / Qwen Team
74.4
$1.25 in / $3.75 out
GPT-5.6 Sol
OpenAI
72.7
$5 in / $30 out
Claude Opus 4.5
Anthropic
72.5
N/A
Qwen3.8 Max
Alibaba Cloud / Qwen Team
72.0
$1.65 in / $4.951 out
Claude Opus 4.6
Anthropic
71.9
$5 in / $25 out
Hy4 preview
Tencent
70.6
N/A
GPT-5.6 Terra
OpenAI
69.3
$2 in / $12 out
Grok 4.5
xAI
69.2
$2 in / $6 out
MiniMax M3
MiniMax
66.5
$0.3 in / $1.2 out
GPT-5.2
OpenAI
66.3
$1.75 in / $14 out
Claude Sonnet 4.6
Anthropic
65.8
$3 in / $15 out
GPT-5.6 Luna
OpenAI
65.8
$0.2 in / $1.2 out
Gemini 3.1 Pro
62.9
$2.5 in / $15 out