Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
13.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 21 | MiniMax M2.1 minimax-m2.1 codeprogrammingtool use | MiniMax | 68.9 Inference | 39.1 | 68.9 | 45.7 | 47.6 | 72.9 | $0.3 in / $1.2 out |
| 22 | MiniMax M2.5 minimax-m2.5 codeprogrammingtool use | MiniMax | 68.9 Inference | 0.0 | 68.9 | 43.6 | 50.4 | 72.9 | $0.3 in / $1.2 out |
| 23 | Grok-4.1 Fast Non-Reasoning grok-4-1-fast-non-reasoning multimodalvisionmulti-input reasoning | xAI | 63.0 Inference | 0.0 | 63.0 | 0.0 | 0.0 | 77.3 | |
| 24 | Grok-4.1 Fast Reasoning grok-4-1-fast-reasoning multimodalvisionmulti-input reasoning | xAI | 63.0 Inference | 0.0 | 63.0 | 0.0 | 0.0 | 77.3 | |
| 25 | Grok-4 Fast Reasoning grok-4-fast-reasoning multimodalvisionmulti-input reasoning | xAI | 63.0 Inference | 0.0 | 63.0 | 0.0 | 0.0 | 77.3 | |
| 26 | Claude Fable 5 claude-fable-5 multimodalvisionmulti-input reasoning | Anthropic | 62.8 Inference | 70.8 | 62.8 | 0.0 | 84.2 | 0.0 | |
| 27 | Gemini 3.1 Flash-Lite gemini-3.1-flash-lite-preview multimodalvisionmulti-input reasoning | Google | 62.8 Inference | 52.6 | 62.8 | 0.0 | 0.0 | 67.1 | |
| 28 | Gemini 3 Flash gemini-3-flash-preview multimodalvisionmulti-input reasoning | Google | 62.8 Inference | 68.5 | 62.8 | 33.2 | 61.9 | 54.9 | |
| 29 | GPT-5.1 gpt-5.1-2025-11-13 multimodalvisionmulti-input reasoning | OpenAI | 62.8 Inference | 62.4 | 62.8 | 0.0 | 51.4 | 37.3 | |
| 30 | GPT-5.1 Instant gpt-5.1-instant-2025-11-12 multimodalvisionmulti-input reasoning | OpenAI | 62.8 Inference | 62.4 | 62.8 | 0.0 | 51.4 | 37.3 | |
| 31 | GPT-5.2 gpt-5.2-2025-12-11 multimodalvisionmulti-input reasoning | OpenAI | 62.8 Inference | 70.9 | 62.8 | 37.0 | 66.3 | 31.5 | |
| 32 | GPT-5.5 Instant gpt-5.5-instant multimodalvisionmulti-input reasoning | OpenAI | 62.8 Inference | 49.5 | 62.8 | 0.0 | 0.0 | 17.3 | |
| 33 | Grok 4.3 grok-4.3 textinference | xAI | 62.8 Inference | 0.0 | 62.8 | 0.0 | 0.0 | 52.4 | $1.25 in / $2.5 out |
| 34 | MiniMax M2 minimax-m2 codeprogrammingtool use | MiniMax | 62.8 Inference | 29.8 | 62.8 | 40.2 | 40.0 | 73.2 | $0.3 in / $1.2 out |
| 35 | MiniMax M3 minimax-m3 multimodalvisionmulti-input reasoning | MiniMax | 62.8 Inference | 49.6 | 62.8 | 37.5 | 68.3 | 73.2 | $0.3 in / $1.2 out |
| 36 | Nova 2 Lite nova-2-lite multimodalvisionmulti-input reasoning | Amazon | 62.8 Inference | 41.1 | 62.8 | 13.0 | 26.0 | 59.1 | $0.3 in / $2.5 out |
| 37 | Nova 2 Sonic nova-2-sonic multimodalvisionmulti-input reasoning | Amazon | 62.8 Inference | 0.0 | 62.8 | 0.0 | 0.0 | 57.3 | $0.33 in / $2.75 out |
| 38 | Qwen3.6 Plus qwen3.6-plus multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 62.8 Inference | 66.9 | 62.8 | 33.6 | 52.8 | 54.9 | $0.5 in / $3 out |
| 39 | Qwen3.7 Max qwen3.7-max multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 62.8 Inference | 64.7 | 62.8 | 49.6 | 74.2 | 43.9 | $1.25 in / $3.75 out |
| 40 | Qwen3.7-Plus qwen3.7-plus multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 62.8 Inference | 62.9 | 62.8 | 48.1 | 61.1 | 69.5 | $0.32 in / $1.28 out |
MiniMax M2.1
MiniMax
68.9
$0.3 in / $1.2 out
MiniMax M2.5
MiniMax
68.9
$0.3 in / $1.2 out
Grok-4.1 Fast Non-Reasoning
xAI
63.0
$0.2 in / $0.5 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $0.2 in / $0.5 out |
| $0.2 in / $0.5 out |
| $0.2 in / $0.5 out |
| $10 in / $50 out |
| $0.25 in / $1.5 out |
| $0.5 in / $3 out |
| $1.25 in / $10 out |
| $1.25 in / $10 out |
| $1.75 in / $14 out |
| $5 in / $30 out |
Grok-4.1 Fast Reasoning
xAI
63.0
$0.2 in / $0.5 out
Grok-4 Fast Reasoning
xAI
63.0
$0.2 in / $0.5 out
Claude Fable 5
Anthropic
62.8
$10 in / $50 out
Gemini 3.1 Flash-Lite
62.8
$0.25 in / $1.5 out
Gemini 3 Flash
62.8
$0.5 in / $3 out
GPT-5.1
OpenAI
62.8
$1.25 in / $10 out
GPT-5.1 Instant
OpenAI
62.8
$1.25 in / $10 out
GPT-5.2
OpenAI
62.8
$1.75 in / $14 out
GPT-5.5 Instant
OpenAI
62.8
$5 in / $30 out
Grok 4.3
xAI
62.8
$1.25 in / $2.5 out
MiniMax M2
MiniMax
62.8
$0.3 in / $1.2 out
MiniMax M3
MiniMax
62.8
$0.3 in / $1.2 out
Nova 2 Lite
Amazon
62.8
$0.3 in / $2.5 out
Nova 2 Sonic
Amazon
62.8
$0.33 in / $2.75 out
Qwen3.6 Plus
Alibaba Cloud / Qwen Team
62.8
$0.5 in / $3 out
Qwen3.7 Max
Alibaba Cloud / Qwen Team
62.8
$1.25 in / $3.75 out
Qwen3.7-Plus
Alibaba Cloud / Qwen Team
62.8
$0.32 in / $1.28 out