Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
13.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 41 | Step-3.5-Flash step-3.5-flash codeprogrammingtool use | StepFun | 59.8 Inference | 62.8 | 59.8 | 36.5 | 48.6 | 93.9 | $0.1 in / $0.4 out |
| 42 | Gemini 3.1 Pro gemini-3.1-pro-preview multimodalvisionmulti-input reasoning | Google | 58.3 Inference | 72.3 | 58.3 | 52.6 | 60.9 | 22.7 | |
| 43 | Claude Haiku 4.5 claude-haiku-4-5-20251001 multimodalvisionmulti-input reasoning | Anthropic | 53.3 Inference | 30.8 | 53.3 | 50.8 | 53.9 | 45.6 | |
| 44 | DeepSeek-V3.2 (Non-thinking) deepseek-chat textinference | DeepSeek | 52.0 Inference | 0.0 | 52.0 | 0.0 | 0.0 | 82.7 | $0.28 in / $0.42 out |
| 45 | Gemini 2.5 Pro gemini-2.5-pro multimodalvisionmulti-input reasoning | Google | 51.0 Inference | 42.5 | 51.0 | 0.0 | 21.4 | 29.8 | |
| 46 | GPT-4 Turbo gpt-4-turbo-2024-04-09 textinference | OpenAI | 50.2 Inference | 15.5 | 50.2 | 0.0 | 0.0 | 15.4 | $10 in / $30 out |
| 47 | GPT-5.3 Chat gpt-5.3-chat-latest multimodalvisionmulti-input reasoning | OpenAI | 50.2 Inference | 0.0 | 50.2 | 0.0 | 0.0 | 31.5 | |
| 48 | Grok-3 grok-3 multimodalvisionmulti-input reasoning | xAI | 50.2 Inference | 58.4 | 50.2 | 0.0 | 0.0 | 24.1 | $3 in / $15 out |
| 49 | GPT-5.1 Medium gpt-5.1-medium-2025-11-12 multimodalvisionmulti-input reasoning | OpenAI | 44.9 Inference | 64.1 | 44.9 | 0.0 | 0.0 | 32.0 | |
| 50 | GPT-5.4 Mini gpt-5.4-mini texttext-to-textlanguage | OpenAI | 44.5 Inference | 51.1 | 44.5 | 15.0 | 20.0 | 42.7 | |
| 51 | GPT-5.4 nano gpt-5.4-nano multimodalvisionmulti-input reasoning | OpenAI | 44.5 Inference | 41.8 | 44.5 | 6.9 | 8.2 | 76.8 | $0.2 in / $1.25 out |
| 52 | GPT-4o gpt-4o-2024-08-06 multimodalvisionmulti-input reasoning | OpenAI | 39.6 Inference | 29.1 | 39.6 | 14.9 | 3.7 | 31.2 | |
| 53 | Grok 4.5 grok-4.5 multimodalvisionmulti-input reasoning | xAI | 38.2 Inference | 69.3 | 38.2 | 0.0 | 70.8 | 35.6 | $2 in / $6 out |
| 54 | GPT-4o gpt-4o-2024-05-13 multimodalvisionmulti-input reasoning | OpenAI | 38.0 Inference | 20.5 | 38.0 | 0.0 | 0.0 | 30.7 | |
| 55 | GPT-5.4 gpt-5.4 texttext-to-textlanguage | OpenAI | 37.2 Inference | 70.5 | 37.2 | 48.9 | 50.3 | 18.5 | |
| 56 | Gemma 4 26B-A4B gemma-4-26b-a4b-it multimodalvisionmulti-input reasoning | Google | 32.9 Inference | 43.8 | 32.9 | 0.0 | 0.0 | 90.2 | |
| 57 | Gemma 4 31B gemma-4-31b-it multimodalvisionmulti-input reasoning | Google | 32.9 Inference | 55.4 | 32.9 | 0.0 | 0.0 | 91.5 | |
| 58 | Kimi K2.6 kimi-k2.6 texttext-to-textlanguage | Moonshot AI | 32.9 Inference | 63.5 | 32.9 | 47.2 | 69.4 | 46.3 | |
| 59 | Kimi K2.7 Code kimi-k2.7-code multimodalvisionmulti-input reasoning | Moonshot AI | 32.9 Inference | 0.0 | 32.9 | 47.2 | 0.0 | 47.6 | |
| 60 | Nemotron 3 Nano (30B A3B) nemotron-3-nano-30b-a3b codeprogrammingtool use | NVIDIA | 32.9 Inference | 43.6 | 32.9 | 3.0 | 3.8 | 100.0 | $0.06 in / $0.24 out |
Step-3.5-Flash
StepFun
59.8
$0.1 in / $0.4 out
Gemini 3.1 Pro
58.3
$2.5 in / $15 out
Claude Haiku 4.5
Anthropic
53.3
$1 in / $5 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $2.5 in / $15 out |
| $1 in / $5 out |
| $1.25 in / $10 out |
| $1.75 in / $14 out |
| $1.25 in / $10 out |
| $0.75 in / $4.5 out |
| $2.5 in / $10 out |
| $2.5 in / $10 out |
| $2.5 in / $15 out |
| $0.13 in / $0.4 out |
| $0.13 in / $0.38 out |
| $0.75 in / $3.5 out |
| $0.74 in / $3.5 out |
DeepSeek-V3.2 (Non-thinking)
DeepSeek
52.0
$0.28 in / $0.42 out
Gemini 2.5 Pro
51.0
$1.25 in / $10 out
GPT-4 Turbo
OpenAI
50.2
$10 in / $30 out
GPT-5.3 Chat
OpenAI
50.2
$1.75 in / $14 out
Grok-3
xAI
50.2
$3 in / $15 out
GPT-5.1 Medium
OpenAI
44.9
$1.25 in / $10 out
GPT-5.4 nano
OpenAI
44.5
$0.2 in / $1.25 out
GPT-4o
OpenAI
39.6
$2.5 in / $10 out
Grok 4.5
xAI
38.2
$2 in / $6 out
GPT-4o
OpenAI
38.0
$2.5 in / $10 out
Gemma 4 26B-A4B
32.9
$0.13 in / $0.4 out
Gemma 4 31B
32.9
$0.13 in / $0.38 out
Kimi K2.7 Code
Moonshot AI
32.9
$0.74 in / $3.5 out
Nemotron 3 Nano (30B A3B)
NVIDIA
32.9
$0.06 in / $0.24 out