Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
13.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 61 | Qwen3.5-27B qwen3.5-27b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 32.9 Inference | 57.8 | 32.9 | 41.3 | 39.1 | 61.0 | $0.3 in / $2.4 out |
| 62 | Qwen3.6-27B qwen3.6-27b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 32.9 Inference | 54.7 | 32.9 | 0.0 | 39.4 | 49.4 | $0.6 in / $3.6 out |
| 63 | Qwen3 VL 4B Instruct qwen3-vl-4b-instruct multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 32.9 Inference | 18.2 | 32.9 | 17.7 | 0.0 | 85.4 | |
| 64 | Qwen3 VL 4B Thinking qwen3-vl-4b-thinking multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 32.9 Inference | 20.2 | 32.9 | 17.0 | 0.0 | 79.3 | |
| 65 | GPT-5.2 Codex gpt-5.2-codex multimodalvisionmulti-input reasoning | OpenAI | 31.1 Inference | 0.0 | 31.1 | 0.0 | 30.9 | 22.0 | |
| 66 | GPT-5.3 Codex gpt-5.3-codex texttext-to-textcoding | OpenAI | 31.1 Inference | 0.0 | 31.1 | 0.0 | 34.5 | 22.0 | |
| 67 | GPT-3.5 Turbo gpt-3.5-turbo-0125 multimodalvisionmulti-input reasoning | OpenAI | 30.1 Inference | 2.3 | 30.1 | 0.0 | 0.0 | 60.7 | |
| 68 | Claude Opus 4.6 claude-opus-4-6 multimodalvisionmulti-input reasoning | Anthropic | 28.3 Inference | 74.6 | 28.3 | 49.8 | 71.5 | 8.0 | |
| 69 | Claude Opus 4.7 claude-opus-4-7 multimodalvisionmulti-input reasoning | Anthropic | 28.3 Inference | 75.1 | 28.3 | 54.2 | 77.9 | 8.0 | |
| 70 | Claude Opus 4.8 claude-opus-4-8 multimodalvisionmulti-input reasoning | Anthropic | 28.3 Inference | 74.4 | 28.3 | 74.5 | 81.3 | 8.0 | |
| 71 | Claude Sonnet 5 claude-sonnet-5 multimodalvisionmulti-input reasoning | Anthropic | 28.3 Inference | 67.5 | 28.3 | 60.7 | 75.4 | 12.0 | |
| 72 | Grok Code Fast 1 grok-code-fast-1 codeprogrammingtool use | xAI | 27.2 Inference | 0.0 | 27.2 | 0.0 | 36.1 | 60.5 | $0.2 in / $1.5 out |
| 73 | Qwen3 30B A3B qwen3-30b-a3b textinference | Alibaba Cloud / Qwen Team | 26.6 Inference | 23.7 | 26.6 | 0.0 | 0.0 | 78.5 | $0.1 in / $0.44 out |
| 74 | Mistral Medium 3.5 mistral-medium-3-5 multimodalvisionmulti-input reasoning | Mistral AI | 23.2 Inference | 34.6 | 23.2 | 15.4 | 59.0 | 34.8 | |
| 75 | Mistral Small 4 mistral-small-latest multimodalvisionmulti-input reasoning | Mistral AI | 23.2 Inference | 31.3 | 23.2 | 0.0 | 0.0 | 81.7 | |
| 76 | Seed 2.0 Pro seed-2.0-pro multimodalvisionmulti-input reasoning | ByteDance | 23.2 Inference | 66.8 | 23.2 | 44.8 | 56.0 | 54.9 | $0.5 in / $3 out |
| 77 | Mistral Large 3 (675B Instruct 2512) mistral-large-latest multimodalvisionmulti-input reasoning | Mistral AI | 22.0 Inference | 21.9 | 22.0 | 0.0 | 0.0 | 55.6 | |
| 78 | MiniMax M2.7 minimax-m2.7 codeprogrammingtool use | MiniMax | 19.5 Inference | 0.0 | 19.5 | 26.3 | 29.0 | 73.2 | $0.3 in / $1.2 out |
| 79 | GLM-5.1 glm-5.1 codeprogrammingtool use | Zhipu AI | 15.9 Inference | 62.6 | 15.9 | 35.2 | 47.2 | 40.2 | $1.4 in / $4.4 out |
| 80 | Claude Sonnet 4.5 claude-sonnet-4-5-20250929 multimodalvisionmulti-input reasoning | Anthropic | 12.6 Inference | 51.4 | 12.6 | 69.9 | 74.6 | 12.0 |
Qwen3.5-27B
Alibaba Cloud / Qwen Team
32.9
$0.3 in / $2.4 out
Qwen3.6-27B
Alibaba Cloud / Qwen Team
32.9
$0.6 in / $3.6 out
Qwen3 VL 4B Instruct
Alibaba Cloud / Qwen Team
32.9
$0.1 in / $0.6 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $0.1 in / $0.6 out |
| $0.1 in / $1 out |
| $1.75 in / $14 out |
| $1.75 in / $14 out |
| $0.5 in / $1.5 out |
| $5 in / $25 out |
| $5 in / $25 out |
| $5 in / $25 out |
| $3 in / $15 out |
| $1.5 in / $7.5 out |
| $0.15 in / $0.6 out |
| $0.5 in / $1.5 out |
| $3 in / $15 out |
Qwen3 VL 4B Thinking
Alibaba Cloud / Qwen Team
32.9
$0.1 in / $1 out
GPT-5.2 Codex
OpenAI
31.1
$1.75 in / $14 out
GPT-3.5 Turbo
OpenAI
30.1
$0.5 in / $1.5 out
Claude Opus 4.6
Anthropic
28.3
$5 in / $25 out
Claude Opus 4.7
Anthropic
28.3
$5 in / $25 out
Claude Opus 4.8
Anthropic
28.3
$5 in / $25 out
Claude Sonnet 5
Anthropic
28.3
$3 in / $15 out
Grok Code Fast 1
xAI
27.2
$0.2 in / $1.5 out
Qwen3 30B A3B
Alibaba Cloud / Qwen Team
26.6
$0.1 in / $0.44 out
Mistral Medium 3.5
Mistral AI
23.2
$1.5 in / $7.5 out
Mistral Small 4
Mistral AI
23.2
$0.15 in / $0.6 out
Seed 2.0 Pro
ByteDance
23.2
$0.5 in / $3 out
Mistral Large 3 (675B Instruct 2512)
Mistral AI
22.0
$0.5 in / $1.5 out
MiniMax M2.7
MiniMax
19.5
$0.3 in / $1.2 out
GLM-5.1
Zhipu AI
15.9
$1.4 in / $4.4 out
Claude Sonnet 4.5
Anthropic
12.6
$3 in / $15 out