Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
29.3
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 61 | GPT OSS 20B High gpt-oss-20b-high textinference | OpenAI | 52.3 overall | 52.3 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 62 | Seed 2.0 Lite seed-2.0-lite multimodalvisionmulti-input reasoning | ByteDance | 51.9 overall | 56.5 | 0.0 | 0.0 | 46.1 | 0.0 | N/A |
| 63 | Seed 2.0 Pro seed-2.0-pro multimodalvisionmulti-input reasoning | ByteDance | 51.0 overall | 66.8 | 23.2 | 44.8 | 56.0 | 54.9 | $0.5 in / $3 out |
| 64 | Grok-3 Mini grok-3-mini multimodalvisionmulti-input reasoning | xAI | 51.0 overall | 51.0 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 65 | MiMo-V2-Omni mimo-v2-omni multimodalvisionmulti-input reasoning | Xiaomi | 50.9 overall | 0.0 | 0.0 | 0.0 | 50.9 | 0.0 | N/A |
| 66 | Claude Sonnet 4.5 claude-sonnet-4-5-20250929 multimodalvisionmulti-input reasoning | Anthropic | 50.8 overall | 51.4 | 12.6 | 69.9 | 74.6 | 12.0 | |
| 67 | MiniMax M2.1 minimax-m2.1 codeprogrammingtool use | MiniMax | 50.7 overall | 39.1 | 68.9 | 45.7 | 47.6 | 72.9 | $0.3 in / $1.2 out |
| 68 | Nova 2 Pro nova-2-pro multimodalvisionmulti-input reasoning | Amazon | 50.4 overall | 45.3 | 0.0 | 57.2 | 49.6 | 0.0 | N/A |
| 69 | GPT-5.4 gpt-5.4 texttext-to-textlanguage | OpenAI | 50.3 overall | 70.5 | 37.2 | 48.9 | 50.3 | 18.5 | |
| 70 | Kimi K2.5 kimi-k2.5 multimodalvisionmulti-input reasoning | Moonshot AI | 49.8 overall | 63.7 | 0.0 | 41.0 | 41.8 | 0.0 | N/A |
| 71 | GPT-5 Codex gpt-5-codex-2025-09-15 codeprogrammingtool use | OpenAI | 49.8 overall | 0.0 | 0.0 | 0.0 | 49.8 | 0.0 | N/A |
| 72 | Grok-3 grok-3 multimodalvisionmulti-input reasoning | xAI | 49.6 overall | 58.4 | 50.2 | 0.0 | 0.0 | 24.1 | $3 in / $15 out |
| 73 | Gemma 4 26B-A4B gemma-4-26b-a4b-it multimodalvisionmulti-input reasoning | Google | 49.2 overall | 43.8 | 32.9 | 0.0 | 0.0 | 90.2 | |
| 74 | Grok-4 grok-4 multimodalvisionmulti-input reasoning | xAI | 49.1 overall | 49.1 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
| 75 | GLM-5V-Turbo glm-5v-turbo multimodalvisionmulti-input reasoning | Zhipu AI | 49.1 overall | 0.0 | 0.0 | 49.1 | 0.0 | 0.0 | N/A |
| 76 | Qwen3.5-122B-A10B qwen3.5-122b-a10b multimodalvisionmulti-input reasoning | Alibaba Cloud / Qwen Team | 48.8 overall | 60.5 | 0.0 | 44.6 | 38.3 | 0.0 | N/A |
| 77 | MAI-Thinking-1 mai-thinking-1 codeprogrammingtool use | Microsoft | 47.8 overall | 60.1 | 0.0 | 0.0 | 32.2 | 0.0 | N/A |
| 78 | GPT-5.5 Instant gpt-5.5-instant multimodalvisionmulti-input reasoning | OpenAI | 47.5 overall | 49.5 | 62.8 | 0.0 | 0.0 | 17.3 | |
| 79 | GPT-5.1 Codex gpt-5.1-codex multimodalvisionmulti-input reasoning | OpenAI | 47.2 overall | 0.0 | 0.0 | 0.0 | 47.2 | 0.0 | N/A |
| 80 | Step3-VL-10B step3-vl-10b multimodalvisionmulti-input reasoning | StepFun | 46.9 overall | 46.9 | 0.0 | 0.0 | 0.0 | 0.0 | N/A |
GPT OSS 20B High
OpenAI
52.3
N/A
Seed 2.0 Lite
ByteDance
51.9
N/A
Seed 2.0 Pro
ByteDance
51.0
$0.5 in / $3 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $3 in / $15 out |
| $2.5 in / $15 out |
| $0.13 in / $0.4 out |
| $5 in / $30 out |
Grok-3 Mini
xAI
51.0
N/A
MiMo-V2-Omni
Xiaomi
50.9
N/A
Claude Sonnet 4.5
Anthropic
50.8
$3 in / $15 out
MiniMax M2.1
MiniMax
50.7
$0.3 in / $1.2 out
Nova 2 Pro
Amazon
50.4
N/A
Kimi K2.5
Moonshot AI
49.8
N/A
GPT-5 Codex
OpenAI
49.8
N/A
Grok-3
xAI
49.6
$3 in / $15 out
Gemma 4 26B-A4B
49.2
$0.13 in / $0.4 out
Grok-4
xAI
49.1
N/A
GLM-5V-Turbo
Zhipu AI
49.1
N/A
Qwen3.5-122B-A10B
Alibaba Cloud / Qwen Team
48.8
N/A
MAI-Thinking-1
Microsoft
47.8
N/A
GPT-5.5 Instant
OpenAI
47.5
$5 in / $30 out
GPT-5.1 Codex
OpenAI
47.2
N/A
Step3-VL-10B
StepFun
46.9
N/A