Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
15.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 101 | LongCat-Flash-Thinking longcat-flash-thinking codeprogrammingtool use | Meituan | 18.4 Programming | 48.2 | 0.0 | 0.0 | 18.4 | 0.0 | N/A |
| 102 | GLM-4.7-Flash glm-4.7-flash codeprogrammingtool use | Zhipu AI | 17.7 Programming | 36.4 | 0.0 | 9.0 | 17.7 | 0.0 | N/A |
| 103 | Gemini 3.5 Flash-Lite gemini-3.5-flash-lite multimodalvisionmulti-input reasoning | Google | 17.2 Programming | 18.9 | 84.8 | 0.0 | 17.2 | 59.1 | |
| 104 | Kimi K2-Instruct-0905 kimi-k2-instruct-0905 codeprogrammingtool use | Moonshot AI | 17.1 Programming | 23.2 | 0.0 | 6.0 | 17.1 | 0.0 | |
| 105 | MiniMax M1 80K minimax-m1-80k codeprogrammingtool use | MiniMax | 16.2 Programming | 22.8 | 0.0 | 20.9 | 16.2 | 0.0 | N/A |
| 106 | GLM-4.5-Air glm-4.5-air codeprogrammingtool use | Zhipu AI | 16.0 Programming | 25.7 | 0.0 | 24.2 | 16.0 | 0.0 | N/A |
| 107 | MiniMax M1 40K minimax-m1-40k codeprogrammingtool use | MiniMax | 15.5 Programming | 21.3 | 0.0 | 26.8 | 15.5 | 0.0 | N/A |
| 108 | Command A+ command-a-plus-05-2026 multimodalvisionmulti-input reasoning | Cohere | 15.3 Programming | 35.2 | 0.0 | 0.0 | 15.3 | 0.0 | |
| 109 | Mercury 2 mercury-2 codeprogrammingtool use | Inception | 15.3 Programming | 42.7 | 68.9 | 0.0 | 15.3 | 84.4 | $0.25 in / $0.75 out |
| 110 | GPT-4.1 gpt-4.1-2025-04-14 multimodalvisionmulti-input reasoning | OpenAI | 14.7 Programming | 27.2 | 73.2 | 32.8 | 14.7 | 40.7 | |
| 111 | Kimi K2 Instruct kimi-k2-instruct codeprogrammingtool use | Moonshot AI | 14.0 Programming | 23.2 | 0.0 | 13.5 | 14.0 | 0.0 | N/A |
| 112 | GPT-5 nano gpt-5-nano-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 13.3 Programming | 25.2 | 0.0 | 0.0 | 13.3 | 0.0 | |
| 113 | Devstral Small 1.1 devstral-small-2507 codeprogrammingtool use | Mistral AI | 12.5 Programming | 0.0 | 0.0 | 0.0 | 12.5 | 0.0 | |
| 114 | o3-mini o3-mini codeprogrammingtool use | OpenAI | 11.6 Programming | 25.3 | 0.0 | 11.9 | 11.6 | 0.0 | N/A |
| 115 | Claude 3.5 Sonnet claude-3-5-sonnet-20241022 multimodalvisionmulti-input reasoning | Anthropic | 11.1 Programming | 32.0 | 0.0 | 38.7 | 11.1 | 0.0 | |
| 116 | Sarvam-105B sarvam-105b codeprogrammingtool use | Sarvam AI | 10.3 Programming | 41.1 | 0.0 | 16.7 | 10.3 | 0.0 | N/A |
| 117 | DeepSeek-V3 deepseek-v3 codeprogrammingtool use | DeepSeek | 8.8 Programming | 26.1 | 0.0 | 0.0 | 8.8 | 0.0 | N/A |
| 118 | GPT-5.4 nano gpt-5.4-nano multimodalvisionmulti-input reasoning | OpenAI | 8.2 Programming | 41.8 | 44.5 | 6.9 | 8.2 | 76.8 | $0.2 in / $1.25 out |
| 119 | o1-preview o1-preview codeprogrammingtool use | OpenAI | 8.1 Programming | 40.2 | 0.0 | 0.0 | 8.1 | 0.0 | N/A |
| 120 | Claude 3.5 Haiku claude-3-5-haiku-20241022 codeprogrammingtool use | Anthropic | 6.6 Programming | 9.9 | 0.0 | 3.0 | 6.6 | 0.0 |
LongCat-Flash-Thinking
Meituan
18.4
N/A
GLM-4.7-Flash
Zhipu AI
17.7
N/A
Gemini 3.5 Flash-Lite
17.2
$0.3 in / $2.5 out
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $0.3 in / $2.5 out |
| N/A |
| N/A |
| $2 in / $8 out |
| N/A |
| N/A |
| N/A |
| N/A |
Kimi K2-Instruct-0905
Moonshot AI
17.1
N/A
MiniMax M1 80K
MiniMax
16.2
N/A
GLM-4.5-Air
Zhipu AI
16.0
N/A
MiniMax M1 40K
MiniMax
15.5
N/A
Command A+
Cohere
15.3
N/A
Mercury 2
Inception
15.3
$0.25 in / $0.75 out
GPT-4.1
OpenAI
14.7
$2 in / $8 out
Kimi K2 Instruct
Moonshot AI
14.0
N/A
GPT-5 nano
OpenAI
13.3
N/A
Devstral Small 1.1
Mistral AI
12.5
N/A
o3-mini
OpenAI
11.6
N/A
Claude 3.5 Sonnet
Anthropic
11.1
N/A
Sarvam-105B
Sarvam AI
10.3
N/A
DeepSeek-V3
DeepSeek
8.8
N/A
GPT-5.4 nano
OpenAI
8.2
$0.2 in / $1.25 out
o1-preview
OpenAI
8.1
N/A
Claude 3.5 Haiku
Anthropic
6.6
N/A