Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.
334
Tracked models
29
Providers
286
Benchmarked
13.1
Avg. index
334 models
| Rank | Model | Provider | Score | Benchmarks | Inference | Agentic | Programming | Value | Price |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.5 gpt-5.5 multimodalvisionmulti-input reasoning | OpenAI | 94.5 Inference | 76.7 | 94.5 | 61.0 | 51.2 | 3.7 | $5 in / $30 out |
| 2 | GPT-5.6 Luna gpt-5.6-luna multimodalvisionmulti-input reasoning | OpenAI | 94.5 Inference | 63.9 | 94.5 | 55.0 | 65.5 | 37.8 | |
| 3 | GPT-5.6 Sol gpt-5.6-sol multimodalvisionmulti-input reasoning | OpenAI | 94.5 Inference | 79.8 | 94.5 | 71.4 | 73.7 | 3.7 | |
| 4 | GPT-5.6 Terra gpt-5.6-terra multimodalvisionmulti-input reasoning | OpenAI | 94.5 Inference | 74.6 | 94.5 | 61.5 | 69.6 | 17.1 | |
| 5 | GPT-4.1 nano gpt-4.1-nano-2025-04-14 multimodalvisionmulti-input reasoning | OpenAI | 87.8 Inference | 11.6 | 87.8 | 0.0 | 0.0 | 94.9 | |
| 6 | DeepSeek-V4-Flash-Max deepseek-v4-flash-max codeprogrammingtool use | DeepSeek | 84.8 Inference | 56.2 | 84.8 | 35.3 | 41.4 | 98.8 | |
| 7 | DeepSeek-V4-Pro-Max deepseek-v4-pro-max codeprogrammingtool use | DeepSeek | 84.8 Inference | 64.9 | 84.8 | 51.0 | 52.0 | 45.1 | |
| 8 | Gemini 3.5 Flash gemini-3.5-flash multimodalvisionmulti-input reasoning | Google | 84.8 Inference | 60.2 | 84.8 | 67.3 | 21.8 | 31.7 | |
| 9 | Gemini 3.5 Flash-Lite gemini-3.5-flash-lite multimodalvisionmulti-input reasoning | Google | 84.8 Inference | 18.9 | 84.8 | 0.0 | 17.2 | 59.1 | |
| 10 | Gemini 3.6 Flash gemini-3.6-flash multimodalvisionmulti-input reasoning | Google | 84.8 Inference | 57.8 | 84.8 | 0.0 | 52.6 | 34.8 | |
| 11 | GLM-5.2 glm-5.2 codeprogrammingtool use | Zhipu AI | 84.8 Inference | 68.7 | 84.8 | 44.1 | 59.9 | 51.2 | $0.95 in / $3 out |
| 12 | Kimi K3 kimi-k3 multimodalvisionmulti-input reasoning | Moonshot AI | 84.8 Inference | 76.1 | 84.8 | 84.2 | 0.0 | 12.2 | $3 in / $15 out |
| 13 | MiMo-V2.5 mimo-v2.5 multimodalvisionmulti-input reasoning | Xiaomi | 84.8 Inference | 47.7 | 84.8 | 0.0 | 27.2 | 92.7 | $0.168 in / $0.336 out |
| 14 | MiMo-V2.5-Pro mimo-v2.5-pro codeprogrammingtool use | Xiaomi | 84.8 Inference | 36.2 | 84.8 | 0.0 | 56.3 | 78.0 | $0.435 in / $0.87 out |
| 15 | Muse Spark 1.1 muse-spark-1.1 multimodalvisionmulti-input reasoning | Meta | 84.8 Inference | 69.7 | 84.8 | 76.6 | 58.1 | 41.5 | $1.25 in / $4.25 out |
| 16 | GPT-4.1 mini gpt-4.1-mini-2025-04-14 multimodalvisionmulti-input reasoning | OpenAI | 84.6 Inference | 19.2 | 84.6 | 8.9 | 2.2 | 69.5 | |
| 17 | GPT-5 mini gpt-5-mini-2025-08-07 multimodalvisionmulti-input reasoning | OpenAI | 77.4 Inference | 39.4 | 77.4 | 0.0 | 22.2 | 68.5 | |
| 18 | GPT-4.1 gpt-4.1-2025-04-14 multimodalvisionmulti-input reasoning | OpenAI | 73.2 Inference | 27.2 | 73.2 | 32.8 | 14.7 | 40.7 | |
| 19 | LongCat-Flash-Lite longcat-flash-lite codeprogrammingtool use | Meituan | 72.8 Inference | 22.8 | 72.8 | 30.1 | 23.9 | 95.6 | $0.1 in / $0.4 out |
| 20 | Mercury 2 mercury-2 codeprogrammingtool use | Inception | 68.9 Inference | 42.7 | 68.9 | 0.0 | 15.3 | 84.4 | $0.25 in / $0.75 out |
GPT-5.5
OpenAI
94.5
$5 in / $30 out
GPT-5.6 Luna
OpenAI
94.5
$1 in / $6 out
GPT-5.6 Sol
OpenAI
94.5
$5 in / $30 out
Page 1 of 17 · 334 models
Want benchmark charts, model comparison, and pricing analytics?
Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.
Open full leaderboardRankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.
| $1 in / $6 out |
| $5 in / $30 out |
| $2.5 in / $15 out |
| $0.1 in / $0.4 out |
| $0.1 in / $0.2 out |
| $1.6 in / $3.2 out |
| $1.5 in / $9 out |
| $0.3 in / $2.5 out |
| $1.5 in / $7.5 out |
| $0.4 in / $1.6 out |
| $0.25 in / $2 out |
| $2 in / $8 out |
GPT-5.6 Terra
OpenAI
94.5
$2.5 in / $15 out
GPT-4.1 nano
OpenAI
87.8
$0.1 in / $0.4 out
DeepSeek-V4-Flash-Max
DeepSeek
84.8
$0.1 in / $0.2 out
DeepSeek-V4-Pro-Max
DeepSeek
84.8
$1.6 in / $3.2 out
Gemini 3.5 Flash
84.8
$1.5 in / $9 out
Gemini 3.5 Flash-Lite
84.8
$0.3 in / $2.5 out
Gemini 3.6 Flash
84.8
$1.5 in / $7.5 out
GLM-5.2
Zhipu AI
84.8
$0.95 in / $3 out
Kimi K3
Moonshot AI
84.8
$3 in / $15 out
MiMo-V2.5
Xiaomi
84.8
$0.168 in / $0.336 out
MiMo-V2.5-Pro
Xiaomi
84.8
$0.435 in / $0.87 out
Muse Spark 1.1
Meta
84.8
$1.25 in / $4.25 out
GPT-4.1 mini
OpenAI
84.6
$0.4 in / $1.6 out
GPT-5 mini
OpenAI
77.4
$0.25 in / $2 out
GPT-4.1
OpenAI
73.2
$2 in / $8 out
LongCat-Flash-Lite
Meituan
72.8
$0.1 in / $0.4 out
Mercury 2
Inception
68.9
$0.25 in / $0.75 out