Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

15.1

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
81

GPT-5.2 Codex

gpt-5.2-codex

multimodalvisionmulti-input reasoning
OpenAI

30.9

Programming

0.031.10.030.922.0$1.75 in / $14 out
82

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

30.2

Programming

53.40.038.330.20.0N/A
83

MiniMax M2.7

minimax-m2.7

codeprogrammingtool use
MiniMax

29.0

Programming

0.019.526.329.073.2$0.3 in / $1.2 out
84

o4-mini

o4-mini

multimodalvisionmulti-input reasoning
OpenAI

28.7

Programming

46.20.036.128.70.0N/A
85

o3

o3-2025-04-16

multimodalvisionmulti-input reasoning
OpenAI

27.7

Programming

42.90.017.927.70.0N/A
86

MiMo-V2.5

mimo-v2.5

multimodalvisionmulti-input reasoning
Xiaomi

27.2

Programming

47.784.80.027.292.7$0.168 in / $0.336 out
87

Nova 2 Lite

nova-2-lite

multimodalvisionmulti-input reasoning
AAmazon

26.0

Programming

41.162.813.026.059.1$0.3 in / $2.5 out
88

Gemini 2.5 Pro Preview 06-05

gemini-2.5-pro-preview-06-05

multimodalvisionmulti-input reasoning
Google

25.8

Programming

50.20.00.025.80.0
89

DeepSeek-V3.1

deepseek-v3.1

codeprogrammingtool use
DeepSeek

25.4

Programming

36.70.013.625.40.0N/A
90

Qwen3.6-35B-A3B

qwen3.6-35b-a3b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

25.2

Programming

51.10.09.825.20.0N/A
91

LongCat-Flash-Lite

longcat-flash-lite

codeprogrammingtool use
Meituan

23.9

Programming

22.872.830.123.995.6$0.1 in / $0.4 out
92

GPT-5 mini

gpt-5-mini-2025-08-07

multimodalvisionmulti-input reasoning
OpenAI

22.2

Programming

39.477.40.022.268.5
93

Nemotron 3 Super (120B A12B)

nemotron-3-super-120b-a12b

codeprogrammingtool use
NNVIDIA

22.0

Programming

45.50.07.622.00.0N/A
94

Gemini 3.5 Flash

gemini-3.5-flash

multimodalvisionmulti-input reasoning
Google

21.8

Programming

60.284.867.321.831.7
95

Gemini 2.5 Pro

gemini-2.5-pro

multimodalvisionmulti-input reasoning
Google

21.4

Programming

42.551.00.021.429.8
96

MAI-Code-1-Flash

mai-code-1-flash

codeprogrammingtool use
MMicrosoft

21.4

Programming

32.20.00.021.40.0N/A
97

Devstral Medium

devstral-medium-2507

codeprogrammingtool use
Mistral AI

20.6

Programming

0.00.00.020.60.0N/A
98

GPT-5.4 Mini

gpt-5.4-mini

texttext-to-textlanguage
OpenAI

20.0

Programming

51.144.515.020.042.7
99

Gemini 2.5 Flash

gemini-2.5-flash

multimodalvisionmulti-input reasoning
Google

19.5

Programming

38.20.00.019.50.0
100

North Mini Code 1.0

north-mini-code-1.0

codeprogrammingtool use
Cohere

18.6

Programming

0.00.00.018.60.0N/A
81

GPT-5.2 Codex

OpenAI

30.9

$1.75 in / $14 out

82
A

Qwen3.5-35B-A3B

Alibaba Cloud / Qwen Team

30.2

N/A

83

MiniMax M2.7

MiniMax

29.0

$0.3 in / $1.2 out

84

Page 5 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

N/A
$0.25 in / $2 out
$1.5 in / $9 out
$1.25 in / $10 out
$0.75 in / $4.5 out
N/A

o4-mini

OpenAI

28.7

N/A

85

o3

OpenAI

27.7

N/A

86

MiMo-V2.5

Xiaomi

27.2

$0.168 in / $0.336 out

87
A

Nova 2 Lite

Amazon

26.0

$0.3 in / $2.5 out

88

Gemini 2.5 Pro Preview 06-05

Google

25.8

N/A

89

DeepSeek-V3.1

DeepSeek

25.4

N/A

90
A

Qwen3.6-35B-A3B

Alibaba Cloud / Qwen Team

25.2

N/A

91

LongCat-Flash-Lite

Meituan

23.9

$0.1 in / $0.4 out

92

GPT-5 mini

OpenAI

22.2

$0.25 in / $2 out

93
N

Nemotron 3 Super (120B A12B)

NVIDIA

22.0

N/A

94

Gemini 3.5 Flash

Google

21.8

$1.5 in / $9 out

95

Gemini 2.5 Pro

Google

21.4

$1.25 in / $10 out

96
M

MAI-Code-1-Flash

Microsoft

21.4

N/A

97

Devstral Medium

Mistral AI

20.6

N/A

98

GPT-5.4 Mini

OpenAI

20.0

$0.75 in / $4.5 out

99

Gemini 2.5 Flash

Google

19.5

N/A

100

North Mini Code 1.0

Cohere

18.6

N/A