Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

28.3

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
121

MiMo-V2.5-Pro

mimo-v2.5-pro

codeprogrammingtool use
Xiaomi

36.2

Benchmarks

36.284.80.056.378.0$0.435 in / $0.87 out
122

Nova 2 Omni

nova-2-omni

multimodalvisionmulti-input reasoning
AAmazon

36.1

Benchmarks

36.10.00.00.00.0N/A
123

Claude Opus 4

claude-opus-4-20250514

multimodalvisionmulti-input reasoning
Anthropic

35.8

Benchmarks

35.80.057.447.00.0
124

Ministral 3 (14B Reasoning 2512)

ministral-14b-latest

multimodalvisionmulti-input reasoning
Mistral AI

35.4

Benchmarks

35.40.00.00.00.0
125

Command A+

command-a-plus-05-2026

multimodalvisionmulti-input reasoning
Cohere

35.2

Benchmarks

35.20.00.015.30.0
126

Qwen3 VL 235B A22B Thinking

qwen3-vl-235b-a22b-thinking

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

35.2

Benchmarks

35.20.036.20.00.0
127

Kimi-k1.5

kimi-k1.5

multimodalvisionmulti-input reasoning
Moonshot AI

34.7

Benchmarks

34.70.00.00.00.0N/A
128

Mistral Medium 3.5

mistral-medium-3-5

multimodalvisionmulti-input reasoning
Mistral AI

34.6

Benchmarks

34.623.215.459.034.8
129

Qwen3 VL 235B A22B Instruct

qwen3-vl-235b-a22b-instruct

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

34.3

Benchmarks

34.30.051.00.00.0
130

GPT OSS 120B

gpt-oss-120b

textinference
OpenAI

33.7

Benchmarks

33.70.026.80.00.0N/A
131

Llama 3.1 Nemotron Ultra 253B v1

llama-3.1-nemotron-ultra-253b-v1

textinference
NNVIDIA

33.0

Benchmarks

33.00.00.00.00.0N/A
132

Qwen3 VL 8B Thinking

qwen3-vl-8b-thinking

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

32.8

Benchmarks

32.80.021.10.00.0
133

Qwen3 VL 30B A3B Thinking

qwen3-vl-30b-a3b-thinking

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

32.7

Benchmarks

32.70.019.20.00.0
134

Gemma 4 12B

gemma-4-12b-it

multimodalvisionmulti-input reasoning
Google

32.6

Benchmarks

32.60.00.00.00.0N/A
135

Llama 4 Maverick

llama-4-maverick

multimodalvisionmulti-input reasoning
MMeta

32.6

Benchmarks

32.60.00.00.00.0N/A
136

MAI-Code-1-Flash

mai-code-1-flash

codeprogrammingtool use
MMicrosoft

32.2

Benchmarks

32.20.00.021.40.0N/A
137

Claude 3.5 Sonnet

claude-3-5-sonnet-20241022

multimodalvisionmulti-input reasoning
Anthropic

32.0

Benchmarks

32.00.038.711.10.0
138

Gemini 2.0 Flash

gemini-2.0-flash

multimodalvisionmulti-input reasoning
Google

31.7

Benchmarks

31.70.00.00.00.0
139

GLM-4.5

glm-4.5

codeprogrammingtool use
ZZhipu AI

31.5

Benchmarks

31.50.036.036.10.0N/A
140

Mistral Small 4

mistral-small-latest

multimodalvisionmulti-input reasoning
Mistral AI

31.3

Benchmarks

31.323.20.00.081.7
121

MiMo-V2.5-Pro

Xiaomi

36.2

$0.435 in / $0.87 out

122
A

Nova 2 Omni

Amazon

36.1

N/A

123

Claude Opus 4

Anthropic

35.8

N/A

124

Page 7 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

N/A
N/A
N/A
N/A
$1.5 in / $7.5 out
N/A
N/A
N/A
N/A
N/A
$0.15 in / $0.6 out

Ministral 3 (14B Reasoning 2512)

Mistral AI

35.4

N/A

125

Command A+

Cohere

35.2

N/A

126
A

Qwen3 VL 235B A22B Thinking

Alibaba Cloud / Qwen Team

35.2

N/A

127

Kimi-k1.5

Moonshot AI

34.7

N/A

128

Mistral Medium 3.5

Mistral AI

34.6

$1.5 in / $7.5 out

129
A

Qwen3 VL 235B A22B Instruct

Alibaba Cloud / Qwen Team

34.3

N/A

130

GPT OSS 120B

OpenAI

33.7

N/A

131
N

Llama 3.1 Nemotron Ultra 253B v1

NVIDIA

33.0

N/A

132
A

Qwen3 VL 8B Thinking

Alibaba Cloud / Qwen Team

32.8

N/A

133
A

Qwen3 VL 30B A3B Thinking

Alibaba Cloud / Qwen Team

32.7

N/A

134

Gemma 4 12B

Google

32.6

N/A

135
M

Llama 4 Maverick

Meta

32.6

N/A

136
M

MAI-Code-1-Flash

Microsoft

32.2

N/A

137

Claude 3.5 Sonnet

Anthropic

32.0

N/A

138

Gemini 2.0 Flash

Google

31.7

N/A

139
Z

GLM-4.5

Zhipu AI

31.5

N/A

140

Mistral Small 4

Mistral AI

31.3

$0.15 in / $0.6 out