Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

28.3

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
81

LongCat-Flash-Thinking

longcat-flash-thinking

codeprogrammingtool use
Meituan

48.2

Benchmarks

48.20.00.018.40.0N/A
82

DeepSeek-R1-0528

deepseek-r1-0528

codeprogrammingtool use
DeepSeek

47.9

Benchmarks

47.90.00.05.70.0N/A
83

MiMo-V2.5

mimo-v2.5

multimodalvisionmulti-input reasoning
Xiaomi

47.7

Benchmarks

47.784.80.027.292.7$0.168 in / $0.336 out
84

Step3-VL-10B

step3-vl-10b

multimodalvisionmulti-input reasoning
SStepFun

46.9

Benchmarks

46.90.00.00.00.0N/A
85

o4-mini

o4-mini

multimodalvisionmulti-input reasoning
OpenAI

46.2

Benchmarks

46.20.036.128.70.0N/A
86

Claude Opus 4.1

claude-opus-4-1-20250805

multimodalvisionmulti-input reasoning
Anthropic

46.0

Benchmarks

46.00.067.460.80.0
87

Nemotron 3 Super (120B A12B)

nemotron-3-super-120b-a12b

codeprogrammingtool use
NNVIDIA

45.5

Benchmarks

45.50.07.622.00.0N/A
88

Nova 2 Pro

nova-2-pro

multimodalvisionmulti-input reasoning
AAmazon

45.3

Benchmarks

45.30.057.249.60.0N/A
89

Gemini 2.0 Flash Thinking

gemini-2.0-flash-thinking

multimodalvisionmulti-input reasoning
Google

44.9

Benchmarks

44.90.00.00.00.0
90

Sarvam-30B

sarvam-30b

codeprogrammingtool use
SSarvam AI

44.9

Benchmarks

44.90.06.44.40.0N/A
91

GLM-4.6

glm-4.6

multimodalvisionmulti-input reasoning
ZZhipu AI

44.5

Benchmarks

44.50.035.443.20.0N/A
92

Qwen3-235B-A22B-Thinking-2507

qwen3-235b-a22b-thinking-2507

textinference
AAlibaba Cloud / Qwen Team

44.4

Benchmarks

44.40.026.80.00.0N/A
93

GPT OSS 120B High

gpt-oss-120b-high

multimodalvisionmulti-input reasoning
OpenAI

44.1

Benchmarks

44.10.00.00.00.0
94

o1-pro

o1-pro

multimodalvisionmulti-input reasoning
OpenAI

44.1

Benchmarks

44.10.00.00.00.0N/A
95

K-EXAONE-236B-A23B

k-exaone-236b-a23b

multimodalvisionmulti-input reasoning
LLG AI Research

43.9

Benchmarks

43.90.00.00.00.0N/A
96

Gemma 4 26B-A4B

gemma-4-26b-a4b-it

multimodalvisionmulti-input reasoning
Google

43.8

Benchmarks

43.832.90.00.090.2
97

Nemotron 3 Nano (30B A3B)

nemotron-3-nano-30b-a3b

codeprogrammingtool use
NNVIDIA

43.6

Benchmarks

43.632.93.03.8100.0$0.06 in / $0.24 out
98

o3

o3-2025-04-16

multimodalvisionmulti-input reasoning
OpenAI

42.9

Benchmarks

42.90.017.927.70.0N/A
99

Mercury 2

mercury-2

codeprogrammingtool use
IInception

42.7

Benchmarks

42.768.90.015.384.4$0.25 in / $0.75 out
100

Gemini 2.5 Pro

gemini-2.5-pro

multimodalvisionmulti-input reasoning
Google

42.5

Benchmarks

42.551.00.021.429.8
81

LongCat-Flash-Thinking

Meituan

48.2

N/A

82

DeepSeek-R1-0528

DeepSeek

47.9

N/A

83

MiMo-V2.5

Xiaomi

47.7

$0.168 in / $0.336 out

84

Page 5 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

N/A
N/A
N/A
$0.13 in / $0.4 out
$1.25 in / $10 out
S

Step3-VL-10B

StepFun

46.9

N/A

85

o4-mini

OpenAI

46.2

N/A

86

Claude Opus 4.1

Anthropic

46.0

N/A

87
N

Nemotron 3 Super (120B A12B)

NVIDIA

45.5

N/A

88
A

Nova 2 Pro

Amazon

45.3

N/A

89

Gemini 2.0 Flash Thinking

Google

44.9

N/A

90
S

Sarvam-30B

Sarvam AI

44.9

N/A

91
Z

GLM-4.6

Zhipu AI

44.5

N/A

92
A

Qwen3-235B-A22B-Thinking-2507

Alibaba Cloud / Qwen Team

44.4

N/A

93

GPT OSS 120B High

OpenAI

44.1

N/A

94

o1-pro

OpenAI

44.1

N/A

95
L

K-EXAONE-236B-A23B

LG AI Research

43.9

N/A

96

Gemma 4 26B-A4B

Google

43.8

$0.13 in / $0.4 out

97
N

Nemotron 3 Nano (30B A3B)

NVIDIA

43.6

$0.06 in / $0.24 out

98

o3

OpenAI

42.9

N/A

99
I

Mercury 2

Inception

42.7

$0.25 in / $0.75 out

100

Gemini 2.5 Pro

Google

42.5

$1.25 in / $10 out