Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

28.3

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
101

Claude 3.7 Sonnet

claude-3-7-sonnet-20250219

multimodalvisionmulti-input reasoning
Anthropic

42.3

Benchmarks

42.30.049.137.70.0N/A
102

Qwen3-Next-80B-A3B-Thinking

qwen3-next-80b-a3b-thinking

textinference
AAlibaba Cloud / Qwen Team

42.3

Benchmarks

42.30.041.70.00.0N/A
103

o1

o1-2024-12-17

multimodalvisionmulti-input reasoning
OpenAI

41.9

Benchmarks

41.90.044.75.60.0N/A
104

GPT-5.4 nano

gpt-5.4-nano

multimodalvisionmulti-input reasoning
OpenAI

41.8

Benchmarks

41.844.56.98.276.8$0.2 in / $1.25 out
105

Qwen3 VL 32B Thinking

qwen3-vl-32b-thinking

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

41.2

Benchmarks

41.20.031.10.00.0
106

GPT-4.5

gpt-4.5

multimodalvisionmulti-input reasoning
OpenAI

41.1

Benchmarks

41.10.035.85.20.0N/A
107

Nova 2 Lite

nova-2-lite

multimodalvisionmulti-input reasoning
AAmazon

41.1

Benchmarks

41.162.813.026.059.1$0.3 in / $2.5 out
108

Sarvam-105B

sarvam-105b

codeprogrammingtool use
SSarvam AI

41.1

Benchmarks

41.10.016.710.30.0N/A
109

Kimi K2 0905

kimi-k2-0905

textinference
Moonshot AI

41.0

Benchmarks

41.00.00.00.00.0N/A
110

Qwen3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

textinference
AAlibaba Cloud / Qwen Team

40.7

Benchmarks

40.70.00.00.00.0N/A
111

o1-preview

o1-preview

codeprogrammingtool use
OpenAI

40.2

Benchmarks

40.20.00.08.10.0N/A
112

GPT-5 mini

gpt-5-mini-2025-08-07

multimodalvisionmulti-input reasoning
OpenAI

39.4

Benchmarks

39.477.40.022.268.5
113

Claude Sonnet 4

claude-sonnet-4-20250514

multimodalvisionmulti-input reasoning
Anthropic

39.3

Benchmarks

39.30.049.442.80.0
114

MiniMax M2.1

minimax-m2.1

codeprogrammingtool use
MiniMax

39.1

Benchmarks

39.168.945.747.672.9$0.3 in / $1.2 out
115

Gemini 2.5 Flash

gemini-2.5-flash

multimodalvisionmulti-input reasoning
Google

38.2

Benchmarks

38.20.00.019.50.0
116

QvQ-72B-Preview

qvq-72b-preview

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

37.6

Benchmarks

37.60.00.00.00.0N/A
117

DeepSeek R1 Zero

deepseek-r1-zero

textinference
DeepSeek

36.8

Benchmarks

36.80.00.00.00.0N/A
118

DeepSeek-V3.1

deepseek-v3.1

codeprogrammingtool use
DeepSeek

36.7

Benchmarks

36.70.013.625.40.0N/A
119

GLM-4.7-Flash

glm-4.7-flash

codeprogrammingtool use
ZZhipu AI

36.4

Benchmarks

36.40.09.017.70.0N/A
120

Qwen3.5-9B

qwen3.5-9b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

36.3

Benchmarks

36.30.00.00.00.0N/A
101

Claude 3.7 Sonnet

Anthropic

42.3

N/A

102
A

Qwen3-Next-80B-A3B-Thinking

Alibaba Cloud / Qwen Team

42.3

N/A

103

o1

OpenAI

41.9

N/A

104

Page 6 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

N/A
$0.25 in / $2 out
N/A
N/A

GPT-5.4 nano

OpenAI

41.8

$0.2 in / $1.25 out

105
A

Qwen3 VL 32B Thinking

Alibaba Cloud / Qwen Team

41.2

N/A

106

GPT-4.5

OpenAI

41.1

N/A

107
A

Nova 2 Lite

Amazon

41.1

$0.3 in / $2.5 out

108
S

Sarvam-105B

Sarvam AI

41.1

N/A

109

Kimi K2 0905

Moonshot AI

41.0

N/A

110
A

Qwen3-235B-A22B-Instruct-2507

Alibaba Cloud / Qwen Team

40.7

N/A

111

o1-preview

OpenAI

40.2

N/A

112

GPT-5 mini

OpenAI

39.4

$0.25 in / $2 out

113

Claude Sonnet 4

Anthropic

39.3

N/A

114

MiniMax M2.1

MiniMax

39.1

$0.3 in / $1.2 out

115

Gemini 2.5 Flash

Google

38.2

N/A

116
A

QvQ-72B-Preview

Alibaba Cloud / Qwen Team

37.6

N/A

117

DeepSeek R1 Zero

DeepSeek

36.8

N/A

118

DeepSeek-V3.1

DeepSeek

36.7

N/A

119
Z

GLM-4.7-Flash

Zhipu AI

36.4

N/A

120
A

Qwen3.5-9B

Alibaba Cloud / Qwen Team

36.3

N/A