Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

29.3

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
81

GPT-5 mini

gpt-5-mini-2025-08-07

multimodalvisionmulti-input reasoning
OpenAI

46.3

overall

39.477.40.022.268.5$0.25 in / $2 out
82

Claude Opus 4

claude-opus-4-20250514

multimodalvisionmulti-input reasoning
Anthropic

46.1

overall

35.80.057.447.00.0
83

Qwen3.5-27B

qwen3.5-27b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

46.0

overall

57.832.941.339.161.0$0.3 in / $2.4 out
84

Mercury 2

mercury-2

codeprogrammingtool use
IInception

45.8

overall

42.768.90.015.384.4$0.25 in / $0.75 out
85

Claude Haiku 4.5

claude-haiku-4-5-20251001

multimodalvisionmulti-input reasoning
Anthropic

45.8

overall

30.853.350.853.945.6
86

Qwen3.5-397B-A17B

qwen3.5-397b-a17b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

45.1

overall

54.50.024.755.30.0N/A
87

Qwen3.6-27B

qwen3.6-27b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

45.0

overall

54.732.90.039.449.4$0.6 in / $3.6 out
88

Claude Sonnet 4.6

claude-sonnet-4-6

multimodalvisionmulti-input reasoning
Anthropic

44.9

overall

62.312.641.065.612.0
89

Gemini 2.0 Flash Thinking

gemini-2.0-flash-thinking

multimodalvisionmulti-input reasoning
Google

44.9

overall

44.90.00.00.00.0
90

GPT-5

gpt-5-2025-08-07

multimodalvisionmulti-input reasoning
OpenAI

44.5

overall

59.90.024.347.10.0N/A
91

MiniMax M2

minimax-m2

codeprogrammingtool use
MiniMax

44.2

overall

29.862.840.240.073.2$0.3 in / $1.2 out
92

GLM-4.7

glm-4.7

multimodalvisionmulti-input reasoning
ZZhipu AI

44.1

overall

60.30.026.642.50.0N/A
93

GPT OSS 120B High

gpt-oss-120b-high

multimodalvisionmulti-input reasoning
OpenAI

44.1

overall

44.10.00.00.00.0
94

o1-pro

o1-pro

multimodalvisionmulti-input reasoning
OpenAI

44.1

overall

44.10.00.00.00.0N/A
95

K-EXAONE-236B-A23B

k-exaone-236b-a23b

multimodalvisionmulti-input reasoning
LLG AI Research

43.9

overall

43.90.00.00.00.0N/A
96

Claude Sonnet 4

claude-sonnet-4-20250514

multimodalvisionmulti-input reasoning
Anthropic

43.6

overall

39.30.049.442.80.0
97

Claude 3.7 Sonnet

claude-3-7-sonnet-20250219

multimodalvisionmulti-input reasoning
Anthropic

43.1

overall

42.30.049.137.70.0
98

GPT-5.3 Chat

gpt-5.3-chat-latest

multimodalvisionmulti-input reasoning
OpenAI

43.0

overall

0.050.20.00.031.5
99

GLM-5.1

glm-5.1

codeprogrammingtool use
ZZhipu AI

42.9

overall

62.615.935.247.240.2$1.4 in / $4.4 out
100

Kimi K2.7 Code

kimi-k2.7-code

multimodalvisionmulti-input reasoning
Moonshot AI

42.7

overall

0.032.947.20.047.6
81

GPT-5 mini

OpenAI

46.3

$0.25 in / $2 out

82

Claude Opus 4

Anthropic

46.1

N/A

83
A

Qwen3.5-27B

Alibaba Cloud / Qwen Team

46.0

$0.3 in / $2.4 out

84

Page 5 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

N/A
$1 in / $5 out
$3 in / $15 out
N/A
N/A
N/A
N/A
$1.75 in / $14 out
$0.74 in / $3.5 out
I

Mercury 2

Inception

45.8

$0.25 in / $0.75 out

85

Claude Haiku 4.5

Anthropic

45.8

$1 in / $5 out

86
A

Qwen3.5-397B-A17B

Alibaba Cloud / Qwen Team

45.1

N/A

87
A

Qwen3.6-27B

Alibaba Cloud / Qwen Team

45.0

$0.6 in / $3.6 out

88

Claude Sonnet 4.6

Anthropic

44.9

$3 in / $15 out

89

Gemini 2.0 Flash Thinking

Google

44.9

N/A

90

GPT-5

OpenAI

44.5

N/A

91

MiniMax M2

MiniMax

44.2

$0.3 in / $1.2 out

92
Z

GLM-4.7

Zhipu AI

44.1

N/A

93

GPT OSS 120B High

OpenAI

44.1

N/A

94

o1-pro

OpenAI

44.1

N/A

95
L

K-EXAONE-236B-A23B

LG AI Research

43.9

N/A

96

Claude Sonnet 4

Anthropic

43.6

N/A

97

Claude 3.7 Sonnet

Anthropic

43.1

N/A

98

GPT-5.3 Chat

OpenAI

43.0

$1.75 in / $14 out

99
Z

GLM-5.1

Zhipu AI

42.9

$1.4 in / $4.4 out

100

Kimi K2.7 Code

Moonshot AI

42.7

$0.74 in / $3.5 out