Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

13.1

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
61

Qwen3.5-27B

qwen3.5-27b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

32.9

Inference

57.832.941.339.161.0$0.3 in / $2.4 out
62

Qwen3.6-27B

qwen3.6-27b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

32.9

Inference

54.732.90.039.449.4$0.6 in / $3.6 out
63

Qwen3 VL 4B Instruct

qwen3-vl-4b-instruct

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

32.9

Inference

18.232.917.70.085.4
64

Qwen3 VL 4B Thinking

qwen3-vl-4b-thinking

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

32.9

Inference

20.232.917.00.079.3
65

GPT-5.2 Codex

gpt-5.2-codex

multimodalvisionmulti-input reasoning
OpenAI

31.1

Inference

0.031.10.030.922.0
66

GPT-5.3 Codex

gpt-5.3-codex

texttext-to-textcoding
OpenAI

31.1

Inference

0.031.10.034.522.0
67

GPT-3.5 Turbo

gpt-3.5-turbo-0125

multimodalvisionmulti-input reasoning
OpenAI

30.1

Inference

2.330.10.00.060.7
68

Claude Opus 4.6

claude-opus-4-6

multimodalvisionmulti-input reasoning
Anthropic

28.3

Inference

74.628.349.871.58.0
69

Claude Opus 4.7

claude-opus-4-7

multimodalvisionmulti-input reasoning
Anthropic

28.3

Inference

75.128.354.277.98.0
70

Claude Opus 4.8

claude-opus-4-8

multimodalvisionmulti-input reasoning
Anthropic

28.3

Inference

74.428.374.581.38.0
71

Claude Sonnet 5

claude-sonnet-5

multimodalvisionmulti-input reasoning
Anthropic

28.3

Inference

67.528.360.775.412.0
72

Grok Code Fast 1

grok-code-fast-1

codeprogrammingtool use
xAI

27.2

Inference

0.027.20.036.160.5$0.2 in / $1.5 out
73

Qwen3 30B A3B

qwen3-30b-a3b

textinference
AAlibaba Cloud / Qwen Team

26.6

Inference

23.726.60.00.078.5$0.1 in / $0.44 out
74

Mistral Medium 3.5

mistral-medium-3-5

multimodalvisionmulti-input reasoning
Mistral AI

23.2

Inference

34.623.215.459.034.8
75

Mistral Small 4

mistral-small-latest

multimodalvisionmulti-input reasoning
Mistral AI

23.2

Inference

31.323.20.00.081.7
76

Seed 2.0 Pro

seed-2.0-pro

multimodalvisionmulti-input reasoning
BByteDance

23.2

Inference

66.823.244.856.054.9$0.5 in / $3 out
77

Mistral Large 3 (675B Instruct 2512)

mistral-large-latest

multimodalvisionmulti-input reasoning
Mistral AI

22.0

Inference

21.922.00.00.055.6
78

MiniMax M2.7

minimax-m2.7

codeprogrammingtool use
MiniMax

19.5

Inference

0.019.526.329.073.2$0.3 in / $1.2 out
79

GLM-5.1

glm-5.1

codeprogrammingtool use
ZZhipu AI

15.9

Inference

62.615.935.247.240.2$1.4 in / $4.4 out
80

Claude Sonnet 4.5

claude-sonnet-4-5-20250929

multimodalvisionmulti-input reasoning
Anthropic

12.6

Inference

51.412.669.974.612.0
61
A

Qwen3.5-27B

Alibaba Cloud / Qwen Team

32.9

$0.3 in / $2.4 out

62
A

Qwen3.6-27B

Alibaba Cloud / Qwen Team

32.9

$0.6 in / $3.6 out

63
A

Qwen3 VL 4B Instruct

Alibaba Cloud / Qwen Team

32.9

$0.1 in / $0.6 out

64

Page 4 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

$0.1 in / $0.6 out
$0.1 in / $1 out
$1.75 in / $14 out
$1.75 in / $14 out
$0.5 in / $1.5 out
$5 in / $25 out
$5 in / $25 out
$5 in / $25 out
$3 in / $15 out
$1.5 in / $7.5 out
$0.15 in / $0.6 out
$0.5 in / $1.5 out
$3 in / $15 out
A

Qwen3 VL 4B Thinking

Alibaba Cloud / Qwen Team

32.9

$0.1 in / $1 out

65

GPT-5.2 Codex

OpenAI

31.1

$1.75 in / $14 out

66

GPT-5.3 Codex

OpenAI

31.1

$1.75 in / $14 out

67

GPT-3.5 Turbo

OpenAI

30.1

$0.5 in / $1.5 out

68

Claude Opus 4.6

Anthropic

28.3

$5 in / $25 out

69

Claude Opus 4.7

Anthropic

28.3

$5 in / $25 out

70

Claude Opus 4.8

Anthropic

28.3

$5 in / $25 out

71

Claude Sonnet 5

Anthropic

28.3

$3 in / $15 out

72

Grok Code Fast 1

xAI

27.2

$0.2 in / $1.5 out

73
A

Qwen3 30B A3B

Alibaba Cloud / Qwen Team

26.6

$0.1 in / $0.44 out

74

Mistral Medium 3.5

Mistral AI

23.2

$1.5 in / $7.5 out

75

Mistral Small 4

Mistral AI

23.2

$0.15 in / $0.6 out

76
B

Seed 2.0 Pro

ByteDance

23.2

$0.5 in / $3 out

77

Mistral Large 3 (675B Instruct 2512)

Mistral AI

22.0

$0.5 in / $1.5 out

78

MiniMax M2.7

MiniMax

19.5

$0.3 in / $1.2 out

79
Z

GLM-5.1

Zhipu AI

15.9

$1.4 in / $4.4 out

80

Claude Sonnet 4.5

Anthropic

12.6

$3 in / $15 out