Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

12.2

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
41

Qwen3.5-122B-A10B

qwen3.5-122b-a10b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

44.6

Agentic

60.50.044.638.30.0N/A
42

GLM-5.2

glm-5.2

codeprogrammingtool use
ZZhipu AI

44.1

Agentic

68.784.844.159.951.2$0.95 in / $3 out
43

MiniMax M2.5

minimax-m2.5

codeprogrammingtool use
MiniMax

43.6

Agentic

0.068.943.650.472.9$0.3 in / $1.2 out
44

Qwen3-Next-80B-A3B-Thinking

qwen3-next-80b-a3b-thinking

textinference
AAlibaba Cloud / Qwen Team

41.7

Agentic

42.30.041.70.00.0N/A
45

Qwen3.5-27B

qwen3.5-27b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

41.3

Agentic

57.832.941.339.161.0$0.3 in / $2.4 out
46

Claude Sonnet 4.6

claude-sonnet-4-6

multimodalvisionmulti-input reasoning
Anthropic

41.0

Agentic

62.312.641.065.612.0
47

Kimi K2.5

kimi-k2.5

multimodalvisionmulti-input reasoning
Moonshot AI

41.0

Agentic

63.70.041.041.80.0N/A
48

Hy3

hy3

codeprogrammingtool use
TTencent

40.4

Agentic

65.90.040.459.20.0N/A
49

MiniMax M2

minimax-m2

codeprogrammingtool use
MiniMax

40.2

Agentic

29.862.840.240.073.2$0.3 in / $1.2 out
50

Claude 3.5 Sonnet

claude-3-5-sonnet-20241022

multimodalvisionmulti-input reasoning
Anthropic

38.7

Agentic

32.00.038.711.10.0
51

Qwen3.5-35B-A3B

qwen3.5-35b-a3b

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

38.3

Agentic

53.40.038.330.20.0N/A
52

MiniMax M3

minimax-m3

multimodalvisionmulti-input reasoning
MiniMax

37.5

Agentic

49.662.837.568.373.2$0.3 in / $1.2 out
53

GPT-5.2

gpt-5.2-2025-12-11

multimodalvisionmulti-input reasoning
OpenAI

37.0

Agentic

70.962.837.066.331.5
54

Step-3.5-Flash

step-3.5-flash

codeprogrammingtool use
SStepFun

36.5

Agentic

62.859.836.548.693.9$0.1 in / $0.4 out
55

Qwen3 VL 235B A22B Thinking

qwen3-vl-235b-a22b-thinking

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

36.2

Agentic

35.20.036.20.00.0
56

o4-mini

o4-mini

multimodalvisionmulti-input reasoning
OpenAI

36.1

Agentic

46.20.036.128.70.0N/A
57

GLM-4.5

glm-4.5

codeprogrammingtool use
ZZhipu AI

36.0

Agentic

31.50.036.036.10.0N/A
58

GPT-4.5

gpt-4.5

multimodalvisionmulti-input reasoning
OpenAI

35.8

Agentic

41.10.035.85.20.0N/A
59

GLM-4.6

glm-4.6

multimodalvisionmulti-input reasoning
ZZhipu AI

35.4

Agentic

44.50.035.443.20.0N/A
60

DeepSeek-V4-Flash-Max

deepseek-v4-flash-max

codeprogrammingtool use
DeepSeek

35.3

Agentic

56.284.835.341.498.8
41
A

Qwen3.5-122B-A10B

Alibaba Cloud / Qwen Team

44.6

N/A

42
Z

GLM-5.2

Zhipu AI

44.1

$0.95 in / $3 out

43

MiniMax M2.5

MiniMax

43.6

$0.3 in / $1.2 out

44

Page 3 of 17 · 334 models

PreviousNext

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

$3 in / $15 out
N/A
$1.75 in / $14 out
N/A
$0.1 in / $0.2 out
A

Qwen3-Next-80B-A3B-Thinking

Alibaba Cloud / Qwen Team

41.7

N/A

45
A

Qwen3.5-27B

Alibaba Cloud / Qwen Team

41.3

$0.3 in / $2.4 out

46

Claude Sonnet 4.6

Anthropic

41.0

$3 in / $15 out

47

Kimi K2.5

Moonshot AI

41.0

N/A

48
T

Hy3

Tencent

40.4

N/A

49

MiniMax M2

MiniMax

40.2

$0.3 in / $1.2 out

50

Claude 3.5 Sonnet

Anthropic

38.7

N/A

51
A

Qwen3.5-35B-A3B

Alibaba Cloud / Qwen Team

38.3

N/A

52

MiniMax M3

MiniMax

37.5

$0.3 in / $1.2 out

53

GPT-5.2

OpenAI

37.0

$1.75 in / $14 out

54
S

Step-3.5-Flash

StepFun

36.5

$0.1 in / $0.4 out

55
A

Qwen3 VL 235B A22B Thinking

Alibaba Cloud / Qwen Team

36.2

N/A

56

o4-mini

OpenAI

36.1

N/A

57
Z

GLM-4.5

Zhipu AI

36.0

N/A

58

GPT-4.5

OpenAI

35.8

N/A

59
Z

GLM-4.6

Zhipu AI

35.4

N/A

60

DeepSeek-V4-Flash-Max

DeepSeek

35.3

$0.1 in / $0.2 out