Skytells
HomeModelsCLIChangelog
  • Home
  • Models
  • CLI
  • Changelog
Skytells

Addressing the world's greatest challenges with AI. Enterprise research, foundation models, and infrastructure trusted by organizations worldwide since 2012.

Get Started

  • Console
  • Learn
  • Documentation
  • API Reference
  • Pricing
  • ModelsNew

Platform

  • Cloud AgentsNew
  • AI Solutions
  • Infrastructure
  • Edge Network
  • Trust Center
  • CLI

Resources

  • Blog
  • Changelog
  • AI Leaderboard
  • Research
  • Status

Company

  • About
  • Careers
  • Legal
  • Privacy Policy

© 2012–2026 Skytells, Inc. All rights reserved.

Live rankings

AI Model Leaderboard

Every major AI model ranked across benchmark quality, inference speed, agentic capability, programming aptitude, and cost efficiency — updated continuously from published evaluation data.

Explore full leaderboardBrowse model catalog

334

Tracked models

29

Providers

286

Benchmarked

15.1

Avg. index

OverallBenchmarksInferenceAgenticProgrammingValue / Price

334 models

RankModelProviderScoreBenchmarksInferenceAgenticProgrammingValuePrice
1

Claude Fable 5

claude-fable-5

multimodalvisionmulti-input reasoning
Anthropic

84.2

Programming

70.862.80.084.20.0$10 in / $50 out
2

Claude Mythos Preview

claude-mythos-preview

multimodalvisionmulti-input reasoning
Anthropic

82.7

Programming

80.00.066.682.70.0
3

Claude Opus 4.8

claude-opus-4-8

multimodalvisionmulti-input reasoning
Anthropic

81.3

Programming

74.428.374.581.38.0
4

Claude Opus 4.7

claude-opus-4-7

multimodalvisionmulti-input reasoning
Anthropic

77.9

Programming

75.128.354.277.98.0
5

Claude Sonnet 5

claude-sonnet-5

multimodalvisionmulti-input reasoning
Anthropic

75.4

Programming

67.528.360.775.412.0
6

Claude Sonnet 4.5

claude-sonnet-4-5-20250929

multimodalvisionmulti-input reasoning
Anthropic

74.6

Programming

51.412.669.974.612.0
7

Qwen3.7 Max

qwen3.7-max

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

74.2

Programming

64.762.849.674.243.9$1.25 in / $3.75 out
8

GPT-5.6 Sol

gpt-5.6-sol

multimodalvisionmulti-input reasoning
OpenAI

73.7

Programming

79.894.571.473.73.7$5 in / $30 out
9

Claude Opus 4.5

claude-opus-4-5-20251101

multimodalvisionmulti-input reasoning
Anthropic

72.2

Programming

54.50.035.272.20.0
10

Claude Opus 4.6

claude-opus-4-6

multimodalvisionmulti-input reasoning
Anthropic

71.5

Programming

74.628.349.871.58.0
11

Grok 4.5

grok-4.5

multimodalvisionmulti-input reasoning
xAI

70.8

Programming

69.338.20.070.835.6$2 in / $6 out
12

GPT-5.6 Terra

gpt-5.6-terra

multimodalvisionmulti-input reasoning
OpenAI

69.6

Programming

74.694.561.569.617.1
13

Kimi K2.6

kimi-k2.6

texttext-to-textlanguage
Moonshot AI

69.4

Programming

63.532.947.269.446.3
14

MiniMax M3

minimax-m3

multimodalvisionmulti-input reasoning
MiniMax

68.3

Programming

49.662.837.568.373.2$0.3 in / $1.2 out
15

GPT-5.2

gpt-5.2-2025-12-11

multimodalvisionmulti-input reasoning
OpenAI

66.3

Programming

70.962.837.066.331.5
16

Claude Sonnet 4.6

claude-sonnet-4-6

multimodalvisionmulti-input reasoning
Anthropic

65.6

Programming

62.312.641.065.612.0
17

GPT-5.6 Luna

gpt-5.6-luna

multimodalvisionmulti-input reasoning
OpenAI

65.5

Programming

63.994.555.065.537.8
18

Gemini 3 Flash

gemini-3-flash-preview

multimodalvisionmulti-input reasoning
Google

61.9

Programming

68.562.833.261.954.9
19

MiMo-V2-Pro

mimo-v2-pro

codeprogrammingtool use
Xiaomi

61.9

Programming

0.00.00.061.90.0N/A
20

Qwen3.7-Plus

qwen3.7-plus

multimodalvisionmulti-input reasoning
AAlibaba Cloud / Qwen Team

61.1

Programming

62.962.848.161.169.5$0.32 in / $1.28 out
1

Claude Fable 5

Anthropic

84.2

$10 in / $50 out

2

Claude Mythos Preview

Anthropic

82.7

N/A

3

Claude Opus 4.8

Anthropic

81.3

$5 in / $25 out

Page 1 of 17 · 334 models

Next

Want benchmark charts, model comparison, and pricing analytics?

Sign in to access the full interactive leaderboard with deep benchmark breakdowns and model comparison tools.

Open full leaderboard

Rankings are based on multi-dimensional evaluation across benchmark quality, inference efficiency, and cost-per-output. Scores are updated continuously and may differ from individual third-party benchmarks.

N/A
$5 in / $25 out
$5 in / $25 out
$3 in / $15 out
$3 in / $15 out
N/A
$5 in / $25 out
$2.5 in / $15 out
$0.75 in / $3.5 out
$1.75 in / $14 out
$3 in / $15 out
$1 in / $6 out
$0.5 in / $3 out
4

Claude Opus 4.7

Anthropic

77.9

$5 in / $25 out

5

Claude Sonnet 5

Anthropic

75.4

$3 in / $15 out

6

Claude Sonnet 4.5

Anthropic

74.6

$3 in / $15 out

7
A

Qwen3.7 Max

Alibaba Cloud / Qwen Team

74.2

$1.25 in / $3.75 out

8

GPT-5.6 Sol

OpenAI

73.7

$5 in / $30 out

9

Claude Opus 4.5

Anthropic

72.2

N/A

10

Claude Opus 4.6

Anthropic

71.5

$5 in / $25 out

11

Grok 4.5

xAI

70.8

$2 in / $6 out

12

GPT-5.6 Terra

OpenAI

69.6

$2.5 in / $15 out

13

Kimi K2.6

Moonshot AI

69.4

$0.75 in / $3.5 out

14

MiniMax M3

MiniMax

68.3

$0.3 in / $1.2 out

15

GPT-5.2

OpenAI

66.3

$1.75 in / $14 out

16

Claude Sonnet 4.6

Anthropic

65.6

$3 in / $15 out

17

GPT-5.6 Luna

OpenAI

65.5

$1 in / $6 out

18

Gemini 3 Flash

Google

61.9

$0.5 in / $3 out

19

MiMo-V2-Pro

Xiaomi

61.9

N/A

20
A

Qwen3.7-Plus

Alibaba Cloud / Qwen Team

61.1

$0.32 in / $1.28 out