tokenstat
tokenstat

Model catalog

Benchmarks

Arena Elo from free open daily snapshots on GitHub (text, code, vision, agent), plus a sparse Artificial Analysis subset OpenRouter embeds. One score set is cross-linked onto provider clones of the same model. Arena may score the same base model at different reasoning efforts, so those rows stay separate and link to the base model only when it exists in the catalog. The open dumps publish 20 models per Arena board (10 on agent), so a full board is short by design. Empty on a single board is a gap, not a ranking of zero.

158 scored rows · 362 linked into the catalog · as of · Models · AI plans

Arena code

Top 10 of 20Full board
#ModelScore
1
OpenAI: GPT-6 AstraOpenAI · gpt-6-astra · max effort
1796
2
Anthropic: Claude Fable 5.1Anthropic · claude-fable-5.1 · max effort
1764
3
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · max effort
1688
4
Qwen3.8 Max 0902Alibaba · qwen3.8-max-0902
1685
5
Moonshot: Kimi K3Moonshot · kimi-k3 · max effort
1674
6
Qwen3.8 MaxAlibaba · qwen3.8 · max effort
1670
7
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · high effort
1661
8
Meta: Muse Spark 1.3Meta · muse-spark-1.3 · max effort
1650
9
Alibaba: Qwen 3.8 Flash NextAlibaba · qwen3.8-flash-next
1631
10
Anthropic: Claude Fable 5Anthropic · claude-fable-5
1628

Arena agent

10 modelsFull board
#ModelScore
1
Anthropic: Claude Fable 5.1Anthropic · claude-fable-5.1 · max effort
14.51
2
OpenAI: GPT-6 AstraOpenAI · gpt-6-astra · max effort
12.55
3
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · high effort
11.42
4
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · max effort
10.79
5
Anthropic: Claude Fable 5Anthropic · Claude Fable 5 · high effort
9.15
6
OpenAI: GPT-5.6 SolOpenAI · gpt-5.6-sol · xhigh effort
7.75
7
Anthropic: Claude Opus 4.8 ThinkingAnthropic · claude-opus-4-8 · high effort
7.69
8
Moonshot: Kimi K3Moonshot · kimi-k3 · max effort
6.59
9
Anthropic: Claude Sonnet 5 ThinkingAnthropic · Claude Sonnet 5 · high effort
6.31
10
Hy4 previewTencent · hy4-preview
5.37

Arena text

Top 10 of 19Full board
#ModelScore
1
Anthropic: Claude Fable 5Anthropic · claude-fable-5
1507
2
Anthropic: Claude 4.6 Opus ThinkingAnthropic · claude-opus-4-6 · high effort
1505
3
Anthropic: Claude Fable 5.1Anthropic · claude-fable-5.1 · max effort
1504
4
Anthropic: Claude 4.7 Opus ThinkingAnthropic · claude-opus-4-7 · high effort
1502
5
Meta: Muse Spark 1.2Meta · muse-spark-1.2 · xhigh effort
1499
6
Anthropic: Claude 4.6 Opus ThinkingAnthropic · claude-opus-4.6
1498
7
Anthropic: Claude 4.7 Opus ThinkingAnthropic · claude-opus-4-7
1494
8
Google: Gemini 3.8 FlashGoogle · gemini-3.8-flash · high effort
1494
9
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · high effort
1493
10
Meta: Muse Spark 1.1Meta · muse-spark-1.1
1492

Arena vision

Top 10 of 19Full board
#ModelScore
1
Anthropic: Claude Fable 5Anthropic · claude-fable-5
1313
2
Anthropic: Claude 4.7 Opus ThinkingAnthropic · claude-opus-4-7 · high effort
1301
3
Qwen3.8 MaxAlibaba · qwen3.8 · max effort
1300
4
Anthropic: Claude 4.6 Opus ThinkingAnthropic · claude-opus-4-6 · high effort
1299
5
Anthropic: Claude 4.7 Opus ThinkingAnthropic · claude-opus-4-7
1299
6
Anthropic: Claude 4.6 Opus ThinkingAnthropic · claude-opus-4.6
1293
7
Meta: Muse Spark 1.2Meta · muse-spark-1.2 · xhigh effort
1292
8
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · high effort
1290
9
Google: Gemini 3 ProGoogle · gemini-3-pro
1289
10
OpenAI: GPT-5.5OpenAI · gpt-5.5
1286

Artificial Analysis

Top 10 of 129Full board
#ModelScore
1
OpenAI: GPT-6 AstraOpenAI · gpt-6-astra
61AA intelligence
2
xAI: Grok 4.6xAI · grok-4.6 · high effort
61AA intelligence
3
Meta: Muse Spark 1.3Meta · muse-spark-1.3 · xhigh effort
61AA intelligence
4
Anthropic: Claude Fable 5.1Anthropic · claude-fable-5.1
53.4AA intelligence
5
Anthropic: Claude Opus 5Anthropic · claude-opus-5
50.7AA intelligence
6
Anthropic: Claude Fable 5Anthropic · claude-fable-5
49.7AA intelligence
7
OpenAI: GPT-5.6 SolOpenAI · gpt-5.6-sol
47.1AA intelligence
8
Z.ai: GLM-5.3z-ai · glm-5.3
44.9AA intelligence
9
xAI: Grok 4.6x-ai · grok-4.6
44.4AA intelligence
10
Moonshot: Kimi K3moonshotai · kimi-k3
43.8AA intelligence

Sources

Arena Elo from Arena AI, via open dumps by oolong-tea-2026. Artificial Analysis indices via OpenRouter (subset). Artificial Analysis for the indices themselves. Plus vendor-reported launch evals collected from announcements, analyst writeups, launch blogs, and community benchmarks. As of .

Turn benchmark scores into working sessions

Run agents in a local Git-enabled workspace, connect to another machine when needed, and track the sessions and tokens behind your work. See what your AI subscriptions covered.

CLI for macOS, Linux, and Windows

Data and list-price estimates may contain mistakes. Not investment advice.