tokenstat
tokenstat

Model catalog

Benchmarks

Arena Elo from free open daily snapshots on GitHub (text, code, vision, agent), plus a sparse Artificial Analysis subset OpenRouter embeds. One score set is cross-linked onto provider clones of the same model. Arena may score the same base model at different reasoning efforts, so those rows stay separate and link to the base model only when it exists in the catalog. The open dumps publish 20 models per Arena board (10 on agent), so a full board is short by design. Empty on a single board is a gap, not a ranking of zero.

44 scored rows on this board · 417 linked into the catalog · as of · Models · AI plans

#ModelScore
1
OpenAI: GPT-6 AstraOpenAI · gpt-6-astra · max effort
1800Arena code
2
Anthropic: Claude Fable 5.1Anthropic · claude-fable-5.1 · max effort
1758Arena code
3
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · max effort
1687Arena code
4
Qwen3.8 Max 0902Alibaba · qwen3.8-max-0902
1681Arena code
5
Moonshot: Kimi K3Moonshot · kimi-k3 · max effort
1674Arena code
6
Qwen3.8 MaxAlibaba · qwen3.8 · max effort
1671Arena code
7
Anthropic: Claude Opus 5Anthropic · claude-opus-5 · high effort
1660Arena code
8
Meta: Muse Spark 1.3Meta · muse-spark-1.3 · max effort
1652Arena code
9
Qwen3.8 Flash NextAlibaba · qwen3.8-flash-next
1635Arena code
10
Anthropic: Claude Fable 5Anthropic · claude-fable-5 · high effort
1628Arena code
11
Hy4 previewTencent · hy4-preview
1624Arena code
12
Meta: Muse Spark 1.3Meta · muse-spark-1.3 · xhigh effort
1623Arena code
13
xAI: Grok 4.6xAI · grok-4.6 · high effort
1618Arena code
14
OpenAI: GPT-5.6 SolOpenAI · gpt-5.6-sol-xhigh · codex-harness effort
1617Arena code
15
DeepSeek: V4.1 FlashDeepSeek · deepseek-v4.1-flash · max effort
1614Arena code
16
Mistral: GLM-5.3Z.ai · glm-5.3 · max effort
1614Arena code
17
Z.ai: GLM 5.3 FlashZ.ai · glm-5.3-flash
1607Arena code
18
Qwen3.8 27BAlibaba · qwen3.8-27b
1593Arena code
19
Mistral: GLM-5.2Z.ai · glm-5.2 · max effort
1592Arena code
20
Google: Gemini 3.7 FlashGoogle · gemini-3.7-flash · high effort
1587Arena code
21
deepseek-v4-pro-high-20260813DeepSeek · deepseek-v4-pro-high-20260813 · not linked in catalog
1581Arena code
22
DeepSeek: V4 FlashDeepSeek · deepseek-v4-flash · high effort
1580Arena code
23
Google: Gemini 3.8 FlashGoogle · gemini-3.8-flash · high effort
1568Arena code
24
Anthropic: Claude Opus 4.8 ThinkingAnthropic · claude-opus-4-8 · high effort
1559Arena code
25
Anthropic: Claude 4.7 Opus ThinkingAnthropic · claude-opus-4-7
1557Arena code
26
Anthropic: Claude 4.7 Opus ThinkingAnthropic · claude-opus-4-7 · high effort
1555Arena code
27
xAI: Grok 4.5xAI · grok-4.5
1555Arena code
28
Anthropic: Claude 4.6 Opus ThinkingAnthropic · claude-opus-4-6 · high effort
1547Arena code
29
Meta: Muse Spark 1.1Meta · muse-spark-1.1
1542Arena code
30
Anthropic: Claude Opus 4.8 ThinkingAnthropic · claude-opus-4-8
1539Arena code
31
Anthropic: Claude 4.6 Opus ThinkingAnthropic · claude-opus-4.6
1537Arena code
32
Anthropic: Claude Sonnet 5 ThinkingAnthropic · claude-sonnet-5 · high effort
1537Arena code
33
Google: Gemini 3.6 FlashGoogle · gemini-3.6-flash · high effort
1537Arena code
34
Meta: Muse Spark 1.2Meta · muse-spark-1.2 · xhigh effort
1534Arena code
35
Anthropic: Claude Sonnet 4.6 ThinkingAnthropic · claude-sonnet-4-6
1521Arena code
36
OpenAI: GPT-5.6 TerraOpenAI · gpt-5.6-terra-xhigh · codex-harness effort
1521Arena code
37
OpenAI: GPT-5.6 LunaOpenAI · gpt-5.6-luna-xhigh · codex-harness effort
1519Arena code
38
seed-2.1-pro-previewBytedance · seed-2.1-pro-preview · not linked in catalog
1519Arena code
39
Qwen3.7 MaxAlibaba · qwen3.7-max-20260517
1517Arena code
40
Hy3 (Free)Tencent · hy3
1513Arena code
41
OpenAI: GPT-5.5OpenAI · gpt-5.5-xhigh · codex-harness effort
1510Arena code
42
Moonshot: Kimi K2.6Moonshot · kimi-k2.6
1509Arena code
43
Z.ai: GLM-5.1Z.ai · glm-5.1
1508Arena code
44
Google: Gemini 3.5 FlashGoogle · gemini-3.5-flash · high effort
1500Arena code

Sources

Arena Elo from Arena AI, via open dumps by oolong-tea-2026. Artificial Analysis indices via OpenRouter (subset). Artificial Analysis for the indices themselves. Plus vendor-reported launch evals collected from announcements, analyst writeups, launch blogs, and community benchmarks. As of .

Turn benchmark scores into working sessions

Run agents in a local Git-enabled workspace, connect to another machine when needed, and track the sessions and tokens behind your work. See what your AI subscriptions covered.

CLI for macOS, Linux, and Windows

Data and list-price estimates may contain mistakes. Not investment advice.