PlatformBenchmarksModelsComparisonAboutOpen app
A Puma experiment

Models

Every model we evaluate

Index scores, cost, and latency. Filter by lab or search by name. Scores are measurements, not a claim that one model is the future.

#ModelIndexCost / testLatencyReleased
1Claude Opus 5
Anthropic
67.21%$19.2855m 49s2026-07-22
2Claude Fable 5
Anthropic
66.04%$28.8037m 51s2026-06-09
3GPT-5.6 Sol
OpenAI
63.71%$13.7932m 24s2026-07-09
4Claude Opus 4.8
Anthropic
60.91%$12.6736m 22s2026-05-28
5GPT-5.6 Luna
OpenAI
59.88%$0.6223m 16s2026-07-09
6Claude Sonnet 5
Anthropic
59.61%$17.7045m 46s2026-06-30
7Grok 4.6
SpaceXAI
59.17%$4.3438m 4s2026-08-12
8Kimi K3
Moonshot · Open weights
57.81%$6.4769m 34s2026-07-16
9GPT 5.5
OpenAI
57.41%$6.1420m 51s2026-05-15
10Muse Spark 1.2
Meta
57.05%$1.6616m 49s2026-08-05
11GPT-5.6 Terra
OpenAI
56.53%$1.8011m 40s2026-07-09
12Claude Opus 4.7
Anthropic
56.11%$12.7728m 26s2026-05-01
13Gemini 3.6 Flash
Google
55.35%$3.0322m 8s2026-07-21
14Muse Spark 1.1
Meta
54.75%$1.2513m 48s2026-06-15
15DeepSeek V4 Flash 0731
DeepSeek · Open weights
53.57%$0.2234m 55s2026-07-31
16GLM 5.2
zAI · Open weights
53.12%$4.2942m 7s2026-06-13
17Gemini 3.5 Flash
Google
53.08%$2.9111m 1s2026-05-22
18DeepSeek V4 Pro 0813
DeepSeek · Open weights
52.37%$0.8458m 18s2026-08-13
19Qwen 3.8 Max
Alibaba
51.84%$4.0090m 46s2026-08-03
20Grok 4.5
SpaceXAI
51.53%$1.9613m 58s2026-07-16
21Claude Sonnet 4.6
Anthropic
50.59%$8.4934m 46s2026-04-20
22Inkling
Thinking · Open weights
49.28%$0.4130m 0s2026-07-15
23Qwen 3.7 Max
Alibaba
44.77%$2.8529m 42s2026-05-20
24Nemotron 3 Ultra
NVIDIA · Open weights
43.99%$1.1026m 40s2026-06-04
25Kimi K2.6
Moonshot · Open weights
43.47%$1.8539m 52s2026-04-28
26DeepSeek V4
DeepSeek · Open weights
42.89%$0.9323m 47s2026-06-01
27MiniMax-M3
MiniMax · Open weights
42.72%$2.5035m 15s2026-05-31
28Gemma 4 31B IT
Google · Open weights
38.94%$0.355m 23s2026-04-10
29Mistral Medium 3.5
Mistral · Open weights
17.95%$8.0157m 26s2026-03-20