External benchmark rankings

Epoch Capabilities Index

Epoch AI's broad capabilities index.

Epoch AI Benchmarking Hub

Ranked among models offered by everyais · 13 models

Data source: Epoch AI Benchmarking HubLicense: CC-BYLast synced:
Epoch AI Benchmarking Hub leaderboard · Ranked among models offered by everyais
RankModelScore
1GPT-6 Astra
Evaluation target / conditions: GPT-6 Astra
Measurement date not providedView source
169.23 (source scale)
2Claude Fable 5
Evaluation target / conditions: Claude Fable 5
Measurement date not providedView source
162.9 (source scale)
3Claude Fable 5.1
Evaluation target / conditions: Claude Fable 5.1
Measurement date not providedView source
162.88 (source scale)
4GPT-5.6 Sol
Evaluation target / conditions: GPT-5.6 Sol
Measurement date not providedView source
162.03 (source scale)
5GPT-5.6 Terra
Evaluation target / conditions: GPT-5.6 Terra
Measurement date not providedView source
159.18 (source scale)
6Claude Opus 4.8
Evaluation target / conditions: Claude Opus 4.8
Measurement date not providedView source
158.24 (source scale)
7Kimi K3
Evaluation target / conditions: Kimi K3
Measurement date not providedView source
157.62 (source scale)
8Gemini 3.7 Flash
Evaluation target / conditions: Gemini 3.7 Flash
Measurement date not providedView source
157.32 (source scale)
9GPT-5.6 Luna
Evaluation target / conditions: GPT-5.6 Luna
Measurement date not providedView source
156.33 (source scale)
10DeepSeek V4 Flash 0731
Evaluation target / conditions: DeepSeek V4 Flash 0731
Measurement date not providedView source
154.46 (source scale)
11GLM-5.2
Evaluation target / conditions: GLM-5.2
Measurement date not providedView source
151.98 (source scale)
12GLM-5.3 Flash
Evaluation target / conditions: GLM-5.3-Flash
Measurement date not providedView source
151.64 (source scale)
13MiniMax M3
Evaluation target / conditions: MiniMax-M3
Measurement date not providedView source
146.57 (source scale)

About these rankings

Each source, unit and index version has its own ranking. This is not the source’s full leaderboard. Equal scores share a rank.

Results use the source’s evaluation settings; they do not represent everyais default API settings.

Models without evaluation data are not ranked; missing data does not mean a low score.

Sync time is separate from the measurement date.