Skip to main content

Autoresearch
Bench

Evaluating language model agents
on long-horizon autonomous research

Rankings

Every model and agent harness on one table, ranked by normalized reward.

Sample data for illustration.

Results for
1

Claude Fable 5

Claude Code0.742$21.63
2

Claude Opus 5

Claude Code0.731$11.84
3

GPT-5.6 Sol

Codex0.719$6.46
4

GLM-5.3

Claude Code0.697$3.99
5

Gemini 3.7 Flash

Gemini CLI0.684$2.18
6

Claude Opus 4.8

Claude Code0.672$13.52
7

GPT-5.6 Luna

Codex0.661$0.61
8

Kimi K3

Kimi CLI0.649$4.65
9

Claude Sonnet 5

Claude Code0.638$5.42
10

GPT-5.6 Terra

Codex0.626$2.94
11

Gemini 3.6 Flash

Gemini CLI0.614$1.65
12

GPT-5.5

Codex0.601$7.23
13

Grok 4.6

Grok CLI0.588$5.50
14

Grok 4.5

Grok CLI0.571$4.82
15

GLM-5.2

Claude Code0.556$3.21
16

Claude Opus 4.7

Claude Code0.542$14.47
17

Claude Sonnet 4.6

Claude Code0.529$4.18
18

Gemini 3.1 Pro

Gemini CLI0.514$3.76
19

Qwen3.8 Max

Qwen Code0.498$3.18
20

Qwen3.8 27B

Qwen Code0.479$1.12
21

Qwen3.6 Plus

Qwen Code0.458$0.82
22

DeepSeek V4 Pro

Claude Code0.437$2.34
23

Kimi K2.6

Kimi CLI0.416$2.58
24

Kimi K2.5

Kimi CLI0.391$1.91
25

Composer 2.5

Cursor CLI0.362$10.20

Performance and cost

Score against mean API spend per completed run.

Results for
Pareto frontier
Qwen
Qwen
Qwen

Browse individual environments and agent runs. View all tasks