Skip to main content

byEmulated

Autoresearch
Bench

Evaluating language model agents
on long-horizon autonomous research

Rankings

Every model and agent harness on one table, ranked by normalized reward.

Sample data for illustration.

Results for
1

Claude Fable 5

Claude Code0.742$21.635
2

Claude Opus 5

Claude Code0.731$11.845
3

GPT-5.6 Sol

Codex0.719$6.465
4

GLM-5.3

Claude Code0.697$3.995
5

Gemini 3.7 Flash

Gemini CLI0.684$2.185
6

Claude Opus 4.8

Claude Code0.672$13.525
7

GPT-5.6 Luna

Codex0.661$0.615
8

Kimi K3

Kimi CLI0.649$4.655
9

Claude Sonnet 5

Claude Code0.638$5.425
10

GPT-5.6 Terra

Codex0.626$2.945
11

Gemini 3.6 Flash

Gemini CLI0.614$1.655
12

GPT-5.5

Codex0.601$7.235
13

Grok 4.6

Grok CLI0.588$5.505
14

Grok 4.5

Grok CLI0.571$4.825
15

GLM-5.2

Claude Code0.556$3.215
16

Claude Opus 4.7

Claude Code0.542$14.475
17

Claude Sonnet 4.6

Claude Code0.529$4.185
18

Gemini 3.1 Pro

Gemini CLI0.514$3.765
19

Qwen3.8 Max

Qwen Code0.498$3.185
20

Qwen3.8 27B

Qwen Code0.479$1.125
21

Qwen3.6 Plus

Qwen Code0.458$0.825
22

DeepSeek V4 Pro

Claude Code0.437$2.345
23

Kimi K2.6

Kimi CLI0.416$2.585
24

Kimi K2.5

Kimi CLI0.391$1.915
25

Composer 2.5

Cursor CLI0.362$10.205

Performance and cost

Score against mean API spend per completed run.

Results for
Pareto frontier
Qwen
Qwen
Qwen

Browse individual environments and agent runs. View all tasks