Rankings
Every model and agent harness on one table, ranked by normalized reward.
Sample data for illustration.
Results for
| 1 | Claude Fable 5 | Claude Code | 0.742 | $21.63 | 5 |
| 2 | Claude Opus 5 | Claude Code | 0.731 | $11.84 | 5 |
| 3 | GPT-5.6 Sol | Codex | 0.719 | $6.46 | 5 |
| 4 | GLM-5.3 | Claude Code | 0.697 | $3.99 | 5 |
| 5 | Gemini 3.7 Flash | Gemini CLI | 0.684 | $2.18 | 5 |
| 6 | Claude Opus 4.8 | Claude Code | 0.672 | $13.52 | 5 |
| 7 | GPT-5.6 Luna | Codex | 0.661 | $0.61 | 5 |
| 8 | Kimi K3 | Kimi CLI | 0.649 | $4.65 | 5 |
| 9 | Claude Sonnet 5 | Claude Code | 0.638 | $5.42 | 5 |
| 10 | GPT-5.6 Terra | Codex | 0.626 | $2.94 | 5 |
| 11 | Gemini 3.6 Flash | Gemini CLI | 0.614 | $1.65 | 5 |
| 12 | GPT-5.5 | Codex | 0.601 | $7.23 | 5 |
| 13 | Grok 4.6 | Grok CLI | 0.588 | $5.50 | 5 |
| 14 | Grok 4.5 | Grok CLI | 0.571 | $4.82 | 5 |
| 15 | GLM-5.2 | Claude Code | 0.556 | $3.21 | 5 |
| 16 | Claude Opus 4.7 | Claude Code | 0.542 | $14.47 | 5 |
| 17 | Claude Sonnet 4.6 | Claude Code | 0.529 | $4.18 | 5 |
| 18 | Gemini 3.1 Pro | Gemini CLI | 0.514 | $3.76 | 5 |
| 19 | Qwen3.8 Max | Qwen Code | 0.498 | $3.18 | 5 |
| 20 | Qwen3.8 27B | Qwen Code | 0.479 | $1.12 | 5 |
| 21 | Qwen3.6 Plus | Qwen Code | 0.458 | $0.82 | 5 |
| 22 | DeepSeek V4 Pro | Claude Code | 0.437 | $2.34 | 5 |
| 23 | Kimi K2.6 | Kimi CLI | 0.416 | $2.58 | 5 |
| 24 | Kimi K2.5 | Kimi CLI | 0.391 | $1.91 | 5 |
| 25 | Composer 2.5 | Cursor CLI | 0.362 | $10.20 | 5 |
Performance and cost
Score against mean API spend per completed run.
Results for
Pareto frontier
Tasks
Browse individual environments and agent runs. View all tasks