GPT-6 Astra

OpenAI#1 of 2 by best run
Compare models
Best success72%in Codex
Cheapest run$1.20per task in OpenCode
Fastest run122sper task in Hermes Agent
Best harness
Codex
Graded runs
6 of 7 harnesses
Latest run
2026-09-10

Success rate

% of tasks passed by harness · higher is better
Codex
72.4%
Hermes Agent
72.4%
Command Code
72.4%
Claude Code
69.0%
OpenCode
65.5%
Pi Agent
65.5%

Time per task

Seconds per task by harness · lower is better
Hermes Agent
122s
OpenCode
126s
Pi Agent
127s
Codex
151s
Command Code
159s
Claude Code
194s

Runs

  1. 01Codex
    72%
    $ / task$1.63Time / task151s
  2. 02Hermes Agent
    72%
    $ / task$1.51Time / task122s
  3. 03Command Code
    72%
    $ / task$2.06Time / task159s
  4. 04Claude Code
    69%
    $ / task$15.72Time / task194s
  5. 05OpenCode
    66%
    $ / task$1.20Time / task126s
  6. 06Pi Agent
    66%
    $ / task$1.29Time / task127s

1 harness not yet run. Pages fill in as new runs land