+5.92.5× cost
+19.934.3× cost
+17.19.5× cost
+16.19.9× cost
+17.34.7× cost
+10.05.2× cost
+8.02.7× cost
+14.111.5× cost
+6.73.2× cost
+13.23.8× cost
Can the model complete substantial programming work under this benchmark's agent setup?
One row per model, using its best reported score across effort settings.
| Rank | Model | Best score | Best reported setting |
|---|---|---|---|
| 1 | Claude Opus 5.5Anthropic | 57.8% | max effortAnthropic report6 values · 2 reportsSep 22, 2026 · source |
| 2 | Claude Fable 5.1Anthropic | 51.8% | Reported configurationAnthropic report6 values · 2 reportsSep 22, 2026 · source |
| 3 | Claude Opus 5Anthropic | 46.6% | Reported configurationAnthropic report6 values · 2 reportsSep 22, 2026 · source |
| 4 | Grok 4.7SpaceXAI | 46.3% | xhigh effortSpaceXAI report5 values · 2 reportsSep 21, 2026 · source |
| 5 | GPT-5.6 SolOpenAI | 41.7% | Reported configurationAnthropic report6 values · 2 reportsSep 22, 2026 · source |
| 6 | Muse Spark 1.3Meta | 41.6% | max effort$2.64 / task6 values · 1 reportSep 10, 2026 · source |
| 7 | Grok 4.6SpaceXAI | 41.4% | xhigh effort$6.10 / task4 values · 1 reportSep 10, 2026 · source |
| 8 | GPT-5.6 TerraOpenAI | 41.3% | max effort$5.14 / task5 values · 1 reportSep 10, 2026 · source |
| 9 | Gemini 3.8 FlashGoogle | 39.6% | high effort$4.70 / task2 values · 1 reportSep 10, 2026 · source |
| 10 | GPT-5.6 LunaOpenAI | 35.9% | max effort$1.03 / task5 values · 1 reportSep 10, 2026 · source |
| 11 | Claude Sonnet 5Anthropic | 34.1% | max effort$7.17 / task5 values · 1 reportSep 10, 2026 · source |
| 12 | Composer 2.5Cursor | 27.7% | Reported configuration$0.68 / task1 value · 1 reportSep 10, 2026 · source |
Every sourced cost-linked effort value for this exact version. Lines connect complete sweeps only.
+5.92.5× cost
+19.934.3× cost
+17.19.5× cost
+16.19.9× cost
+17.34.7× cost
+10.05.2× cost
+8.02.7× cost
+14.111.5× cost
+6.73.2× cost
+13.23.8× cost
Can the model complete substantial programming work under this benchmark's agent setup?
Software implementation, debugging, or repository work under the published evaluation protocol. Higher is better. Cursor's official CursorBench 4.0 score is a percentage.
Effort and harness are model-specific. The page warns that results have variance; small score differences may not be statistically meaningful. Costs are the publisher's pricing-based average, not observed billed amounts.
Cursor's leaderboard prints source model label "Opus 5.5 Max", 57.8% score, average cost/task $13.43, 218,363 tokens, and 185 steps. Cursor's leaderboard prints source model label "Opus 5.5 Extra High", 56.0% score, average cost/task $6.98, 101,083 tokens, and 109 steps. Cursor's leaderboard prints source model label "Opus 5.5 High", 56.0% score, average cost/task $3.97, 53,078 tokens, and 68 steps. Cursor's leaderboard prints source model label "Opus 5.5 Medium", 52.5% score, average cost/task $2.91, 37,954 tokens, and 54 steps. Cursor's leaderboard prints source model label "Fable 5.1 Max", 51.8% score, average cost/task $17.28, 117,236 tokens, and 128 steps. Cursor's leaderboard prints source model label "Fable 5.1 Extra High", 51.6% score, average cost/task $13.01, 87,294 tokens, and 101 steps. Cursor's leaderboard prints source model label "Fable 5.1 High", 49.2% score, average cost/task $9.08, 58,438 tokens, and 77 steps. Cursor's leaderboard prints source model label "Fable 5.1 Medium", 46.8% score, average cost/task $7.05, 45,411 tokens, and 63 steps. Cursor's leaderboard prints source model label "Opus 5 Max", 46.6% score, average cost/task $11.95, 85,384 tokens, and 106 steps. Cursor's leaderboard prints source model label "Grok 4.7 Extra High", 46.3% score, average cost/task $6.01, 70,141 tokens, and 88 steps. Cursor's leaderboard prints source model label "Opus 5 Extra High", 46.1% score, average cost/task $11.43, 80,094 tokens, and 103 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Max", 41.3% score, average cost/task $5.14, 60,814 tokens, and 107 steps. Cursor's leaderboard prints source model label "Fable 5.1 Low", 45.1% score, average cost/task $5.44, 34,795 tokens, and 51 steps. Cursor's leaderboard prints source model label "Opus 5 High", 44.7% score, average cost/task $9.00, 61,405 tokens, and 86 steps. Cursor's leaderboard prints source model label "Grok 4.7 High", 43.9% score, average cost/task $4.69, 56,382 tokens, and 71 steps. Cursor's leaderboard prints source model label "Opus 5.5 Low", 43.7% score, average cost/task $1.17, 15,811 tokens, and 28 steps. Cursor's leaderboard prints source model label "Opus 5 Medium", 43.3% score, average cost/task $6.94, 45,272 tokens, and 72 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Max", 41.7% score, average cost/task $8.23, 42,944 tokens, and 99 steps. Cursor's leaderboard prints source model label "Grok 4.7 Medium", 41.6% score, average cost/task $3.49, 36,683 tokens, and 60 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Max", 41.6% score, average cost/task $2.64, 52,005 tokens, and 98 steps. Cursor's leaderboard prints source model label "Grok 4.6 Extra High", 41.4% score, average cost/task $6.10, 49,814 tokens, and 56 steps. Cursor's leaderboard prints source model label "Opus 5 Low", 40.7% score, average cost/task $4.87, 31,995 tokens, and 57 steps. Cursor's leaderboard prints source model label "Grok 4.6 High", 40.4% score, average cost/task $5.20, 41,387 tokens, and 48 steps. Cursor's leaderboard prints source model label "Gemini 3.8 Flash High", 39.6% score, average cost/task $4.70, 162,565 tokens, and 324 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Extra High", 37.7% score, average cost/task $4.40, 24,729 tokens, and 55 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Extra High", 37.5% score, average cost/task $2.10, 40,891 tokens, and 83 steps. Cursor's leaderboard prints source model label "Gemini 3.8 Flash Medium", 37.3% score, average cost/task $4.06, 128,364 tokens, and 290 steps. Cursor's leaderboard prints source model label "Grok 4.6 Medium", 36.1% score, average cost/task $3.48, 24,893 tokens, and 40 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Max", 35.9% score, average cost/task $1.03, 87,284 tokens, and 208 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol High", 35.7% score, average cost/task $2.85, 16,174 tokens, and 41 steps. Cursor's leaderboard prints source model label "Sonnet 5 Max", 34.1% score, average cost/task $7.17, 149,257 tokens, and 140 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Extra High", 33.6% score, average cost/task $1.81, 23,436 tokens, and 43 steps. Cursor's leaderboard prints source model label "Grok 4.6 Low", 33.4% score, average cost/task $2.25, 16,307 tokens, and 32 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 High", 33.4% score, average cost/task $1.66, 30,654 tokens, and 69 steps. Cursor's leaderboard prints source model label "Grok 4.7 Low", 33.1% score, average cost/task $1.58, 15,677 tokens, and 40 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Extra High", 33.0% score, average cost/task $0.44, 40,598 tokens, and 98 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Medium", 32.6% score, average cost/task $1.49, 27,255 tokens, and 64 steps. Cursor's leaderboard prints source model label "Sonnet 5 Extra High", 32.0% score, average cost/task $4.55, 83,373 tokens, and 102 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Medium", 31.1% score, average cost/task $1.77, 10,111 tokens, and 32 steps. Cursor's leaderboard prints source model label "Sonnet 5 High", 30.8% score, average cost/task $3.48, 61,146 tokens, and 85 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra High", 30.7% score, average cost/task $1.11, 13,162 tokens, and 33 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna High", 29.4% score, average cost/task $0.25, 23,368 tokens, and 64 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Low", 29.3% score, average cost/task $0.93, 17,483 tokens, and 47 steps. Cursor's leaderboard prints source model label "Sonnet 5 Medium", 28.0% score, average cost/task $2.31, 39,114 tokens, and 65 steps. Cursor's leaderboard prints source model label "Composer 2.5", 27.7% score, average cost/task $0.68, 17,347 tokens, and 41 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Medium", 27.6% score, average cost/task $0.64, 7,307 tokens, and 25 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Low", 25.2% score, average cost/task $0.52, 5,914 tokens, and 23 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Low", 24.6% score, average cost/task $0.87, 4,885 tokens, and 21 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Minimal", 24.3% score, average cost/task $0.56, 10,620 tokens, and 34 steps. Cursor's leaderboard prints source model label "Sonnet 5 Low", 24.1% score, average cost/task $1.39, 23,772 tokens, and 46 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Medium", 22.2% score, average cost/task $0.08, 7,642 tokens, and 32 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Low", 16.0% score, average cost/task $0.03, 3,288 tokens, and 18 steps. Anthropic's table gives Opus 5.5 adaptive Max. The exact model comparison values are retained as printed; the GPT-6 Astra cell is null and omitted. SpaceXAI's table reports 46.3% for Grok 4.7 at xhigh; the table does not print the CursorBench harness or task-set revision.
Method / source