CursorBenchBrowse 296

CursorBench

Can the model complete substantial programming work under this benchmark's agent setup?

Latest stable4.0
Coding12 ranked models57 reported values3 reportsHigher is better

Top rankings

One row per model, using its best reported score across effort settings.

12
RankModelBest scoreBest reported setting
1Claude Opus 5.5Anthropic57.8%max effortAnthropic report6 values · 2 reportsSep 22, 2026 · source
2Claude Fable 5.1Anthropic51.8%Reported configurationAnthropic report6 values · 2 reportsSep 22, 2026 · source
3Claude Opus 5Anthropic46.6%Reported configurationAnthropic report6 values · 2 reportsSep 22, 2026 · source
4Grok 4.7SpaceXAI46.3%xhigh effortSpaceXAI report5 values · 2 reportsSep 21, 2026 · source
5GPT-5.6 SolOpenAI41.7%Reported configurationAnthropic report6 values · 2 reportsSep 22, 2026 · source
6Muse Spark 1.3Meta41.6%max effort$2.64 / task6 values · 1 reportSep 10, 2026 · source
7Grok 4.6SpaceXAI41.4%xhigh effort$6.10 / task4 values · 1 reportSep 10, 2026 · source
8GPT-5.6 TerraOpenAI41.3%max effort$5.14 / task5 values · 1 reportSep 10, 2026 · source
9Gemini 3.8 FlashGoogle39.6%high effort$4.70 / task2 values · 1 reportSep 10, 2026 · source
10GPT-5.6 LunaOpenAI35.9%max effort$1.03 / task5 values · 1 reportSep 10, 2026 · source
11Claude Sonnet 5Anthropic34.1%max effort$7.17 / task5 values · 1 reportSep 10, 2026 · source
12Composer 2.5Cursor27.7%Reported configuration$0.68 / task1 value · 1 reportSep 10, 2026 · source

Effort curve

Every sourced cost-linked effort value for this exact version. Lines connect complete sweeps only.

52
Cursor · Cursor reportClaude Opus 5

+5.92.5× cost

EffortScoreCost/task
max46.6%$11.95
xhigh46.1%$11.43
high44.7%$9.00
medium43.3%$6.94
low40.7%$4.87
Cursor · Cursor reportGPT-5.6 Luna

+19.934.3× cost

EffortScoreCost/task
max35.9%$1.03
xhigh33.0%$0.44
high29.4%$0.25
medium22.2%$0.08
low16.0%$0.03
Cursor · Cursor reportGPT-5.6 Sol

+17.19.5× cost

EffortScoreCost/task
max41.7%$8.23
xhigh37.7%$4.40
high35.7%$2.85
medium31.1%$1.77
low24.6%$0.87
Cursor · Cursor reportGPT-5.6 Terra

+16.19.9× cost

EffortScoreCost/task
max41.3%$5.14
xhigh33.6%$1.81
high30.7%$1.11
medium27.6%$0.64
low25.2%$0.52
Cursor · Cursor reportMuse Spark 1.3

+17.34.7× cost

EffortScoreCost/task
max41.6%$2.64
xhigh37.5%$2.10
high33.4%$1.66
medium32.6%$1.49
low29.3%$0.93
minimal24.3%$0.56
Cursor · Cursor reportClaude Sonnet 5

+10.05.2× cost

EffortScoreCost/task
max34.1%$7.17
xhigh32.0%$4.55
high30.8%$3.48
medium28.0%$2.31
low24.1%$1.39
Cursor · Cursor reportGrok 4.6

+8.02.7× cost

EffortScoreCost/task
xhigh41.4%$6.10
high40.4%$5.20
medium36.1%$3.48
low33.4%$2.25
Cursor · Cursor reportClaude Opus 5.5

+14.111.5× cost

EffortScoreCost/task
max57.8%$13.43
xhigh56.0%$6.98
high56.0%$3.97
medium52.5%$2.91
low43.7%$1.17
Cursor · Cursor reportClaude Fable 5.1

+6.73.2× cost

EffortScoreCost/task
max51.8%$17.28
xhigh51.6%$13.01
high49.2%$9.08
medium46.8%$7.05
low45.1%$5.44
Cursor · Cursor reportGrok 4.7

+13.23.8× cost

EffortScoreCost/task
xhigh46.3%$6.01
high43.9%$4.69
medium41.6%$3.49
low33.1%$1.58
Definition and comparison boundarypublic methodology

Can the model complete substantial programming work under this benchmark's agent setup?

Software implementation, debugging, or repository work under the published evaluation protocol. Higher is better. Cursor's official CursorBench 4.0 score is a percentage.

Effort and harness are model-specific. The page warns that results have variance; small score differences may not be statistically meaningful. Costs are the publisher's pricing-based average, not observed billed amounts.

Cursor's leaderboard prints source model label "Opus 5.5 Max", 57.8% score, average cost/task $13.43, 218,363 tokens, and 185 steps. Cursor's leaderboard prints source model label "Opus 5.5 Extra High", 56.0% score, average cost/task $6.98, 101,083 tokens, and 109 steps. Cursor's leaderboard prints source model label "Opus 5.5 High", 56.0% score, average cost/task $3.97, 53,078 tokens, and 68 steps. Cursor's leaderboard prints source model label "Opus 5.5 Medium", 52.5% score, average cost/task $2.91, 37,954 tokens, and 54 steps. Cursor's leaderboard prints source model label "Fable 5.1 Max", 51.8% score, average cost/task $17.28, 117,236 tokens, and 128 steps. Cursor's leaderboard prints source model label "Fable 5.1 Extra High", 51.6% score, average cost/task $13.01, 87,294 tokens, and 101 steps. Cursor's leaderboard prints source model label "Fable 5.1 High", 49.2% score, average cost/task $9.08, 58,438 tokens, and 77 steps. Cursor's leaderboard prints source model label "Fable 5.1 Medium", 46.8% score, average cost/task $7.05, 45,411 tokens, and 63 steps. Cursor's leaderboard prints source model label "Opus 5 Max", 46.6% score, average cost/task $11.95, 85,384 tokens, and 106 steps. Cursor's leaderboard prints source model label "Grok 4.7 Extra High", 46.3% score, average cost/task $6.01, 70,141 tokens, and 88 steps. Cursor's leaderboard prints source model label "Opus 5 Extra High", 46.1% score, average cost/task $11.43, 80,094 tokens, and 103 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Max", 41.3% score, average cost/task $5.14, 60,814 tokens, and 107 steps. Cursor's leaderboard prints source model label "Fable 5.1 Low", 45.1% score, average cost/task $5.44, 34,795 tokens, and 51 steps. Cursor's leaderboard prints source model label "Opus 5 High", 44.7% score, average cost/task $9.00, 61,405 tokens, and 86 steps. Cursor's leaderboard prints source model label "Grok 4.7 High", 43.9% score, average cost/task $4.69, 56,382 tokens, and 71 steps. Cursor's leaderboard prints source model label "Opus 5.5 Low", 43.7% score, average cost/task $1.17, 15,811 tokens, and 28 steps. Cursor's leaderboard prints source model label "Opus 5 Medium", 43.3% score, average cost/task $6.94, 45,272 tokens, and 72 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Max", 41.7% score, average cost/task $8.23, 42,944 tokens, and 99 steps. Cursor's leaderboard prints source model label "Grok 4.7 Medium", 41.6% score, average cost/task $3.49, 36,683 tokens, and 60 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Max", 41.6% score, average cost/task $2.64, 52,005 tokens, and 98 steps. Cursor's leaderboard prints source model label "Grok 4.6 Extra High", 41.4% score, average cost/task $6.10, 49,814 tokens, and 56 steps. Cursor's leaderboard prints source model label "Opus 5 Low", 40.7% score, average cost/task $4.87, 31,995 tokens, and 57 steps. Cursor's leaderboard prints source model label "Grok 4.6 High", 40.4% score, average cost/task $5.20, 41,387 tokens, and 48 steps. Cursor's leaderboard prints source model label "Gemini 3.8 Flash High", 39.6% score, average cost/task $4.70, 162,565 tokens, and 324 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Extra High", 37.7% score, average cost/task $4.40, 24,729 tokens, and 55 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Extra High", 37.5% score, average cost/task $2.10, 40,891 tokens, and 83 steps. Cursor's leaderboard prints source model label "Gemini 3.8 Flash Medium", 37.3% score, average cost/task $4.06, 128,364 tokens, and 290 steps. Cursor's leaderboard prints source model label "Grok 4.6 Medium", 36.1% score, average cost/task $3.48, 24,893 tokens, and 40 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Max", 35.9% score, average cost/task $1.03, 87,284 tokens, and 208 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol High", 35.7% score, average cost/task $2.85, 16,174 tokens, and 41 steps. Cursor's leaderboard prints source model label "Sonnet 5 Max", 34.1% score, average cost/task $7.17, 149,257 tokens, and 140 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Extra High", 33.6% score, average cost/task $1.81, 23,436 tokens, and 43 steps. Cursor's leaderboard prints source model label "Grok 4.6 Low", 33.4% score, average cost/task $2.25, 16,307 tokens, and 32 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 High", 33.4% score, average cost/task $1.66, 30,654 tokens, and 69 steps. Cursor's leaderboard prints source model label "Grok 4.7 Low", 33.1% score, average cost/task $1.58, 15,677 tokens, and 40 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Extra High", 33.0% score, average cost/task $0.44, 40,598 tokens, and 98 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Medium", 32.6% score, average cost/task $1.49, 27,255 tokens, and 64 steps. Cursor's leaderboard prints source model label "Sonnet 5 Extra High", 32.0% score, average cost/task $4.55, 83,373 tokens, and 102 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Medium", 31.1% score, average cost/task $1.77, 10,111 tokens, and 32 steps. Cursor's leaderboard prints source model label "Sonnet 5 High", 30.8% score, average cost/task $3.48, 61,146 tokens, and 85 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra High", 30.7% score, average cost/task $1.11, 13,162 tokens, and 33 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna High", 29.4% score, average cost/task $0.25, 23,368 tokens, and 64 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Low", 29.3% score, average cost/task $0.93, 17,483 tokens, and 47 steps. Cursor's leaderboard prints source model label "Sonnet 5 Medium", 28.0% score, average cost/task $2.31, 39,114 tokens, and 65 steps. Cursor's leaderboard prints source model label "Composer 2.5", 27.7% score, average cost/task $0.68, 17,347 tokens, and 41 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Medium", 27.6% score, average cost/task $0.64, 7,307 tokens, and 25 steps. Cursor's leaderboard prints source model label "GPT-5.6 Terra Low", 25.2% score, average cost/task $0.52, 5,914 tokens, and 23 steps. Cursor's leaderboard prints source model label "GPT-5.6 Sol Low", 24.6% score, average cost/task $0.87, 4,885 tokens, and 21 steps. Cursor's leaderboard prints source model label "Muse Spark 1.3 Minimal", 24.3% score, average cost/task $0.56, 10,620 tokens, and 34 steps. Cursor's leaderboard prints source model label "Sonnet 5 Low", 24.1% score, average cost/task $1.39, 23,772 tokens, and 46 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Medium", 22.2% score, average cost/task $0.08, 7,642 tokens, and 32 steps. Cursor's leaderboard prints source model label "GPT-5.6 Luna Low", 16.0% score, average cost/task $0.03, 3,288 tokens, and 18 steps. Anthropic's table gives Opus 5.5 adaptive Max. The exact model comparison values are retained as printed; the GPT-6 Astra cell is null and omitted. SpaceXAI's table reports 46.3% for Grok 4.7 at xhigh; the table does not print the CursorBench harness or task-set revision.

Method / source