SciCode
Can the model reason accurately about difficult scientific material?
Top rankings
One row per model, using its best reported score across effort settings.
| Rank | Model | Best score | Best reported setting |
|---|---|---|---|
| 1 | Gemini 3.1 ProGoogle | 59.0% | high effortGoogle report1 value · 1 reportFeb 19, 2026 · source |
| 2 | Gemini 3 ProGoogle | 56.0% | high effortGoogle report2 values · 2 reportsFeb 19, 2026 · source |
| 3 | Claude Opus 4.6Anthropic | 52.0% | max effortGoogle report2 values · 2 reportsFeb 19, 2026 · source |
| 4 | GPT-5.2OpenAI | 52.0% | xhigh effortGoogle report2 values · 2 reportsFeb 19, 2026 · source |
| 5 | Claude Opus 4.5Anthropic | 50.0% | Reported configurationMiniMax report1 value · 1 reportFeb 12, 2026 · source |
| 6 | Claude Sonnet 4.6Anthropic | 47.0% | max effortGoogle report1 value · 1 reportFeb 19, 2026 · source |
| 7 | Claude Sonnet 4.5Anthropic | 45.0% | Reported configurationMiniMax report1 value · 1 reportFeb 12, 2026 · source |
| 8 | MiniMax M2.5MiniMax | 44.4% | Reported configurationMiniMax report1 value · 1 reportFeb 12, 2026 · source |
| 9 | MiniMax M2.1MiniMax | 41.0% | Reported configurationMiniMax report1 value · 1 reportFeb 12, 2026 · source |
| 10 | North Mini CodeCohere | 38.2% | Reported configurationCohere report1 value · 1 reportJun 9, 2026 · source |
| 11 | o3 miniOpenAI | 10.8% | low effortSciCode repository leaderboard3 values · 1 reportOct 7, 2025 · source |
| 12 | o1OpenAI | 7.7% | Reported configurationSciCode repository leaderboard1 value · 1 reportOct 7, 2025 · source |
Effort curve
Every sourced cost-linked effort value for this exact version. Lines connect complete sweeps only.
Definition and comparison boundarypublic methodology
Can the model reason accurately about difficult scientific material?
Scientific knowledge and reasoning under the benchmark's published question set. Higher is better. Official main-problem resolve rate over the 80 main problems.
This is the repository table's main-problem measurement. The result changelog date is not stated in the pinned README; keep the repository revision, exact source label, and separate subproblem measurement attached.
Official SciCode repository README aggregate row; exact source model label "Claude3.5-Sonnet"; source table rank not ranked; main-problem resolve rate 4.6% over 80 main problems; subproblem accuracy 26% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Claude3.5-Sonnet (new)"; source table rank not ranked; main-problem resolve rate 4.6% over 80 main problems; subproblem accuracy 25.3% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Claude3-Opus"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 21.5% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Claude3-Sonnet"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 17% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Deepseek-Coder-v2"; source table rank not ranked; main-problem resolve rate 3.1% over 80 main problems; subproblem accuracy 21.2% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Deepseek-R1"; source table rank not ranked; main-problem resolve rate 4.6% over 80 main problems; subproblem accuracy 28.5% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Deepseek-v3"; source table rank not ranked; main-problem resolve rate 3.1% over 80 main problems; subproblem accuracy 23.7% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Gemini 1.5 Pro"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 21.9% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "GPT-4-Turbo"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 22.9% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "GPT-4o"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 25% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Llama-3.1-405B-Chat"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 19.8% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Llama-3.1-70B-Chat"; source table rank not ranked; main-problem resolve rate 0% over 80 main problems; subproblem accuracy 17% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Llama-3-70B-Chat"; source table rank not ranked; main-problem resolve rate 0% over 80 main problems; subproblem accuracy 14.6% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Mixtral-8x22B-Instruct"; source table rank not ranked; main-problem resolve rate 0% over 80 main problems; subproblem accuracy 16.3% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "OpenAI o1-mini"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 22.2% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "OpenAI o1-preview"; source table rank not ranked; main-problem resolve rate 7.7% over 80 main problems; subproblem accuracy 28.5% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "OpenAI o3-mini-high"; source table rank 2; main-problem resolve rate 9.2% over 80 main problems; subproblem accuracy 34.4% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "OpenAI o3-mini-low"; source table rank 1; main-problem resolve rate 10.8% over 80 main problems; subproblem accuracy 33.3% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "OpenAI o3-mini-medium"; source table rank 3; main-problem resolve rate 9.2% over 80 main problems; subproblem accuracy 33% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred. Official SciCode repository README aggregate row; exact source model label "Qwen2-72B-Instruct"; source table rank not ranked; main-problem resolve rate 1.5% over 80 main problems; subproblem accuracy 17% over 338 subproblems; repository revision e3158ea011d4235245a547460d3688d7ccbf9900 dated 2025-10-07; result notice date not stated in the pinned README. No task-level material, prompts, answers, code, test cases, or cost is retained or inferred.
Method / source