Skip to main content
ModelScale

Reasoning benchmark

CritPt leaderboard

Critical Physics Tasks. Every model the catalog carries a published CritPt value for, ranked by that value.

CategoryReasoning
MeasureAccuracy
TasksResearch-level physics questions
DifficultyResearch-level physics reasoning

A display-only Artificial Analysis metric for research-level physics reasoning.

CritPt ranking

175 models with a published CritPt value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.

Models ranked by their published Critical Physics Tasks value
RankModelProviderAccuracy
1GPT-5.6 SolOpenAI32.3
2GPT-6 AstraOpenAI31.7
3GPT-5.5 ProOpenAI30.6
4GPT-5.4 ProOpenAI30.0
4GPT-5.6 TerraOpenAI30.0
6Claude Fable 5.1Anthropic29.7
7Claude Opus 5Anthropic29.1
8Claude Fable 5Anthropic28.6
9GPT-5.5OpenAI27.1
10Gemini 3 Pro Deep ThinkGoogle25.7
11Muse Spark 1.3Meta24.9
12GPT-5.4OpenAI23.4
12Kimi K3Moonshot AI23.4
14Claude Opus 4.8Anthropic20.9
14GLM-5.2Z.AI20.9
16GPT-5.6 LunaOpenAI20.6
17GLM-5.3Z.AI19.1
18Gemini 3.8 FlashGoogle18.3
19DeepSeek V4 Pro 0813DeepSeek18.0
20Gemini 3.1 ProGoogle17.7
20Muse Spark 1.2Meta17.7
20Qwen3.8 Max PreviewAlibaba17.7
23Grok 4.6xAI17.1
24Claude Sonnet 5Anthropic16.9
24GPT-5.3 CodexOpenAI16.9
24Hy4 previewTencent16.9
27DeepSeek V4 Flash 0731DeepSeek16.6
28Grok 4.5xAI15.4
29Muse Spark 1.1Meta15.1
30DeepSeek V4.1 FlashDeepSeek14.3
30Gemini 3.7 FlashGoogle14.3
32Qwen3.7 MaxAlibaba13.4
33Gemini 3.5 FlashGoogle13.1
34Claude Opus 4.6 (Adaptive)Anthropic12.6
35Claude Opus 4.7 (Adaptive)Anthropic12.0
36GPT-5.2OpenAI11.6
37Muse SparkMeta11.3
38Qwen3.8-Flash-NextAlibaba11.1
39Gemini 3.6 FlashGoogle10.6
40GPT-5.4 miniOpenAI10.0
40Kimi K2.7 CodeMoonshot AI10.0
42MCQuasar 438BMultiverse Computing9.4
43GPT-5.4 nanoOpenAI9.3
44Gemini 3 ProGoogle9.1
44Qwen3.7 PlusAlibaba9.1
46STA.X K2SK Telecom8.9
47GPT-5.2-CodexOpenAI8.7
48TMInkling-SmallThinking Machines Lab8.3
49Grok 4.3xAI8.0
49Kimi K2.6Moonshot AI8.0
51GPT-5 (high)OpenAI5.7
51GPT-5.1-CodexOpenAI5.7
51GPT-5.1-Codex-MaxOpenAI5.7
54TMInklingThinking Machines Lab5.4
54Qwen3.8-27BAlibaba5.4
54Solar Pro 4Upstage5.4
57Claude Opus 4.7Anthropic5.1
58GPT-5.1OpenAI4.9
58Hy3Tencent4.9
58Hy3 PreviewTencent4.9
61APApodex 1.1Apodex4.6
61APApodex 1.1 MiniApodex4.6
61Claude Opus 4.5 ThinkingAnthropic4.6
61GLM-5.1Z.AI4.6
65MiMo-V2.5-ProXiaomi4.0
66MiniMax M3MiniMax3.7
66Qwen 3.6 Max (preview)Alibaba3.7
68Kimi K2.5Moonshot AI3.1
68Kimi K2.5 (Reasoning)Moonshot AI3.1
68Nemotron 3 Super 100BNVIDIA3.1
68Nemotron 3 UltraNVIDIA3.1
72Grok 4 Fast (Reasoning)xAI2.9
72Grok 4.1 Fast (Reasoning)xAI2.9
72Qwen3.6 PlusAlibaba2.9
75Claude Opus 4.6Anthropic2.8
76Gemini 2.5 ProGoogle2.6
76Muse Glimmer 30BMeta2.6
78Step 3.7 FlashStepFun2.3
79DeepSeek V3.1 (Reasoning)DeepSeek2.0
79GLM-5Z.AI2.0
79Grok 4xAI2.0
79Ling 3.0 Flash VLInclusionAI2.0
83GLM-4.7Z.AI1.7
83Ling 3.0 FlashInclusionAI1.7
83Ling 3.0 Flash FP8InclusionAI1.7
86DeepSeek-R1DeepSeek1.4
86Gemini 2.5 FlashGoogle1.4
86Gemini 3 FlashGoogle1.4
86Gemma 4 31BGoogle1.4
86GPT-OSS 20BOpenAI1.4
91Claude 4 SonnetAnthropic1.1
91GPT-OSS 120BOpenAI1.1
91K-ExaoneLG AI Research1.1
91MiMo-V2-OmniXiaomi1.1
91o3OpenAI1.1
91Qwen3.6-27BAlibaba1.1
97Claude Sonnet 4.6Anthropic0.9
97DeepSeek V3.2DeepSeek0.9
97K-EXAONE 2.0LG AI Research0.9
97Nemotron 3 Nano 30BNVIDIA0.9
97Qwen3.5 397BAlibaba0.9
97Qwen3.5 397B (Reasoning)Alibaba0.9
97Qwen3.5-27BAlibaba0.9
97Qwen3.5-35B-A3BAlibaba0.9
97Trinity-Large-PreviewArcee AI0.9
97Trinity-Large-ThinkingArcee AI0.9
107Gemma 4 E4BGoogle0.6
107GLM-5V-TurboZ.AI0.6
107MiniMax M2.7MiniMax0.6
107Qwen3.5-122B-A10BAlibaba0.6
111Claude Opus 4.5Anthropic0.3
111Command A+Cohere0.3
111GLM-5-TurboZ.AI0.3
111Granite 4.2 30BIBM0.3
111Granite 4.2 8BIBM0.3
111MiMo-V2-ProXiaomi0.3
111OPMiniCPM5-2BOpenBMB0.3
111Mistral Small 4Mistral0.3
111Mistral Small 4 (Reasoning)Mistral0.3
111North Mini CodeCohere0.3
111o1OpenAI0.3
111Qwen3.6-35B-A3BAlibaba0.3
111SASarvam 30BSarvam0.3
124CECeleris-1Celeris0.0
124Claude 3 HaikuAnthropic0.0
124Claude 4.1 Opus ThinkingAnthropic0.0
124DeepSeek V3DeepSeek0.0
124DeepSeek V3.1DeepSeek0.0
124Exaone 4.0 1.2BLG AI Research0.0
124Exaone 4.0 32BLG AI Research0.0
124Gemini 3.5 Flash-LiteGoogle0.0
124Gemma 3 27BGoogle0.0
124Gemma 4 12BGoogle0.0
124Gemma 4 26B A4BGoogle0.0
124Gemma 4 E2BGoogle0.0
124GLM-4.5-AirZ.AI0.0
124GLM-4.6Z.AI0.0
124GPT-4.1OpenAI0.0
124GPT-4.1 miniOpenAI0.0
124GPT-4.1 nanoOpenAI0.0
124GPT-4oOpenAI0.0
124GPT-5 (medium)OpenAI0.0
124Granite 4.2 3BIBM0.0
124Granite-4.0-1BIBM0.0
124Granite-4.0-350MIBM0.0
124Granite-4.0-H-1BIBM0.0
124Granite-4.0-H-350MIBM0.0
124Grok 4.1 FastxAI0.0
124Grok Code Fast 1xAI0.0
124Kimi K2Moonshot AI0.0
124LFM2.5-2.6BLiquidAI0.0
124LFM2.5-8B-A1BLiquidAI0.0
124LFM2.5-VL-1.6B-ExtractLiquidAI0.0
124Ling 2.6 FlashInclusionAI0.0
124Ling 3.0 TinyInclusionAI0.0
124Llama 3.1 405BMeta0.0
124Llama 4 MaverickMeta0.0
124Llama 4 ScoutMeta0.0
124MiMo-V2-FlashXiaomi0.0
124Mistral Large 2Mistral0.0
124Mistral Large 3Mistral0.0
124Mistral Medium 3Mistral0.0
124Mistral Medium 3.5 128BMistral0.0
124Nemotron 3 Nano Omni 30B A3BNVIDIA0.0
124Nemotron 3.5 Lightning 30B A3B NVFP4NVIDIA0.0
124Nemotron Ultra 253BNVIDIA0.0
124Nova ProAmazon0.0
124Phi-4Microsoft0.0
124Qwen3 MaxAlibaba0.0
124Qwen3-Omni-30B-A3B-InstructAlibaba0.0
124Qwen3-Omni-30B-A3B-ThinkingAlibaba0.0
124SASarvam 105BSarvam0.0
124Solar Pro 2Upstage0.0
124Solar Pro 3Upstage0.0
124FAUltravox v0.6 Llama 3.3 70BFixie AI0.0

Evidence key: ObservedLast good

Rows are ordered by the value CritPt Benchmark Leaderboard published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.

All leaderboards · Reasoning capability leaderboard