Skip to main content
ModelScale

Knowledge benchmark

AA-GPQA Diamond leaderboard

Artificial Analysis GPQA Diamond. Every model the catalog carries a published AA-GPQA Diamond value for, ranked by that value.

CategoryKnowledge
MeasureAccuracy
TasksGraduate-level science questions
DifficultyGraduate-level science reasoning

A display-only Artificial Analysis GPQA Diamond score.

AA-GPQA Diamond ranking

181 models with a published AA-GPQA Diamond value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.

Models ranked by their published Artificial Analysis GPQA Diamond value
RankModelProviderAccuracy
1GPT-6 AstraOpenAI96.1
2Gemini 3.8 FlashGoogle95.3
3Grok 4.6xAI94.9
4Gemini 3.7 FlashGoogle94.5
5Gemini 3.1 ProGoogle94.1
5GPT-5.6 SolOpenAI94.1
7Claude Fable 5.1Anthropic93.7
8GPT-5.5OpenAI93.5
8Kimi K3Moonshot AI93.5
8Muse Spark 1.3Meta93.5
11Claude Opus 5Anthropic93.2
12Grok 4.5xAI93.1
13MiniMax M3MiniMax92.9
14DeepSeek V4 Pro 0813DeepSeek92.8
14Gemini 3.6 FlashGoogle92.8
14Qwen3.8 Max PreviewAlibaba92.8
17Claude Fable 5Anthropic92.6
18GPT-5.6 TerraOpenAI92.5
19Qwen3.7 MaxAlibaba92.3
19Qwen3.8-Flash-NextAlibaba92.3
21Gemini 3.5 FlashGoogle92.2
22Claude Opus 4.8Anthropic92.0
22GPT-5.4OpenAI92.0
24GLM-5.3Z.AI91.7
25GPT-5.3 CodexOpenAI91.5
26Claude Opus 4.7 (Adaptive)Anthropic91.4
27GLM-5.3-FlashZ.AI91.2
28Claude Sonnet 5Anthropic91.1
28GPT-5.6 LunaOpenAI91.1
28Kimi K2.6Moonshot AI91.1
31DeepSeek V4 Flash 0731DeepSeek90.8
31Gemini 3 ProGoogle90.8
33Qwen3.8-27BAlibaba90.5
34Muse Spark 1.2Meta90.4
35GPT-5.2OpenAI90.3
36Grok 4.3xAI90.1
37Qwen3.7 PlusAlibaba90.0
38GPT-5.2-CodexOpenAI89.9
39Muse Spark 1.1Meta89.8
40Hy3Tencent89.7
40Hy3 PreviewTencent89.7
42Claude Opus 4.6 (Adaptive)Anthropic89.6
42Kimi K2.7 CodeMoonshot AI89.6
44GLM-5.2Z.AI89.5
44TMInkling-SmallThinking Machines Lab89.5
46Solar Pro 4Upstage89.1
47Qwen 3.6 Max (preview)Alibaba88.8
48Claude Opus 4.7Anthropic88.5
49Muse SparkMeta88.4
50Qwen3.6 PlusAlibaba88.2
51Kimi K2.5Moonshot AI87.9
51Kimi K2.5 (Reasoning)Moonshot AI87.9
53Grok 4xAI87.7
54GPT-5.4 miniOpenAI87.5
55MiniMax M2.7MiniMax87.4
56GPT-5.1OpenAI87.3
57TMInklingThinking Machines Lab87.2
58MiMo-V2-ProXiaomi87.0
59GLM-5.1Z.AI86.8
60Nemotron 3 UltraNVIDIA86.7
61Claude Opus 4.5 ThinkingAnthropic86.6
61MiMo-V2.5-ProXiaomi86.6
63APApodex 1.1Apodex86.4
63APApodex 1.1 MiniApodex86.4
65Ling 3.0 Flash VLInclusionAI86.2
66Qwen3.5 397BAlibaba86.1
66Qwen3.5 397B (Reasoning)Alibaba86.1
68GPT-5.1-CodexOpenAI86.0
68GPT-5.1-Codex-MaxOpenAI86.0
70GLM-4.7Z.AI85.9
71Qwen3.5-27BAlibaba85.8
72STA.X K2SK Telecom85.7
72Gemma 4 31BGoogle85.7
72Qwen3.5-122B-A10BAlibaba85.7
75Ling 3.0 FlashInclusionAI85.5
75Ling 3.0 Flash FP8InclusionAI85.5
77GPT-5 (high)OpenAI85.4
78Grok 4.1 Fast (Reasoning)xAI85.3
79GLM-5-TurboZ.AI84.7
79Grok 4 Fast (Reasoning)xAI84.7
81o3-proOpenAI84.5
81Qwen3.5-35B-A3BAlibaba84.5
83Gemini 2.5 ProGoogle84.4
84GPT-5 (medium)OpenAI84.2
84Qwen3.6-27BAlibaba84.2
86Qwen3.6-35B-A3BAlibaba84.1
87Claude Opus 4.6Anthropic84.0
88Gemini 3.5 Flash-LiteGoogle83.8
89Muse Glimmer 30BMeta83.5
90K-EXAONE 2.0LG AI Research82.9
91MiMo-V2-OmniXiaomi82.8
92o3OpenAI82.7
93GLM-5Z.AI82.0
94GPT-5.4 nanoOpenAI81.7
95DeepSeek-R1DeepSeek81.3
96Gemini 3 FlashGoogle81.2
97Claude Opus 4.5Anthropic81.0
98Claude 4.1 Opus ThinkingAnthropic80.9
98GLM-5V-TurboZ.AI80.9
98Step 3.7 FlashStepFun80.9
101Nemotron 3 Super 100BNVIDIA80.0
102Claude Sonnet 4.6Anthropic79.9
103Gemma 4 26B A4BGoogle79.2
104K-ExaoneLG AI Research78.3
105GPT-OSS 120BOpenAI78.2
106DeepSeek V3.1 (Reasoning)DeepSeek77.9
107Mistral Small 4Mistral76.9
107Mistral Small 4 (Reasoning)Mistral76.9
109Kimi K2Moonshot AI76.6
110o1-previewOpenAI76.5
111Qwen3 MaxAlibaba76.4
112Command A+Cohere76.1
113Nemotron 3 Nano 30BNVIDIA75.7
113North Mini CodeCohere75.7
115Gemma 4 12BGoogle75.3
116Trinity-Large-PreviewArcee AI75.2
116Trinity-Large-ThinkingArcee AI75.2
118DeepSeek V3.2DeepSeek75.1
119Mistral Medium 3.5 128BMistral74.8
119o3-miniOpenAI74.8
121o1OpenAI74.7
122Nemotron 3.5 Lightning 30B A3B NVFP4NVIDIA74.3
123SASarvam 105BSarvam73.8
124DeepSeek V3.1DeepSeek73.5
125Ling 3.0 TinyInclusionAI73.4
126GLM-4.5-AirZ.AI73.3
127MCQuasar 438BMultiverse Computing73.2
128Nemotron Ultra 253BNVIDIA72.8
129Grok Code Fast 1xAI72.7
130Qwen3-Omni-30B-A3B-ThinkingAlibaba72.6
131Solar Pro 3Upstage72.4
132OPMiniCPM5-2BOpenBMB70.2
133GPT-OSS 20BOpenAI68.8
134Claude 4 SonnetAnthropic68.3
134Gemini 2.5 FlashGoogle68.3
136Mistral Large 3Mistral68.0
137Llama 4 MaverickMeta67.1
138GPT-4.1OpenAI66.6
139GPT-4.1 miniOpenAI66.4
140MiMo-V2-FlashXiaomi65.6
141Granite 4.2 30BIBM64.4
142Grok 4.1 FastxAI63.7
143SASarvam 30BSarvam63.3
144GLM-4.6Z.AI63.2
145CECeleris-1Celeris63.1
145Granite 4.2 8BIBM63.1
147Exaone 4.0 32BLG AI Research62.8
148Qwen3-Omni-30B-A3B-InstructAlibaba62.0
149DeepSeek R1 Distill Qwen 32BDeepSeek61.5
150Ling 2.6 FlashInclusionAI59.3
151Gemini 1.5 ProGoogle58.9
152Llama 4 ScoutMeta58.7
153Mistral Medium 3Mistral57.8
154Gemma 4 E4BGoogle57.6
155Phi-4Microsoft57.5
156Solar Pro 2Upstage56.1
157Granite 4.2 3BIBM55.9
158LFM2.5-2.6BLiquidAI55.8
159DeepSeek V3DeepSeek55.7
160GPT-4oOpenAI54.3
161Llama 3.1 405BMeta51.5
162LFM2.5-8B-A1BLiquidAI51.3
163GPT-4.1 nanoOpenAI51.2
164Nova ProAmazon49.9
165FAUltravox v0.6 Llama 3.3 70BFixie AI49.8
166Claude 3 OpusAnthropic48.9
167Mistral Large 2Mistral48.6
168Nemotron 3 Nano Omni 30B A3BNVIDIA46.9
169Gemma 4 E2BGoogle43.3
170Gemma 3 27BGoogle42.8
171GPT-4o miniOpenAI42.6
172Exaone 4.0 1.2BLG AI Research42.4
173Qwen2.5 Coder 32B InstructAlibaba41.7
174Claude 3 HaikuAnthropic37.4
175Phi-4 Multimodal InstructMicrosoft31.5
176LFM2.5-VL-1.6B-ExtractLiquidAI28.9
177Granite-4.0-1BIBM28.1
178Gemini 1.0 ProGoogle27.7
179Granite-4.0-H-1BIBM26.3
180Granite-4.0-350MIBM26.1
181Granite-4.0-H-350MIBM25.7

Evidence key: ObservedLast good

Rows are ordered by the value Artificial Analysis GPQA Diamond Benchmark Leaderboard published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.

All leaderboards · Knowledge capability leaderboard