Knowledge benchmark
AA-Omniscience Accuracy leaderboard
Artificial Analysis Omniscience Accuracy. Every model the catalog carries a published AA-Omniscience Accuracy value for, ranked by that value.
A display-only Artificial Analysis knowledge metric for the proportion of correctly answered questions.
AA-Omniscience Accuracy ranking
171 models with a published AA-Omniscience Accuracy value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.
| Rank | Model | Provider | Accuracy |
|---|---|---|---|
| 1 | Anthropic | 67.2 | |
| 2 | Anthropic | 65.4 | |
| 3 | OpenAI | 62.6 | |
| 4 | Anthropic | 60.9 | |
| 5 | OpenAI | 59.4 | |
| 6 | OpenAI | 58.0 | |
| 7 | 55.8 | ||
| 8 | 55.3 | ||
| 9 | 54.9 | ||
| 10 | 54.6 | ||
| 11 | OpenAI | 52.9 | |
| 12 | Meta | 52.1 | |
| 13 | 51.9 | ||
| 14 | xAI | 51.6 | |
| 15 | OpenAI | 50.8 | |
| 16 | 50.0 | ||
| 17 | Meta | 49.6 | |
| 18 | DeepSeek | 49.1 | |
| 19 | Anthropic | 48.9 | |
| 20 | Anthropic | 48.8 | |
| 21 | xAI | 48.2 | |
| 22 | Moonshot AI | 47.6 | |
| 23 | Anthropic | 47.0 | |
| 24 | OpenAI | 46.8 | |
| 25 | Anthropic | 46.6 | |
| 26 | DeepSeek | 46.4 | |
| 27 | Anthropic | 45.8 | |
| 27 | 45.8 | ||
| 29 | Meta | 45.4 | |
| 30 | Anthropic | 44.7 | |
| 31 | OpenAI | 44.3 | |
| 32 | Meta | 43.6 | |
| 33 | OpenAI | 42.7 | |
| 34 | TMInkling | Thinking Machines Lab | 41.6 |
| 35 | OpenAI | 41.1 | |
| 36 | Anthropic | 40.9 | |
| 37 | xAI | 40.5 | |
| 38 | DeepSeek | 40.4 | |
| 39 | OpenAI | 40.3 | |
| 40 | Anthropic | 40.1 | |
| 41 | OpenAI | 39.9 | |
| 41 | OpenAI | 39.9 | |
| 43 | Moonshot AI | 39.6 | |
| 44 | OpenAI | 39.5 | |
| 45 | 39.1 | ||
| 46 | Anthropic | 38.6 | |
| 46 | OpenAI | 38.6 | |
| 48 | Alibaba | 37.9 | |
| 49 | OpenAI | 37.7 | |
| 50 | OpenAI | 37.5 | |
| 51 | Moonshot AI | 35.2 | |
| 51 | Moonshot AI | 35.2 | |
| 53 | xAI | 34.6 | |
| 54 | OpenAI | 34.5 | |
| 55 | Z.AI | 33.9 | |
| 56 | TMInkling-Small | Thinking Machines Lab | 33.2 |
| 57 | Moonshot AI | 32.6 | |
| 58 | Tencent | 32.0 | |
| 59 | APApodex 1.1 | Apodex | 31.7 |
| 59 | APApodex 1.1 Mini | Apodex | 31.7 |
| 59 | Alibaba | 31.7 | |
| 62 | Tencent | 31.5 | |
| 63 | Alibaba | 31.1 | |
| 64 | DeepSeek | 30.5 | |
| 65 | 29.5 | ||
| 66 | Z.AI | 29.3 | |
| 66 | Z.AI | 29.3 | |
| 68 | DeepSeek | 29.0 | |
| 69 | Z.AI | 28.4 | |
| 70 | OpenAI | 27.8 | |
| 71 | Moonshot AI | 27.4 | |
| 72 | Meta | 27.0 | |
| 73 | MiniMax | 26.8 | |
| 74 | Xiaomi | 26.6 | |
| 75 | Alibaba | 26.4 | |
| 76 | Z.AI | 26.3 | |
| 77 | 26.1 | ||
| 78 | StepFun | 25.8 | |
| 79 | OpenAI | 25.7 | |
| 80 | DeepSeek | 25.5 | |
| 81 | xAI | 25.1 | |
| 82 | Mistral | 25.0 | |
| 83 | Meta | 24.9 | |
| 84 | Mistral | 24.7 | |
| 85 | Alibaba | 24.5 | |
| 85 | Alibaba | 24.5 | |
| 85 | Alibaba | 24.5 | |
| 88 | Alibaba | 24.4 | |
| 88 | Alibaba | 24.4 | |
| 90 | Z.AI | 24.3 | |
| 90 | NVIDIA | 24.3 | |
| 92 | DeepSeek | 24.0 | |
| 93 | Z.AI | 23.7 | |
| 94 | xAI | 23.5 | |
| 95 | Meta | 23.2 | |
| 96 | DeepSeek | 23.1 | |
| 97 | xAI | 22.8 | |
| 98 | Anthropic | 22.7 | |
| 99 | Alibaba | 22.5 | |
| 99 | Arcee AI | 22.5 | |
| 99 | Arcee AI | 22.5 | |
| 102 | Xiaomi | 22.4 | |
| 103 | Inception | 22.0 | |
| 104 | OpenAI | 21.8 | |
| 105 | Mistral | 21.7 | |
| 105 | Mistral | 21.7 | |
| 107 | NVIDIA | 21.6 | |
| 108 | Z.AI | 21.4 | |
| 109 | Alibaba | 20.7 | |
| 110 | OpenAI | 20.3 | |
| 111 | NVIDIA | 20.1 | |
| 111 | Alibaba | 20.1 | |
| 113 | 20.0 | ||
| 114 | OpenAI | 19.9 | |
| 114 | Mistral | 19.9 | |
| 116 | Alibaba | 19.6 | |
| 117 | Xiaomi | 19.3 | |
| 118 | 19.1 | ||
| 119 | FAUltravox v0.6 Llama 3.3 70B | Fixie AI | 19.0 |
| 120 | Cohere | 18.9 | |
| 120 | Upstage | 18.9 | |
| 122 | Alibaba | 18.8 | |
| 123 | STA.X K2 | SK Telecom | 18.6 |
| 124 | Upstage | 18.5 | |
| 125 | Mistral | 18.3 | |
| 126 | InclusionAI | 18.2 | |
| 126 | InclusionAI | 18.2 | |
| 128 | Anthropic | 17.6 | |
| 128 | SASarvam 105B | Sarvam | 17.6 |
| 130 | NVIDIA | 17.3 | |
| 131 | xAI | 17.2 | |
| 132 | Amazon | 16.9 | |
| 133 | MiniMax | 16.7 | |
| 134 | LG AI Research | 16.4 | |
| 135 | Z.AI | 16.3 | |
| 136 | Upstage | 16.1 | |
| 137 | OpenAI | 16.0 | |
| 138 | 15.6 | ||
| 138 | InclusionAI | 15.6 | |
| 138 | Xiaomi | 15.6 | |
| 138 | Alibaba | 15.6 | |
| 142 | MCQuasar 438B | Multiverse Computing | 15.5 |
| 143 | Meta | 15.2 | |
| 143 | NVIDIA | 15.2 | |
| 145 | Alibaba | 14.6 | |
| 146 | InclusionAI | 14.4 | |
| 146 | NVIDIA | 14.4 | |
| 148 | Alibaba | 14.3 | |
| 149 | Microsoft | 14.1 | |
| 150 | OpenAI | 13.7 | |
| 151 | LG AI Research | 13.1 | |
| 152 | 13.0 | ||
| 153 | SASarvam 30B | Sarvam | 12.6 |
| 154 | IBM | 11.2 | |
| 155 | CECeleris-1 | Celeris | 11.0 |
| 156 | LG AI Research | 10.6 | |
| 157 | IBM | 10.1 | |
| 158 | LiquidAI | 9.4 | |
| 159 | IBM | 9.2 | |
| 160 | Cohere | 8.9 | |
| 161 | 8.6 | ||
| 162 | InclusionAI | 8.5 | |
| 163 | OPMiniCPM5-2B | OpenBMB | 8.4 |
| 164 | 6.6 | ||
| 165 | IBM | 6.2 | |
| 166 | LiquidAI | 5.8 | |
| 167 | IBM | 5.2 | |
| 168 | LG AI Research | 5.0 | |
| 169 | LiquidAI | 4.4 | |
| 170 | IBM | 3.9 | |
| 171 | IBM | 3.8 |
Evidence key: ObservedLast good
Rows are ordered by the value Artificial Analysis model benchmarks published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.