Knowledge benchmark
AA-Omniscience Hallucination Rate leaderboard
Artificial Analysis Omniscience Hallucination Rate. Every model the catalog carries a published AA-Omniscience Hallucination Rate value for, ranked by that value.
A display-only Artificial Analysis factuality metric for the rate of incorrect answers among non-correct responses.
AA-Omniscience Hallucination Rate ranking
171 models with a published AA-Omniscience Hallucination Rate value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.
| Rank | Model | Provider | Hallucination rate |
|---|---|---|---|
| 1 | Alibaba | 97.6 | |
| 2 | InclusionAI | 96.7 | |
| 3 | DeepSeek | 96.5 | |
| 4 | SASarvam 30B | Sarvam | 96.3 |
| 5 | LiquidAI | 95.7 | |
| 6 | DeepSeek | 94.1 | |
| 6 | OpenAI | 94.1 | |
| 8 | IBM | 93.5 | |
| 9 | SASarvam 105B | Sarvam | 93.4 |
| 10 | DeepSeek | 93.3 | |
| 10 | OpenAI | 93.3 | |
| 12 | 93.0 | ||
| 12 | Z.AI | 93.0 | |
| 12 | Upstage | 93.0 | |
| 15 | Z.AI | 92.9 | |
| 16 | CECeleris-1 | Celeris | 92.8 |
| 17 | OpenAI | 92.7 | |
| 18 | OpenAI | 92.6 | |
| 19 | 92.4 | ||
| 20 | OpenAI | 92.2 | |
| 21 | 92.1 | ||
| 22 | DeepSeek | 91.7 | |
| 22 | LG AI Research | 91.7 | |
| 22 | OpenAI | 91.7 | |
| 25 | 91.5 | ||
| 26 | 90.9 | ||
| 27 | OpenAI | 90.8 | |
| 28 | OpenAI | 90.2 | |
| 28 | FAUltravox v0.6 Llama 3.3 70B | Fixie AI | 90.2 |
| 30 | DeepSeek | 90.0 | |
| 31 | Alibaba | 89.9 | |
| 32 | OpenAI | 89.2 | |
| 33 | OpenAI | 89.0 | |
| 33 | Alibaba | 89.0 | |
| 35 | Meta | 88.9 | |
| 36 | LG AI Research | 88.8 | |
| 37 | Upstage | 88.2 | |
| 38 | IBM | 88.1 | |
| 38 | OpenAI | 88.1 | |
| 40 | OpenAI | 87.9 | |
| 41 | Alibaba | 87.1 | |
| 42 | NVIDIA | 87.0 | |
| 43 | 86.4 | ||
| 44 | Mistral | 86.0 | |
| 45 | Arcee AI | 85.9 | |
| 45 | Arcee AI | 85.9 | |
| 47 | DeepSeek | 85.7 | |
| 47 | NVIDIA | 85.7 | |
| 49 | Alibaba | 85.4 | |
| 50 | 85.0 | ||
| 50 | StepFun | 85.0 | |
| 52 | Meta | 84.2 | |
| 53 | DeepSeek | 83.4 | |
| 54 | NVIDIA | 83.3 | |
| 55 | OpenAI | 83.2 | |
| 55 | Cohere | 83.2 | |
| 57 | Alibaba | 82.7 | |
| 57 | Alibaba | 82.7 | |
| 59 | OpenAI | 82.6 | |
| 60 | DeepSeek | 82.5 | |
| 61 | Moonshot AI | 82.4 | |
| 62 | xAI | 82.3 | |
| 63 | OpenAI | 82.2 | |
| 64 | LG AI Research | 82.1 | |
| 65 | Meta | 81.9 | |
| 66 | IBM | 81.7 | |
| 67 | Mistral | 81.6 | |
| 68 | Alibaba | 81.5 | |
| 69 | OpenAI | 81.2 | |
| 69 | NVIDIA | 81.2 | |
| 69 | Microsoft | 81.2 | |
| 72 | 81.0 | ||
| 73 | Anthropic | 80.5 | |
| 74 | Anthropic | 80.1 | |
| 75 | Meta | 79.4 | |
| 76 | xAI | 79.3 | |
| 77 | APApodex 1.1 | Apodex | 78.4 |
| 77 | APApodex 1.1 Mini | Apodex | 78.4 |
| 79 | Amazon | 77.7 | |
| 80 | OpenAI | 77.2 | |
| 80 | OpenAI | 77.2 | |
| 82 | Moonshot AI | 76.6 | |
| 83 | Anthropic | 76.2 | |
| 84 | IBM | 76.1 | |
| 85 | Xiaomi | 76.0 | |
| 86 | OpenAI | 74.2 | |
| 87 | Tencent | 74.1 | |
| 88 | OpenAI | 73.4 | |
| 88 | xAI | 73.4 | |
| 90 | Tencent | 73.0 | |
| 91 | Anthropic | 72.6 | |
| 92 | OpenAI | 69.6 | |
| 93 | Z.AI | 68.8 | |
| 94 | Anthropic | 68.5 | |
| 95 | xAI | 68.3 | |
| 96 | TMInkling | Thinking Machines Lab | 67.7 |
| 96 | Mistral | 67.7 | |
| 98 | Z.AI | 67.6 | |
| 99 | Inception | 67.0 | |
| 100 | Mistral | 66.5 | |
| 100 | Mistral | 66.5 | |
| 102 | Moonshot AI | 65.7 | |
| 102 | Moonshot AI | 65.7 | |
| 104 | 64.5 | ||
| 104 | xAI | 64.5 | |
| 106 | Anthropic | 63.6 | |
| 107 | TMInkling-Small | Thinking Machines Lab | 63.0 |
| 108 | Anthropic | 62.8 | |
| 109 | Z.AI | 62.6 | |
| 110 | Anthropic | 61.0 | |
| 111 | Mistral | 60.9 | |
| 112 | Anthropic | 60.8 | |
| 113 | 60.7 | ||
| 114 | 55.6 | ||
| 115 | 55.2 | ||
| 116 | Anthropic | 54.1 | |
| 116 | xAI | 54.1 | |
| 118 | Moonshot AI | 53.2 | |
| 119 | Meta | 52.4 | |
| 120 | OpenAI | 51.9 | |
| 121 | OpenAI | 51.3 | |
| 122 | 50.9 | ||
| 123 | Alibaba | 50.5 | |
| 124 | Meta | 50.0 | |
| 125 | Alibaba | 49.3 | |
| 126 | Xiaomi | 48.9 | |
| 127 | LiquidAI | 46.9 | |
| 128 | Alibaba | 46.2 | |
| 129 | Alibaba | 45.3 | |
| 130 | InclusionAI | 44.1 | |
| 130 | InclusionAI | 44.1 | |
| 132 | Anthropic | 42.3 | |
| 133 | Anthropic | 41.0 | |
| 134 | Moonshot AI | 40.5 | |
| 135 | Anthropic | 39.4 | |
| 136 | Anthropic | 39.3 | |
| 137 | OpenAI | 37.9 | |
| 138 | NVIDIA | 37.6 | |
| 139 | MiniMax | 35.6 | |
| 140 | Z.AI | 35.3 | |
| 141 | Alibaba | 34.6 | |
| 142 | 34.4 | ||
| 143 | xAI | 34.3 | |
| 144 | Meta | 33.3 | |
| 145 | STA.X K2 | SK Telecom | 33.0 |
| 146 | Meta | 32.9 | |
| 147 | 32.4 | ||
| 148 | IBM | 32.0 | |
| 149 | 30.9 | ||
| 150 | InclusionAI | 30.5 | |
| 151 | Alibaba | 30.3 | |
| 152 | Xiaomi | 30.0 | |
| 153 | Z.AI | 29.9 | |
| 154 | NVIDIA | 29.7 | |
| 155 | Z.AI | 29.6 | |
| 156 | Alibaba | 28.8 | |
| 157 | Alibaba | 27.7 | |
| 158 | Z.AI | 26.3 | |
| 158 | IBM | 26.3 | |
| 160 | IBM | 25.6 | |
| 160 | Alibaba | 25.6 | |
| 162 | xAI | 25.0 | |
| 163 | Xiaomi | 24.7 | |
| 164 | Upstage | 24.4 | |
| 165 | LG AI Research | 22.6 | |
| 166 | InclusionAI | 22.0 | |
| 167 | OPMiniCPM5-2B | OpenBMB | 21.9 |
| 168 | MCQuasar 438B | Multiverse Computing | 21.4 |
| 169 | MiniMax | 18.4 | |
| 170 | LiquidAI | 16.0 | |
| 171 | Cohere | 14.2 |
Evidence key: ObservedLast good
Rows are ordered by the value Artificial Analysis model benchmarks published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.