Reasoning benchmark
AA-LCR leaderboard
Artificial Analysis Long Context Reasoning. Every model the catalog carries a published AA-LCR value for, ranked by that value.
A display-only Artificial Analysis long-context reasoning evaluation.
AA-LCR ranking
172 models with a published AA-LCR value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.
| Rank | Model | Provider | Accuracy |
|---|---|---|---|
| 1 | Moonshot AI | 88.7 | |
| 2 | Anthropic | 85.3 | |
| 3 | OpenAI | 84.3 | |
| 4 | DeepSeek | 84.0 | |
| 4 | OpenAI | 84.0 | |
| 6 | OpenAI | 83.7 | |
| 7 | OpenAI | 83.3 | |
| 7 | Meta | 83.3 | |
| 9 | OpenAI | 83.0 | |
| 9 | MiniMax | 83.0 | |
| 9 | Meta | 83.0 | |
| 12 | OpenAI | 82.7 | |
| 13 | Anthropic | 82.3 | |
| 13 | OpenAI | 82.3 | |
| 15 | Anthropic | 82.0 | |
| 15 | 82.0 | ||
| 15 | OpenAI | 82.0 | |
| 15 | Alibaba | 82.0 | |
| 19 | 81.7 | ||
| 20 | 81.3 | ||
| 21 | Moonshot AI | 81.0 | |
| 22 | OpenAI | 80.7 | |
| 22 | Alibaba | 80.7 | |
| 24 | DeepSeek | 80.3 | |
| 24 | xAI | 80.3 | |
| 24 | Alibaba | 80.3 | |
| 27 | 80.0 | ||
| 27 | OpenAI | 80.0 | |
| 29 | DeepSeek | 79.7 | |
| 29 | Z.AI | 79.7 | |
| 29 | Xiaomi | 79.7 | |
| 29 | Alibaba | 79.7 | |
| 33 | APApodex 1.1 | Apodex | 79.3 |
| 33 | APApodex 1.1 Mini | Apodex | 79.3 |
| 33 | Anthropic | 79.3 | |
| 33 | xAI | 79.3 | |
| 33 | Moonshot AI | 79.3 | |
| 38 | Tencent | 79.0 | |
| 38 | Meta | 79.0 | |
| 38 | Alibaba | 79.0 | |
| 41 | Anthropic | 78.7 | |
| 42 | Z.AI | 78.3 | |
| 42 | InclusionAI | 78.3 | |
| 42 | MiniMax | 78.3 | |
| 42 | Alibaba | 78.3 | |
| 46 | OpenAI | 78.2 | |
| 47 | Anthropic | 78.0 | |
| 47 | Moonshot AI | 78.0 | |
| 47 | Moonshot AI | 78.0 | |
| 47 | Meta | 78.0 | |
| 51 | Anthropic | 77.7 | |
| 51 | Meta | 77.7 | |
| 51 | Alibaba | 77.7 | |
| 54 | Anthropic | 77.3 | |
| 54 | TMInkling | Thinking Machines Lab | 77.3 |
| 54 | Alibaba | 77.3 | |
| 57 | OpenAI | 77.0 | |
| 57 | PMTernary Bonsai 2 27B | Prism ML | 77.0 |
| 59 | OpenAI | 76.7 | |
| 60 | MCQuasar 438B | Multiverse Computing | 76.3 |
| 60 | Alibaba | 76.3 | |
| 62 | Anthropic | 76.0 | |
| 62 | 76.0 | ||
| 62 | 76.0 | ||
| 62 | OpenAI | 76.0 | |
| 66 | Anthropic | 75.7 | |
| 66 | Z.AI | 75.7 | |
| 66 | TMInkling-Small | Thinking Machines Lab | 75.7 |
| 69 | Xiaomi | 75.0 | |
| 70 | OpenAI | 74.7 | |
| 71 | xAI | 74.0 | |
| 72 | Z.AI | 73.7 | |
| 72 | xAI | 73.7 | |
| 72 | StepFun | 73.7 | |
| 75 | InclusionAI | 73.0 | |
| 75 | InclusionAI | 73.0 | |
| 75 | Alibaba | 73.0 | |
| 78 | Alibaba | 72.0 | |
| 79 | Z.AI | 71.7 | |
| 79 | Alibaba | 71.7 | |
| 81 | Z.AI | 71.0 | |
| 81 | Upstage | 71.0 | |
| 83 | Anthropic | 70.7 | |
| 84 | Z.AI | 70.3 | |
| 85 | 69.7 | ||
| 86 | 69.3 | ||
| 86 | OpenAI | 69.3 | |
| 86 | OpenAI | 69.3 | |
| 86 | Mistral | 69.3 | |
| 90 | 69.0 | ||
| 91 | Anthropic | 68.3 | |
| 91 | OpenAI | 68.3 | |
| 91 | Xiaomi | 68.3 | |
| 94 | xAI | 68.0 | |
| 94 | Inception | 68.0 | |
| 96 | Anthropic | 67.0 | |
| 96 | NVIDIA | 67.0 | |
| 98 | Tencent | 66.7 | |
| 99 | STA.X K2 | SK Telecom | 66.0 |
| 100 | 65.7 | ||
| 100 | NVIDIA | 65.7 | |
| 102 | OpenAI | 65.0 | |
| 103 | xAI | 64.3 | |
| 103 | Alibaba | 64.3 | |
| 103 | Alibaba | 64.3 | |
| 106 | 63.7 | ||
| 107 | Upstage | 62.3 | |
| 108 | LG AI Research | 61.3 | |
| 109 | InclusionAI | 60.3 | |
| 110 | OPMiniCPM5-2B | OpenBMB | 59.0 |
| 111 | DeepSeek | 56.7 | |
| 112 | LG AI Research | 56.2 | |
| 113 | DeepSeek | 55.7 | |
| 114 | 55.3 | ||
| 115 | xAI | 53.0 | |
| 115 | Moonshot AI | 53.0 | |
| 117 | Cohere | 52.7 | |
| 118 | OpenAI | 52.0 | |
| 119 | Meta | 50.0 | |
| 119 | Alibaba | 50.0 | |
| 121 | 49.9 | ||
| 122 | Mistral | 49.7 | |
| 122 | Mistral | 49.7 | |
| 124 | OpenAI | 49.3 | |
| 125 | NVIDIA | 49.2 | |
| 126 | IBM | 49.0 | |
| 127 | DeepSeek | 47.0 | |
| 128 | Z.AI | 46.7 | |
| 129 | DeepSeek | 45.7 | |
| 130 | IBM | 45.0 | |
| 131 | Anthropic | 44.0 | |
| 131 | OpenAI | 44.0 | |
| 133 | NVIDIA | 39.7 | |
| 134 | CECeleris-1 | Celeris | 38.0 |
| 134 | NVIDIA | 38.0 | |
| 134 | Arcee AI | 38.0 | |
| 134 | Arcee AI | 38.0 | |
| 138 | Cohere | 37.3 | |
| 139 | Xiaomi | 36.3 | |
| 140 | Mistral | 36.0 | |
| 141 | OpenAI | 34.7 | |
| 142 | Upstage | 32.3 | |
| 143 | 32.0 | ||
| 144 | xAI | 31.3 | |
| 144 | InclusionAI | 31.3 | |
| 144 | Mistral | 31.3 | |
| 147 | DeepSeek | 29.3 | |
| 148 | Anthropic | 27.7 | |
| 148 | Meta | 27.7 | |
| 150 | Z.AI | 26.3 | |
| 151 | Meta | 25.3 | |
| 152 | IBM | 24.3 | |
| 153 | Amazon | 21.0 | |
| 154 | OpenAI | 20.3 | |
| 155 | 16.3 | ||
| 156 | FAUltravox v0.6 Llama 3.3 70B | Fixie AI | 15.7 |
| 157 | DeepSeek | 8.7 | |
| 158 | 7.3 | ||
| 159 | IBM | 7.0 | |
| 160 | IBM | 6.0 | |
| 161 | LiquidAI | 5.7 | |
| 162 | LG AI Research | 0.0 | |
| 162 | IBM | 0.0 | |
| 162 | IBM | 0.0 | |
| 162 | LiquidAI | 0.0 | |
| 162 | LiquidAI | 0.0 | |
| 162 | Microsoft | 0.0 | |
| 162 | Alibaba | 0.0 | |
| 162 | Alibaba | 0.0 | |
| 162 | SASarvam 105B | Sarvam | 0.0 |
| 162 | SASarvam 30B | Sarvam | 0.0 |
| 162 | Upstage | 0.0 |
Evidence key: ObservedLast good
Rows are ordered by the value Artificial Analysis model benchmarks published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.