Coding benchmark
AA Coding Index leaderboard
Artificial Analysis Coding Index. Every model the catalog carries a published AA Coding Index value for, ranked by that value.
A display-only Artificial Analysis coding index.
AA Coding Index ranking
102 models with a published AA Coding Index value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.
| Rank | Model | Provider | Aggregated model score |
|---|---|---|---|
| 1 | Anthropic | 81.6 | |
| 2 | Anthropic | 78.0 | |
| 3 | OpenAI | 77.4 | |
| 4 | OpenAI | 76.9 | |
| 5 | xAI | 76.8 | |
| 6 | OpenAI | 76.7 | |
| 7 | Anthropic | 76.5 | |
| 8 | 76.3 | ||
| 9 | Moonshot AI | 76.2 | |
| 10 | 76.1 | ||
| 11 | Meta | 75.8 | |
| 12 | OpenAI | 74.9 | |
| 13 | Z.AI | 74.8 | |
| 14 | Anthropic | 74.3 | |
| 15 | Anthropic | 73.6 | |
| 16 | Alibaba | 73.0 | |
| 17 | xAI | 72.5 | |
| 18 | Meta | 72.2 | |
| 19 | Alibaba | 71.8 | |
| 20 | Anthropic | 71.5 | |
| 21 | OpenAI | 71.5 | |
| 22 | Meta | 71.3 | |
| 23 | OpenAI | 71.0 | |
| 24 | 70.1 | ||
| 25 | 69.2 | ||
| 26 | DeepSeek | 69.1 | |
| 27 | DeepSeek | 68.8 | |
| 27 | 68.8 | ||
| 29 | Z.AI | 68.8 | |
| 30 | Alibaba | 68.1 | |
| 31 | Alibaba | 66.0 | |
| 32 | Moonshot AI | 61.8 | |
| 33 | MCQuasar 438B | Multiverse Computing | 61.2 |
| 34 | APApodex 1.1 | Apodex | 60.8 |
| 34 | APApodex 1.1 Mini | Apodex | 60.8 |
| 34 | Moonshot AI | 60.8 | |
| 37 | Xiaomi | 60.2 | |
| 38 | Tencent | 58.8 | |
| 38 | Tencent | 58.8 | |
| 40 | Meta | 58.6 | |
| 41 | MiniMax | 58.6 | |
| 42 | OpenAI | 56.1 | |
| 43 | OpenAI | 56.1 | |
| 44 | Alibaba | 55.9 | |
| 45 | Z.AI | 55.8 | |
| 46 | Alibaba | 54.5 | |
| 47 | Alibaba | 53.7 | |
| 48 | TMInkling-Small | Thinking Machines Lab | 53.0 |
| 49 | MiniMax | 52.6 | |
| 50 | TMInkling | Thinking Machines Lab | 52.1 |
| 51 | InclusionAI | 50.6 | |
| 51 | InclusionAI | 50.6 | |
| 53 | Xiaomi | 49.8 | |
| 54 | OpenAI | 49.4 | |
| 55 | 49.3 | ||
| 56 | NVIDIA | 49.3 | |
| 57 | Meta | 49.0 | |
| 58 | Mistral | 46.9 | |
| 59 | Moonshot AI | 46.8 | |
| 59 | Moonshot AI | 46.8 | |
| 61 | Alibaba | 45.7 | |
| 62 | Z.AI | 45.3 | |
| 63 | 43.4 | ||
| 64 | xAI | 42.3 | |
| 65 | Alibaba | 41.9 | |
| 66 | OpenAI | 39.7 | |
| 67 | StepFun | 39.6 | |
| 68 | 39.3 | ||
| 69 | OpenAI | 37.8 | |
| 70 | NVIDIA | 37.7 | |
| 71 | OpenAI | 34.0 | |
| 72 | 33.3 | ||
| 73 | LG AI Research | 32.1 | |
| 74 | 31.0 | ||
| 75 | OpenAI | 30.4 | |
| 76 | Cohere | 27.9 | |
| 77 | NVIDIA | 26.8 | |
| 78 | Mistral | 26.6 | |
| 78 | Mistral | 26.6 | |
| 80 | Arcee AI | 25.8 | |
| 80 | Arcee AI | 25.8 | |
| 82 | InclusionAI | 25.3 | |
| 83 | 23.6 | ||
| 84 | DeepSeek | 23.0 | |
| 85 | IBM | 22.4 | |
| 86 | OpenAI | 21.5 | |
| 87 | OpenAI | 20.7 | |
| 88 | OpenAI | 20.2 | |
| 89 | Mistral | 20.1 | |
| 90 | Anthropic | 19.5 | |
| 91 | Meta | 16.3 | |
| 92 | CECeleris-1 | Celeris | 14.4 |
| 93 | NVIDIA | 14.4 | |
| 94 | NVIDIA | 13.8 | |
| 95 | FAUltravox v0.6 Llama 3.3 70B | Fixie AI | 11.9 |
| 96 | OpenAI | 11.4 | |
| 97 | OpenAI | 11.1 | |
| 98 | 10.1 | ||
| 99 | 9.4 | ||
| 100 | Meta | 8.2 | |
| 101 | LiquidAI | 7.7 | |
| 102 | 7.2 |
Evidence key: Observed
Rows are ordered by the value Artificial Analysis model leaderboards published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.