Agentic benchmark
GDPval-AA leaderboard
GDPval-AA normalized. Every model the catalog carries a published GDPval-AA value for, ranked by that value.
A display-only Artificial Analysis normalized score for economically valuable tasks.
GDPval-AA ranking
108 models with a published GDPval-AA value, ordered by that value, highest first. Models the source has not scored on this benchmark are not listed — they are unmeasured, not last.
| Rank | Model | Provider | Normalized score |
|---|---|---|---|
| 1 | Anthropic | 61.8 | |
| 2 | Anthropic | 61.2 | |
| 3 | Meta | 60.2 | |
| 4 | Alibaba | 58.2 | |
| 5 | Alibaba | 57.4 | |
| 6 | xAI | 57.1 | |
| 7 | Z.AI | 56.7 | |
| 8 | Anthropic | 56.6 | |
| 8 | DeepSeek | 56.6 | |
| 10 | DeepSeek | 54.5 | |
| 11 | OpenAI | 54.3 | |
| 12 | OpenAI | 54.0 | |
| 13 | Moonshot AI | 52.4 | |
| 14 | Meta | 51.2 | |
| 15 | Anthropic | 50.0 | |
| 16 | Anthropic | 49.5 | |
| 17 | OpenAI | 48.8 | |
| 18 | 48.2 | ||
| 18 | Alibaba | 48.2 | |
| 20 | OpenAI | 47.8 | |
| 21 | DeepSeek | 47.1 | |
| 22 | 46.7 | ||
| 23 | xAI | 46.5 | |
| 24 | Z.AI | 45.3 | |
| 25 | Anthropic | 44.8 | |
| 25 | OpenAI | 44.8 | |
| 27 | 42.2 | ||
| 28 | 41.6 | ||
| 29 | OpenAI | 40.3 | |
| 30 | MiniMax | 40.2 | |
| 31 | Meta | 39.7 | |
| 32 | APApodex 1.1 | Apodex | 38.7 |
| 32 | APApodex 1.1 Mini | Apodex | 38.7 |
| 34 | MCQuasar 438B | Multiverse Computing | 37.0 |
| 35 | InclusionAI | 36.2 | |
| 36 | Tencent | 35.8 | |
| 37 | TMInkling-Small | Thinking Machines Lab | 34.6 |
| 38 | Alibaba | 34.5 | |
| 39 | Xiaomi | 34.3 | |
| 40 | Z.AI | 34.0 | |
| 41 | Upstage | 33.6 | |
| 42 | TMInkling | Thinking Machines Lab | 33.3 |
| 43 | NVIDIA | 33.1 | |
| 44 | Tencent | 31.8 | |
| 45 | Moonshot AI | 30.7 | |
| 46 | Z.AI | 29.8 | |
| 46 | Moonshot AI | 29.8 | |
| 48 | OpenAI | 29.7 | |
| 49 | MiniMax | 29.4 | |
| 50 | xAI | 29.2 | |
| 51 | Meta | 28.8 | |
| 52 | Alibaba | 28.4 | |
| 53 | Alibaba | 28.3 | |
| 54 | 28.2 | ||
| 55 | STA.X K2 | SK Telecom | 27.2 |
| 56 | OpenAI | 26.8 | |
| 57 | InclusionAI | 25.9 | |
| 57 | InclusionAI | 25.9 | |
| 59 | StepFun | 25.8 | |
| 60 | OpenAI | 25.7 | |
| 61 | Alibaba | 24.5 | |
| 62 | Moonshot AI | 21.8 | |
| 62 | Moonshot AI | 21.8 | |
| 64 | OpenAI | 21.5 | |
| 65 | Alibaba | 21.3 | |
| 66 | LG AI Research | 20.9 | |
| 67 | 20.2 | ||
| 68 | Meta | 19.6 | |
| 69 | Alibaba | 19.3 | |
| 70 | Mistral | 18.8 | |
| 71 | OPMiniCPM5-2B | OpenBMB | 16.4 |
| 72 | Xiaomi | 14.4 | |
| 73 | NVIDIA | 13.3 | |
| 74 | 12.8 | ||
| 75 | OpenAI | 12.2 | |
| 76 | IBM | 11.1 | |
| 77 | InclusionAI | 10.8 | |
| 78 | 9.7 | ||
| 79 | Cohere | 7.9 | |
| 80 | IBM | 7.3 | |
| 81 | NVIDIA | 7.2 | |
| 82 | 5.8 | ||
| 83 | 4.5 | ||
| 84 | Mistral | 4.4 | |
| 85 | LG AI Research | 2.0 | |
| 86 | Mistral | 1.8 | |
| 86 | Mistral | 1.8 | |
| 88 | OpenAI | 0.7 | |
| 89 | Arcee AI | 0.6 | |
| 89 | Arcee AI | 0.6 | |
| 91 | CECeleris-1 | Celeris | 0.0 |
| 91 | DeepSeek | 0.0 | |
| 91 | 0.0 | ||
| 91 | 0.0 | ||
| 91 | 0.0 | ||
| 91 | OpenAI | 0.0 | |
| 91 | OpenAI | 0.0 | |
| 91 | OpenAI | 0.0 | |
| 91 | IBM | 0.0 | |
| 91 | LiquidAI | 0.0 | |
| 91 | InclusionAI | 0.0 | |
| 91 | Meta | 0.0 | |
| 91 | Meta | 0.0 | |
| 91 | NVIDIA | 0.0 | |
| 91 | NVIDIA | 0.0 | |
| 91 | Cohere | 0.0 | |
| 91 | Upstage | 0.0 | |
| 91 | FAUltravox v0.6 Llama 3.3 70B | Fixie AI | 0.0 |
Evidence key: Observed
Rows are ordered by the value Artificial Analysis model benchmarks published, highest first. The source does not state whether a higher value is the better result, so this page does not either: for a benchmark that measures a rate of failure, read the table from the bottom.