210 Frontier AI Models Evaluated Across Real-World Benchmarks & Edge Telemetry.
Actuarial evaluation across reasoning, verified code generation, and multi-turn agency.
| Rank | Model Name | Provider | Composite MIQ | Coding (SWE-bench) | Reasoning (GPQA) | Context | Pricing (In/Out 1M) |
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5.1 | Anthropic | 99.8 | 82.6% | 89.4% | 500k | $10.00 / $50.00 |
| #2 | OpenAI GPT-6 Astra | OpenAI | 99.5 | 81.4% | 90.1% | 1M | $12.00 / $48.00 |
| #3 | Claude Opus 4.5 | Anthropic | 99.2 | 80.9% | 88.6% | 500k | $15.00 / $75.00 |
| #4 | Grok 4.5 | xAI | 98.9 | 77.0% | 86.8% | 2M | $5.00 / $15.00 |
| #5 | Gemini 3.0 Pro | Google DeepMind | 98.7 | 78.5% | 87.2% | 2M | $2.50 / $10.00 |
| #6 | OpenAI GPT-5.6 Sol | OpenAI | 98.5 | 79.2% | 91.2% | 256k | $10.00 / $40.00 |
| #7 | DeepSeek-V4 | DeepSeek AI | 98.2 | 76.4% | 85.0% | 256k | $0.20 / $0.60 |
| #8 | Qwen 3.8 Max | Alibaba Cloud | 98.0 | 75.8% | 84.5% | 256k | $1.20 / $4.80 |
| #9 | Kimi K3 | Moonshot AI | 97.8 | 74.5% | 83.2% | 500k | $0.80 / $2.40 |
| #10 | OpenAI o3 | OpenAI | 97.6 | 73.8% | 89.2% | 200k | $10.00 / $40.00 |
| #11 | DeepSeek-R1 | DeepSeek AI | 97.5 | 67.9% | 87.2% | 128k | $0.55 / $2.19 |
| #12 | Gemini 2.5 Flash | Google DeepMind | 97.4 | 74.0% | 82.4% | 1M | $0.15 / $0.60 |
| #13 | Claude 3.7 Sonnet | Anthropic | 97.2 | 70.3% | 84.8% | 200k | $3.00 / $15.00 |
| #14 | Llama 4 Behemoth 405B | Meta | 96.8 | 68.2% | 83.5% | 128k | $1.50 / $3.50 |
| #15 | Grok 3 Ultra | xAI | 96.5 | 66.8% | 85.0% | 1M | $4.00 / $12.00 |