# RouterPlex AI model benchmarks

Canonical HTML: https://routerplex.com/benchmarks

Scores combine versioned blind RouterPlex Arena preferences with active, cited external snapshots. Source-only rows are labeled external instead of low-confidence. Custom prompts and model outputs are not stored.

| Rank | Model | Combined | Arena | External | Votes | Confidence |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | Claude Fable 5 | 100.00 | insufficient data | 100.00 | 0 | external |
| 2 | Claude Opus 4.6 | 99.21 | insufficient data | 99.21 | 0 | external |
| 3 | Qwen3.8 Max | 98.95 | insufficient data | 98.95 | 0 | external |
| 4 | Claude Opus 4.7 | 98.69 | insufficient data | 98.69 | 0 | external |
| 5 | GPT-5.5 | 95.55 | insufficient data | 95.55 | 0 | external |
| 6 | Claude Sonnet 4.6 | 92.67 | insufficient data | 92.67 | 0 | external |
| 7 | Grok 4.5 | 91.62 | insufficient data | 91.62 | 0 | external |
| 8 | Claude Opus 4.8 | 91.47 | 51.20 | 94.50 | 1 | low |
| 9 | GLM-5.1 | 91.36 | insufficient data | 91.36 | 0 | external |
| 10 | MiMo V2.5 Pro | 90.31 | insufficient data | 90.31 | 0 | external |
| 11 | GPT-5.4 | 90.05 | insufficient data | 90.05 | 0 | external |
| 12 | Kimi K2.6 | 89.27 | insufficient data | 89.27 | 0 | external |
| 13 | Qwen3.7 Plus | 88.48 | insufficient data | 88.48 | 0 | external |
| 14 | DeepSeek V4 Pro | 87.96 | insufficient data | 87.96 | 0 | external |
| 15 | Hy3 | 87.17 | insufficient data | 87.17 | 0 | external |
| 16 | MiniMax M3 | 82.72 | insufficient data | 82.72 | 0 | external |
| 17 | Qwen3.6 Plus | 79.86 | 48.80 | 82.20 | 1 | low |
| 18 | DeepSeek V4 Flash | 79.58 | insufficient data | 79.58 | 0 | external |
| 19 | MiMo V2.5 | 78.27 | insufficient data | 78.27 | 0 | external |
| 20 | MiniMax M2.7 | 70.94 | insufficient data | 70.94 | 0 | external |

Methodology: https://routerplex.com/benchmarks#methodology
Run a private comparison: https://routerplex.com/dashboard/arena
