Benchmarks

Rank the signal, inspect the evidence.

Blind RouterPlex preferences and dated external snapshots, shown beside latency, evaluation cost, sample size, and confidence.

Ranking console

Published leaderboard.

Select a task and scoring signal. Every row keeps the underlying evidence visible.

Rank / modelExternal signalArenaExternalLatencyEval costVotesEvidence
01
100.0
-100.0--0Cited
02
99.2
-99.2--0Cited
03
99.0
-99.0--0Cited
04
98.7
-98.7--0Cited
05
GPT-5.5

OpenAI

95.5
-95.5--0Cited
06
94.5
51.294.511889ms$0.00631low
92.7
-92.7--0Cited
91.6
-91.6--0Cited
09
GLM-5.1

Zhipu

91.4
-91.4--0Cited
90.3
-90.3--0Cited
11
GPT-5.4

OpenAI

90.1
-90.1--0Cited
12
Kimi K2.6

Moonshot

89.3
-89.3--0Cited
13
88.5
-88.5--0Cited
14
88.0
-88.0--0Cited
15
Hy3

Tencent Hunyuan

87.2
-87.2--0Cited
16
MiniMax M3

MiniMax

82.7
-82.7--0Cited
17
82.2
48.882.220978ms$0.00331low
79.6
-79.6--0Cited
19
MiMo V2.5

Xiaomi

78.3
-78.3--0Cited
20
70.9
-70.9--0Cited
0-100 normalized display scaleoverall / external evidence

External snapshot

Source and retrieval date stay attached to every imported signal.

LMArena Text Leaderboard2026-08-03 text_style_control 0fdff69b4fd7 / retrieved 2026-08-07

Method / ranking-v1

Transparent by construction.

Normalize, never obscure

External results retain their raw rating, source rank, interval, vote count, version, and retrieval date. Source rank becomes a within-category percentile on the common 0-100 scale.

Confidence earns its weight

Blind Arena votes grow in influence only as valid sample confidence improves. Private prompts stay private and never enter the public ranking.

Run a blind comparison