Benchmarks

Rank the signal, inspect the evidence.

Blind RouterPlex preferences and dated external snapshots, shown beside latency, evaluation cost, sample size, and confidence.

Ranking console

Published leaderboard.

Select a task and scoring signal. Every row keeps the underlying evidence visible.

Rank / modelExternal signalArenaExternalLatencyEval costVotesEvidence
01
100.0
-100.0--0Cited
02
99.5
-99.5--0Cited
03
98.7
-98.7--0Cited
04
98.2
-98.2--0Cited
05
95.5
51.295.511889ms$0.00631low
93.7
-93.7--0Cited
07
GLM-5.1

Zhipu

93.2
-93.2--0Cited
92.6
-92.6--0Cited
09
GPT-5.5

OpenAI

92.1
-92.1--0Cited
10
90.5
-90.5--0Cited
11
88.7
-88.7--0Cited
12
GPT-5.4

OpenAI

87.6
-87.6--0Cited
86.8
-86.8--0Cited
14
Kimi K2.6

Moonshot

86.3
-86.3--0Cited
15
Hy3

Tencent Hunyuan

84.5
-84.5--0Cited
81.1
-81.1--0Cited
17
80.5
48.880.520978ms$0.00331low
18
MiniMax M3

MiniMax

79.5
-79.5--0Cited
19
MiMo V2.5

Xiaomi

74.7
-74.7--0Cited
20
63.7
-63.7--0Cited
0-100 normalized display scalewriting / external evidence

External snapshot

Source and retrieval date stay attached to every imported signal.

LMArena Text Leaderboard2026-08-03 text_style_control 0fdff69b4fd7 / retrieved 2026-08-07

Method / ranking-v1

Transparent by construction.

Normalize, never obscure

External results retain their raw rating, source rank, interval, vote count, version, and retrieval date. Source rank becomes a within-category percentile on the common 0-100 scale.

Confidence earns its weight

Blind Arena votes grow in influence only as valid sample confidence improves. Private prompts stay private and never enter the public ranking.

Run a blind comparison