← Evals

Evaluation profile

Arena Factuality — Search Arena (factuality-only weighting)

1sub-evals
0.384%total index weight
1components

Within-component eval weight: Truthfulness 2.56%.

Model score (higher is better)Predicted score

About this eval

Relative factuality of tool-enabled search responses, including research and citation behavior. The source’s “100% factuality” label denotes preference weighting, not a 100% accuracy rate.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
factuality_bt_ratingarena-factuality/search.csv:factuality_bt_ratingMeasures relative factual correctness, research quality, and citation support in tool-enabled search answers.truthfulness_honesty:1.000arena-factualityHigher is better0.384%Truthfulness 2.56%

factuality_bt_rating

Measures relative factual correctness, research quality, and citation support in tool-enabled search answers.

RankModelValueRelative performanceProvenance
1gpt-5.21273.0official
2gpt-5.51269.0official
3gpt-5.41262.0official
4gpt-5.6-sol1241.0official
5grok-4.51227.0official
6gpt-5.11226.0official
7gemini-2.5-pro1217.0official
8gpt-51214.0official
9grok-4.31211.0official
10grok-4.201210.0official
11claude-opus-4.81196.0official
12claude-opus-41195.0official
13claude-opus-4.51191.0official
14claude-sonnet-51190.0official
15claude-fable-51185.0official
16claude-opus-4.61184.0official
17ppl-sonar-pro1183.0official
18gemini-3.1-pro1182.0official
19claude-sonnet-4.51182.0official
20gemini-3-pro-preview1180.0official
21claude-opus-4.11178.0official
22ppl-sonar-reasoning-pro1172.0official
23claude-opus-4.71171.0official
24claude-sonnet-4.61169.0official
25gemini-3-flash-preview1153.0official
26grok-41128.0official
27grok-4.1-fast1123.0official
28grok-4-fast1112.0official
29ernie-5.11096.0official
30o31082.0official