← Evals

Evaluation profile

FORTRESS

2sub-evals
1.45%Safety weight
2.51%Freedom weight
2components

Weights below are portfolio-specific global index weights.

Model score (lower is better)Predicted score

About this eval

Balanced refusal behavior across harmful and benign prompts, including over-refusal.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
average_risk_scorefortress/leaderboard.csv:average_risk_scoreMeasures whether adversarial prompts trigger behaviors identified by each scenario’s risk rubric.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000fortress/leaderboard.csvSafety: lower · Freedom: higher0.176%1.26%
over_refusal_scorefortress/leaderboard.csv:over_refusal_scoreMeasures whether the model refuses benign requests included to test excessive caution.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000fortress/leaderboard.csvSafety: lower · Freedom: lower1.27%1.25%

average_risk_score

Measures whether adversarial prompts trigger behaviors identified by each scenario’s risk rubric.

RankModelValueRelative performanceProvenance
1gpt-oss-120b8.24official
2claude-opus-4.511.59official
3muse-spark-1.112.4official
4claude-3.5-sonnet12.96official
5claude-fable-5.113.72official
6gpt-5.4-pro14.84official
7claude-sonnet-4.514.88official
8gpt-5-pro15.2official
9claude-opus-4.115.47official
10o316.01official
11gpt-5.516.28official
12claude-opus-4.616.76official
13gpt-5-mini17official
14gpt-517.04official
15gpt-5.217.5official
16gpt-oss-20b17.62official
17claude-opus-4.818.19official
18o119.38official
19muse-spark20.22official
20llama-3.1-405b-instruct20.61official
21claude-sonnet-421.21official
22o4-mini21.49official
23claude-opus-426.19official
24gpt-5.128.04official
25gemini-3.1-pro-preview29.76official
26o3-mini30.05official
27claude-3.5-haiku30.41official
28claude-3.7-sonnet38.01official
29llama-4-maverick40.09official
30kimi-k2.541.09official
31gemini-3-pro-preview41.69official
32llama-3.1-70b-instruct44.18official
33llama-3.3-70b-instruct44.79official
34gpt-4o47.18official
35gpt-4o-mini48.07official
36gemini-1.5-flash50.61official
37gemini-3.1-flash-lite51.05official
38gpt-4.153.02official
39gemini-1.5-pro53.86official
40gemini-2.5-pro-exp54.89official
41kimi-k255.47official
42mixtral-8x22b-instruct56.06official
43qwen2.5-72b-instruct56.43official
44gpt-4.1-mini59.19official
45glm-4.559.58official
46deepseek-v3.160.55official
47qwen3-235b-a22b61.39official
48gemini-2.5-pro61.68official
49glm-4.5-air63.18official
50deepseek-r174.39official

over_refusal_score

Measures whether the model refuses benign requests included to test excessive caution.

RankModelValueRelative performanceProvenance
1deepseek-r10.49official
2qwen3-235b-a22b0.98official
3llama-3.1-70b-instruct1.09official
4glm-4.5-air1.17official
5qwen2.5-72b-instruct1.19official
6gemini-2.5-pro-exp1.38official
6gpt-4.1-mini1.38official
8gemini-2.5-pro1.58official
9gpt-4o1.68official
10deepseek-v3.11.76official
11gemini-3-pro-preview2.15official
11gemini-3.1-flash-lite2.15official
13llama-3.3-70b-instruct2.18official
14claude-opus-42.205official
15gpt-4o-mini2.27official
16glm-4.52.54official
17mixtral-8x22b-instruct2.77official
18gpt-4.12.87official
19gemini-3.1-pro-preview3.13official
20gemini-1.5-pro3.17official
21kimi-k23.33official
22kimi-k2.53.72official
23claude-opus-4.14.065official
24claude-3.7-sonnet4.45official
24gemini-1.5-flash4.45official
26llama-4-maverick4.95official
27o15.05official
28o4-mini5.14official
29claude-sonnet-45.14official
30claude-opus-4.55.145official
31claude-sonnet-4.55.25official
32o3-mini5.65official
33gpt-5.15.78official
34llama-3.1-405b-instruct6.03official
35muse-spark-1.16.92official
36claude-opus-4.87.42official
36o37.42official
38gpt-5.4-pro9.41official
39claude-opus-4.69.59official
40gpt-5.59.79official
41gpt-511.2official
42gpt-5.211.76official
43gpt-oss-20b11.94official
44gpt-5-pro12.43official
45claude-3.5-haiku13.16official
46gpt-5-mini14.17official
47claude-fable-5.116.91official
48gpt-oss-120b18official
49claude-3.5-sonnet21.07official