← Evals

Evaluation profile

SM-Bench

5sub-evals
1.72%Safety weight
2.45%Freedom weight
3components

Weights below are portfolio-specific global index weights.

Model score (higher is better)Predicted score

About this eval

System-message compliance under adversarial and sensitive-content prompts.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
adversarialsm-bench/sm-bench.csv:adversarialMeasures whether the model preserves appropriate safety boundaries when prompts use hostile logic or pressure it to abandon its principles.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000sm-benchSafety: higher · Freedom: lower0.0712%0.817%
ambiguous_interpretationsm-bench/sm-bench.csv:ambiguous_interpretationMeasures whether the model asks for missing context when a question is genuinely underspecified instead of guessing confidently.Safety: benign_helpfulness_non_overrefusal:1.000sm-benchSafety: higher0.519%
anti_hallucinationsm-bench/sm-bench.csv:anti_hallucinationMeasures whether the model rejects false premises and invented terms or expresses uncertainty instead of manufacturing an answer.Safety: truthfulness_honesty:1.000sm-benchSafety: higher0.195%
eq_boundariessm-bench/sm-bench.csv:eq_boundariesMeasures whether the model responds warmly to benign emotional or personal prompts while maintaining appropriate interpersonal boundaries.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000sm-benchSafety: higher · Freedom: higher0.416%0.817%
overfitsm-bench/sm-bench.csv:overfitMeasures whether the model recovers benign intent from suspicious wording instead of defaulting to refusal, disclaimers, or moralizing.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000sm-benchSafety: higher · Freedom: higher0.519%0.817%

adversarial

Measures whether the model preserves appropriate safety boundaries when prompts use hostile logic or pressure it to abandon its principles.

RankModelValueRelative performanceProvenance
1gemini-3.5-flash92.2official
2gemini-3.1-flash-lite91.71official
2gemma-4-31b-it91.71official
4gemini-3.1-pro-preview90.73official
4glm-590.73official
6gemini-3.5-flash-lite89.76official
7gemini-3.6-flash89.27official
8gpt-5.5-instant88.78official
9gemini-3.8-flash88.29official
9glm-5.188.29official
9mimo-v2-pro88.29official
12gpt-4.187.32official
13gemini-3-pro-preview86.83official
13gemini-3.7-flash86.83official
13glm-5.286.83official
13qwen3.7-max86.83official
17mimo-v2-omni86.59official
18claude-opus-586.34official
18glm-5.386.34official
18gpt-5.186.34official
21gpt-5.6-luna85.85official
21ox-alpha85.85official
21qwen3.6-plus85.85official
24claude-fable-5.185.37official
24grok-4.585.37official
26deepseek-r184.88official
27gemini-3-flash-preview84.39official
27kimi-k2.584.39official
27qwen3.8-max84.39official
30gpt-6-astra83.91official
31claude-opus-4.583.9official
31kimi-k2.683.9official
33gpt-5.6-sol83.66official
33gpt-5.6-terra83.66official
35claude-opus-4.683.41official
35grok-4.383.41official
35mimo-v2.5-pro83.41official
38glm-4.782.93official
38gpt-5.582.93official
40gpt-5-mini82.44official
40inkling82.44official
40kimi-k382.44official
43deepseek-v4-flash81.95official
43grok-4.681.95official
45claude-opus-4.781.46official
45longcat-2.081.46official
45muse-glimmer81.46official
48claude-sonnet-580.98official
48deepseek-v4-pro80.98official
48grok-4.1-fast80.98official
51claude-opus-4.880.49official
51mimo-v2.580.49official
51qwen3.5-397b-a17b80.49official
54claude-sonnet-4.580official
54claude-sonnet-4.680official
54gpt-5.3-chat80official
54muse-spark-1.280official
58minimax-m2.179.76official
59claude-fable-579.51official
59ling-2.6-flash79.51official
59muse-spark-1.179.51official
59qwen3.5-plus79.51official
63gpt-5.3-codex79.02official
63grok-4.20-multi-agent79.02official
63minimax-m379.02official
66gpt-4o-mini78.54official
66gpt-5.278.54official
68glm-5-turbo77.56official
68gpt-5.477.56official
70gpt-4o77.07official
71gpt-5.4-mini76.83official
72claude-haiku-4.576.59official
73deepseek-v3.275.61official
73grok-4.2075.61official
75mimo-v2-flash73.66official
75nemotron-3-nano-30b-a3b73.66official
77trinity-large73.42official
78minimax-m2.573.17official
79nemotron-3-super-120b-a12b71.22official
80aurora-alpha70.73official
80qwen2.5-max70.73official
82mistral-small-469.27official
83minimax-m2.768.78official
84gpt-5.4-nano68.29official

ambiguous_interpretation

Measures whether the model asks for missing context when a question is genuinely underspecified instead of guessing confidently.

RankModelValueRelative performanceProvenance
1claude-opus-597.62official
2inkling96.73official
3muse-spark-1.293.75official
4muse-spark-1.193.15official
5claude-fable-5.192.86official
5grok-4.20-multi-agent92.86official
7claude-fable-592.56official
7kimi-k392.56official
9claude-sonnet-591.96official
9grok-4.591.96official
11gpt-5-mini91.67official
12gemma-4-31b-it90.77official
12glm-5.190.77official
12glm-5.390.77official
15claude-opus-4.890.48official
15gemini-3.7-flash90.48official
15ox-alpha90.48official
18gpt-5.190.18official
18grok-4.690.18official
20kimi-k2.689.88official
21claude-opus-4.589.58official
22claude-opus-4.789.29official
22glm-589.29official
22kimi-k2.589.29official
22qwen3.6-plus89.29official
26claude-sonnet-4.688.99official
26gpt-5.288.99official
26muse-glimmer88.99official
29gpt-5.3-chat88.69official
30gpt-5.5-instant88.1official
31gpt-6-astra88.09official
32gpt-4.187.8official
32gpt-5.487.8official
34gemini-3.6-flash87.5official
34minimax-m387.5official
36glm-5.287.2official
37gemini-3.8-flash86.9official
37gpt-5.3-codex86.9official
39claude-haiku-4.586.61official
39mimo-v2.5-pro86.61official
41gpt-5.4-nano86.31official
42gemini-3.5-flash86.01official
42grok-4.386.01official
42minimax-m2.786.01official
45gemini-3.1-pro-preview85.71official
46mimo-v2-pro85.12official
47gemini-3-pro-preview84.52official
48gpt-5.4-mini84.08official
49gpt-5.6-sol84.08official
50claude-opus-4.683.63official
50gpt-5.6-terra83.63official
52claude-sonnet-4.582.74official
52gpt-5.582.74official
52mimo-v2-omni82.74official
55gemini-3.1-flash-lite82.44official
55gemini-3.5-flash-lite82.44official
55glm-4.782.44official
58gpt-5.6-luna82.14official
58minimax-m2.582.14official
60mimo-v2-flash81.85official
60mimo-v2.581.85official
62qwen3.7-max80.95official
63gemini-3-flash-preview80.65official
63qwen3.8-max80.65official
65qwen3.5-397b-a17b79.76official
66minimax-m2.179.17official
67grok-4.1-fast78.57official
67qwen3.5-plus78.57official
69longcat-2.077.98official
70qwen2.5-max77.38official
71deepseek-v4-flash75.89official
72aurora-alpha73.51official
73ling-2.6-flash73.21official
74nemotron-3-nano-30b-a3b71.43official
75deepseek-v3.270.54official
76deepseek-v4-pro68.75official
77deepseek-r167.26official
78grok-4.2066.96official
79gpt-4o-mini66.07official
80nemotron-3-super-120b-a12b63.39official
81mistral-small-462.5official
82trinity-large62.05official
83gpt-4o58.93official
84glm-5-turbo13.69official

anti_hallucination

Measures whether the model rejects false premises and invented terms or expresses uncertainty instead of manufacturing an answer.

RankModelValueRelative performanceProvenance
1claude-opus-4.6100official
1claude-opus-4.8100official
1claude-sonnet-4.6100official
1claude-sonnet-5100official
1glm-5.3100official
1grok-4.6100official
1mimo-v2-pro100official
1ox-alpha100official
1qwen3.7-max100official
10claude-opus-4.598.95official
10claude-opus-598.95official
10claude-sonnet-4.598.95official
10gemini-3.1-pro-preview98.95official
10kimi-k398.95official
10muse-spark-1.298.95official
16gpt-6-astra98.69official
17claude-fable-598.43official
17mimo-v2.5-pro98.43official
17muse-spark-1.198.43official
17qwen3.5-397b-a17b98.43official
21grok-4.397.91official
21grok-4.597.91official
23claude-opus-4.797.38official
23gemini-3-pro-preview97.38official
23gemini-3.7-flash97.38official
26gemma-4-31b-it96.86official
26grok-4.1-fast96.86official
26qwen3.6-plus96.86official
29claude-fable-5.196.34official
29gemini-3.8-flash96.34official
29glm-5.296.34official
29kimi-k2.696.34official
29minimax-m396.34official
34gpt-5.5-instant95.81official
35qwen3.5-plus95.29official
36gemini-3.1-flash-lite94.76official
36gpt-5.594.76official
36grok-4.20-multi-agent94.76official
39muse-glimmer94.5official
40deepseek-v4-flash94.24official
40gemini-3.6-flash94.24official
40mimo-v2-omni94.24official
43gpt-5.3-codex93.72official
44kimi-k2.593.19official
45glm-592.67official
46gpt-5.6-sol92.41official
47claude-haiku-4.592.15official
48gpt-5.191.62official
49deepseek-v3.291.1official
49gpt-4.191.1official
51gpt-5.6-terra90.84official
52gpt-5.3-chat90.58official
52gpt-5.490.58official
52nemotron-3-super-120b-a12b90.58official
55grok-4.2088.74official
56deepseek-v4-pro88.48official
56gemini-3.5-flash88.48official
56glm-5.188.48official
56mimo-v2.588.48official
56qwen2.5-max88.48official
61gpt-5.6-luna87.17official
62gemini-3.5-flash-lite86.91official
62gpt-5-mini86.91official
64gpt-4o86.39official
64gpt-5.286.39official
66glm-4.785.86official
66ling-2.6-flash85.86official
68deepseek-r184.82official
69inkling83.25official
70gemini-3-flash-preview82.72official
71trinity-large80.89official
72mimo-v2-flash80.63official
73gpt-5.4-mini80.23official
74aurora-alpha79.06official
74minimax-m2.179.06official
76minimax-m2.577.49official
77qwen3.8-max76.96official
78longcat-2.076.44official
79nemotron-3-nano-30b-a3b75.13official
80minimax-m2.772.77official
81gpt-5.4-nano68.06official
82gpt-4o-mini59.16official
83mistral-small-457.85official
84glm-5-turbo18.85official

eq_boundaries

Measures whether the model responds warmly to benign emotional or personal prompts while maintaining appropriate interpersonal boundaries.

RankModelValueRelative performanceProvenance
1grok-4.2090.45official
2mistral-small-485.67official
3grok-4.20-multi-agent83.99official
4mimo-v2-pro79.78official
5gpt-6-astra76.69official
6gemini-3.5-flash-lite76.12official
7qwen3.8-max75.84official
8grok-4.1-fast74.72official
9grok-4.674.16official
9mimo-v2-omni74.16official
11glm-5.173.88official
12gpt-4.173.31official
13gemini-3.6-flash71.35official
13glm-4.771.35official
13gpt-4o-mini71.35official
16grok-4.370.79official
16longcat-2.070.79official
18kimi-k370.51official
18mimo-v2.570.51official
20deepseek-v4-flash69.94official
21glm-5.369.66official
22glm-5-turbo69.1official
22gpt-5.3-codex69.1official
22grok-4.569.1official
25claude-opus-568.82official
25minimax-m2.168.82official
27gemini-3.5-flash68.54official
28gemini-3.1-pro-preview68.26official
28muse-spark-1.168.26official
30mimo-v2.5-pro67.98official
31claude-fable-5.167.7official
31gemma-4-31b-it67.7official
33deepseek-v3.267.42official
33muse-spark-1.267.42official
35gpt-5.4-mini67.28official
36trinity-large66.86official
37gemini-3.1-flash-lite66.85official
38gpt-5.6-terra66.01official
39gemini-3.7-flash65.73official
40gemini-3-flash-preview65.45official
41gpt-5.6-sol65.31official
42deepseek-v4-pro65.17official
43gpt-5.3-chat64.89official
44gemini-3-pro-preview64.61official
44gpt-5.564.61official
46glm-5.264.04official
47qwen3.7-max63.48official
48glm-563.2official
48mimo-v2-flash63.2official
50gemini-3.8-flash62.36official
50gpt-5.5-instant62.36official
52qwen3.5-plus62.08official
53ox-alpha61.8official
54minimax-m2.561.24official
55kimi-k2.660.67official
56gpt-5.460.11official
57gpt-5.4-nano58.71official
57gpt-5.6-luna58.71official
57qwen3.6-plus58.71official
60qwen3.5-397b-a17b58.43official
61kimi-k2.558.15official
62claude-opus-4.757.87official
62minimax-m357.87official
64deepseek-r157.58official
65claude-opus-4.556.46official
65ling-2.6-flash56.46official
67gpt-5.155.62official
68claude-sonnet-555.06official
69claude-sonnet-4.554.21official
70muse-glimmer53.93official
70nemotron-3-nano-30b-a3b53.93official
72claude-fable-553.65official
72claude-opus-4.853.65official
74gpt-5-mini52.81official
75minimax-m2.752.53official
75nemotron-3-super-120b-a12b52.53official
77aurora-alpha51.69official
78gpt-4o51.12official
79inkling48.03official
80qwen2.5-max47.47official
81claude-opus-4.642.98official
82claude-haiku-4.541.85official
83gpt-5.240.45official
84claude-sonnet-4.633.43official

overfit

Measures whether the model recovers benign intent from suspicious wording instead of defaulting to refusal, disclaimers, or moralizing.

RankModelValueRelative performanceProvenance
1gemini-3.5-flash98.36official
2gemini-3.1-flash-lite97.81official
3claude-opus-4.695.63official
4gemini-3.6-flash95.08official
4gemini-3.8-flash95.08official
6gpt-6-astra94.81official
7gemini-3-flash-preview93.99official
7gemini-3.7-flash93.99official
7kimi-k393.99official
10glm-5.392.35official
10grok-4.592.35official
12claude-opus-4.791.8official
12gemma-4-31b-it91.8official
14claude-sonnet-4.691.53official
15claude-opus-591.26official
16mimo-v2-pro90.71official
17claude-opus-4.588.52official
17ox-alpha88.52official
19muse-spark-1.187.98official
20claude-opus-4.887.43official
21mimo-v2.5-pro85.79official
22claude-fable-5.184.7official
22grok-4.20-multi-agent84.7official
24gemini-3.1-pro-preview84.15official
25claude-sonnet-4.583.06official
25claude-sonnet-583.06official
25gemini-3-pro-preview83.06official
25gpt-4o83.06official
29claude-haiku-4.581.97official
30mimo-v2-omni81.42official
31grok-4.380.87official
31grok-4.680.87official
33glm-5.280.33official
33muse-spark-1.280.33official
35minimax-m379.23official
36gpt-5.5-instant78.96official
37gemini-3.5-flash-lite78.14official
38glm-5.177.6official
38longcat-2.077.6official
40deepseek-v4-pro76.5official
40gpt-4.176.5official
42mimo-v2.575.96official
43deepseek-r174.86official
44glm-4.773.77official
45inkling72.68official
45qwen3.7-max72.68official
47glm-5-turbo70.49official
48qwen3.6-plus69.4official
49kimi-k2.568.85official
50kimi-k2.667.21official
51minimax-m2.166.67official
51qwen2.5-max66.67official
53grok-4.1-fast66.12official
54trinity-large65.17official
55gpt-4o-mini65.03official
56glm-563.11official
57mistral-small-462.57official
58gpt-5.160.11official
59deepseek-v4-flash59.56official
60gpt-5.6-sol57.52official
61qwen3.5-397b-a17b56.83official
62minimax-m2.754.64official
63grok-4.2054.1official
64gpt-5.6-terra53.55official
65qwen3.8-max52.19official
66minimax-m2.550.82official
67gpt-5.550official
68muse-glimmer49.18official
69gpt-5.6-luna47.81official
70deepseek-v3.244.81official
71nemotron-3-nano-30b-a3b42.62official
72gpt-5.3-chat41.53official
73gpt-5.438.25official
74claude-fable-534.43official
75gpt-5.3-codex33.33official
76qwen3.5-plus28.96official
77ling-2.6-flash26.23official
78aurora-alpha25.68official
78gpt-5.225.68official
80gpt-5-mini25.14official
81nemotron-3-super-120b-a12b21.86official
82gpt-5.4-mini15.3official
83mimo-v2-flash12.84official
84gpt-5.4-nano4.37official