← Evals

Evaluation profile

BioTIER

2sub-evals
1.12%Safety weight
1.93%Freedom weight
2components

Weights below are portfolio-specific global index weights.

Model score (higher is better)Predicted score

About this eval

Calibrated deployed-system handling of high-risk biological requests versus benign or close-to-boundary biology questions.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
permit_compliance_pctbiotier/biotier.csv:permit_compliance_pctMeasures whether a deployed model endpoint avoids over-refusing benign or close-to-boundary biological questions.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000biotierSafety: higher · Freedom: higher0.981%0.965%
refuse_compliance_pctbiotier/biotier.csv:refuse_compliance_pctMeasures whether a deployed model endpoint avoids providing substantive answers to the benchmark's high-risk biological requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000biotierSafety: higher · Freedom: lower0.134%0.965%

permit_compliance_pct

Measures whether a deployed model endpoint avoids over-refusing benign or close-to-boundary biological questions.

RankModelValueRelative performanceProvenance
1qwen3.5-397b-a17b100official
2gpt-4.199.9official
2gpt-5.5-pro99.9official
2grok-4.2099.9official
2mistral-medium-3.199.9official
6gpt-5.599.8official
7qwen3-235b-a22b99.7official
8deepseek-v3.199.6official
8gemini-2.5-pro99.6official
8gemini-3.1-pro-preview99.6official
8gpt-4o99.6official
8gpt-5.299.6official
8mistral-large-399.6official
8mistral-medium-3.599.6official
8o3-mini99.6official
8qwen3.7-max99.6official
17gpt-5.499.5official
18gemini-2.5-flash99.4official
18gemini-3.5-flash99.4official
18gpt-4.1-mini99.4official
18gpt-4.1-nano99.4official
18kimi-k2.699.4official
18llama-3.3-70b-instruct99.4official
18o199.4official
25gpt-4o-mini99.3official
26gpt-oss-20b99.2official
27gpt-4-turbo99.1official
28gpt-5.199official
29claude-sonnet-498.9official
29glm-5.298.9official
29gpt-5-mini98.9official
32gpt-3.5-turbo98.8official
33gpt-oss-120b98.7official
33o4-mini98.7official
35deepseek-v4-pro98.5official
36gpt-498.4official
36grok-4.1-fast98.4official
38claude-haiku-4.598.3official
38gemini-3-flash-preview98.3official
40gpt-597.9official
41gpt-5-nano97.6official
42o3-pro97.3official
43kimi-k2.597.1official
44o395.3official
45claude-opus-4.589.4official
45claude-sonnet-4.589.4official
47claude-opus-488.9official
48claude-opus-4.188.8official
49claude-opus-4.687.2official
50claude-opus-4.885.8official
51claude-opus-4.778.7official
52claude-sonnet-4.676.3official

refuse_compliance_pct

Measures whether a deployed model endpoint avoids providing substantive answers to the benchmark's high-risk biological requests.

RankModelValueRelative performanceProvenance
1claude-sonnet-4.696.4official
2claude-opus-4.795.5official
3claude-opus-4.895official
4claude-opus-4.694.1official
5claude-opus-4.590.9official
6claude-opus-490.7official
6claude-sonnet-4.590.7official
8claude-opus-4.190.4official
9grok-4.1-fast77.3official
10o3-pro76.1official
11gemini-3.1-pro-preview73.5official
12gpt-573.4official
13o373.1official
14o4-mini72.5official
15gpt-5.471.3official
16grok-4.2068official
17gpt-5.267official
18o166.7official
19gpt-5.165.6official
20gpt-5.5-pro65.3official
21gpt-5-nano59.6official
22gemini-3-flash-preview54.3official
23gpt-5.552.3official
24gpt-oss-120b47.1official
25gpt-5-mini46.9official
26gemini-3.5-flash44.8official
27claude-haiku-4.541.1official
28gpt-oss-20b37.1official
29o3-mini35.4official
30glm-5.233.4official
31qwen3.7-max30.1official
32qwen3.5-397b-a17b29.5official
33claude-sonnet-428.1official
34gpt-426official
35deepseek-v4-pro22.6official
36gpt-4o22.2official
37kimi-k2.621.7official
38kimi-k2.520.4official
39gpt-4-turbo20official
40gpt-4.1-nano19.2official
41qwen3-235b-a22b19.1official
42gpt-4.116.3official
43gpt-4o-mini15.8official
44gpt-3.5-turbo13official
45gemini-2.5-pro12.4official
46llama-3.3-70b-instruct11.8official
47gpt-4.1-mini10.8official
48mistral-medium-3.510.2official
49mistral-large-39.5official
50mistral-medium-3.19.1official
51gemini-2.5-flash8.8official
52deepseek-v3.15.6official