← Evals

Evaluation profile

CAIS Risk Index

7sub-evals
4.62%Safety weight
2.62%Freedom weight
4components

Weights below are portfolio-specific global index weights.

Model score (lower is better)Predicted score

About this eval

Frontier-model risk across prompt injection, biological-weapons assistance, political manipulation, overconfidence, deception, and harmful propensities.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
agent_red_teamingaisafetyindex/cais-risk-index.csv:agent_red_teamingMeasures whether an agent resists prompt injections and adversarial instructions while using tools.Safety: responsible_agency_control:1.000cais-agent-red-teamingSafety: lower0.986%
bioweapons_assistanceaisafetyindex/cais-risk-index.csv:bioweapons_assistanceMeasures whether the model avoids providing assistance that could enable the development or use of biological weapons.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000cais-bioweapons-assistanceSafety: lower · Freedom: higher0.365%2.62%
hle_overconfidenceaisafetyindex/cais-risk-index.csv:hle_overconfidenceMeasures whether the model avoids expressing unjustified confidence when answering exceptionally difficult factual questions.Safety: truthfulness_honesty:1.000cais-hle-overconfidenceSafety: lower0.252%
machiavelliaisafetyindex/cais-risk-index.csv:machiavelliMeasures whether the model avoids deceptive and power-seeking actions while pursuing goals in interactive text games.Safety: truthfulness_honesty:1.000machiavelliSafety: lower0.485%
maskaisafetyindex/cais-risk-index.csv:maskMeasures whether the model avoids lying when deception would help it satisfy an instructed goal.Safety: truthfulness_honesty:1.000maskSafety: lower0.513%
political_manipulationaisafetyindex/cais-risk-index.csv:political_manipulationMeasures asymmetric rhetoric, framing, depth, and engagement across matched prompts about opposing political subjects.Safety: fairness_nondiscrimination:1.000cais-political-manipulationSafety: lower1.24%
textquests_harmaisafetyindex/cais-risk-index.csv:textquests_harmMeasures whether the model avoids harmful actions while pursuing goals in interactive text-based environments.Safety: responsible_agency_control:1.000cais-textquests-harmSafety: lower0.776%

agent_red_teaming

Measures whether an agent resists prompt injections and adversarial instructions while using tools.

RankModelValueRelative performanceProvenance
1gpt-6-astra13.5official
2gemini-3.8-flash29.8official
3claude-fable-5.134.2official
4gemini-3.7-flash38.5official
5claude-fable-539.4official
6gpt-5.6-sol40.3official
7gpt-5.541.5official
8claude-opus-4.542.5official
9claude-opus-543.3official
10claude-opus-4.744.5official
11muse-spark-1.144.8official
12gemini-3.1-flash-lite45.4official
13claude-opus-4.847official
14gemini-3-pro-preview47.5official
15claude-opus-4.649.5official
16gpt-5.6-terra54.6official
17claude-sonnet-4.654.8official
18gpt-5.459.7official
19gpt-5.6-luna64.2official
20claude-sonnet-4.564.6official
21gemini-3.1-pro-preview68official
22gpt-5.268.8official
23glm-5.369.2official
24claude-haiku-4.569.7official
25glm-5.271official
26gemini-3.5-flash72.3official
27gpt-5.4-mini74.3official
28glm-5.175.8official
29kimi-k376.6official
30gpt-5.4-nano81.7official
31gpt-5.182.1official
32grok-4.583.5official
33gpt-5-mini84.3official
34grok-4.2084.6official
35grok-485.9official
36claude-sonnet-486.6official
37gpt-5-nano88.5official
38grok-4.390.1official
39grok-4.1-fast90.2official
40gpt-4o90.7official
40kimi-k2.690.7official
42deepseek-r190.9official
42kimi-k2.590.9official
44gemini-2.5-pro91.4official
45gemini-2.5-flash91.9official
46kimi-k292.8official
47gemini-3-flash-preview92.9official
48deepseek-v3.293official
49gemini-2.5-flash-lite96.8official

bioweapons_assistance

Measures whether the model avoids providing assistance that could enable the development or use of biological weapons.

RankModelValueRelative performanceProvenance
1claude-fable-50official
2claude-fable-5.10.5official
3claude-sonnet-4.512official
4claude-opus-4.719.2official
5muse-spark-1.122.3official
6claude-opus-523.5official
7claude-opus-4.826.4official
8claude-sonnet-4.631.5official
9claude-opus-4.634.8official
10claude-opus-4.535.3official
11o347.7official
12gpt-6-astra50.8official
13grok-4.2056.9official
14gpt-5.457.1official
15gpt-5.4-mini60official
16grok-4.360.1official
17gpt-5.560.5official
18gpt-562.6official
19gpt-5.262.9official
20glm-5.263.8official
20grok-4.1-fast63.8official
22grok-4-fast64.1official
23grok-464.2official
24gpt-5.6-sol64.3official
25gemini-3.8-flash65.6official
26glm-5.365.8official
27gemini-3.7-flash65.9official
28gpt-5.6-terra66.2official
29gpt-5.166.3official
30o4-mini67.6official
31o168.1official
32gpt-5.6-luna68.8official
33gpt-5-nano71.3official
34gemini-3.1-pro-preview73.5official
35gemini-3-flash-preview75.3official
36gpt-5-mini78.2official
37gemini-3.5-flash78.3official
37gpt-5.4-nano78.3official
39grok-4.579.2official
40claude-haiku-4.584.9official
41kimi-k387.2official
42o3-mini88.3official
43kimi-k2.688.4official
44glm-5.189official
45gemini-3.1-flash-lite89.8official
46gpt-4o92.7official
47kimi-k293official
48kimi-k2.593.2official
49deepseek-v3.294official
50gemini-2.5-pro94.1official
51deepseek-r194.4official
52gemini-2.5-flash95.9official
53gemini-2.5-flash-lite96.3official
54gemini-3-pro-preview100official

hle_overconfidence

Measures whether the model avoids expressing unjustified confidence when answering exceptionally difficult factual questions.

RankModelValueRelative performanceProvenance
1claude-fable-5.120.3official
2claude-opus-523.6official
3muse-spark-1.125.3official
4claude-fable-525.5official
5claude-opus-4.826.4official
6claude-opus-4.728.1official
7grok-4.530.8official
8gpt-6-astra39.8official
9gpt-5.440.9official
10gpt-5.541.8official
11glm-5.242official
12grok-4.342.5official
13claude-sonnet-4.643.1official
14gpt-5.243.7official
15kimi-k344.7official
16grok-4.2045.8official
17claude-opus-4.646official
18glm-5.346.5official
19gpt-5.6-sol46.7official
20gpt-5.4-nano47.1official
21gpt-5.147.8official
22gpt-550official
23gemini-3.1-pro-preview50.3official
24gpt-5.6-terra50.7official
25gemini-3.8-flash51.3official
26gemini-3.7-flash51.9official
27gemini-3.5-flash53.5official
28gemini-3-flash-preview55.1official
29gpt-5.4-mini55.2official
30gpt-5.6-luna55.7official
31grok-456.4official
32claude-opus-4.556.9official
33gemini-3-pro-preview57.2official
34kimi-k2.658.2official
35glm-5.158.5official
36deepseek-v3.258.8official
37claude-haiku-4.560.5official
38claude-sonnet-4.564.1official
39gpt-5-mini65official
40kimi-k267.8official
41grok-4-fast68.7official
42gemini-2.5-pro-exp71official
43gemini-2.5-pro72official
44grok-4.1-fast72.1official
45gemini-3.1-flash-lite72.8official
46deepseek-r173official
47claude-3.7-sonnet75official
47claude-sonnet-475official
49kimi-k2.575.9official
50gemini-2.5-flash80official
50gpt-5-nano80official
50o3-mini80official
53o183official
54gemini-2.5-flash-lite83.4official
55gpt-4o89official

machiavelli

Measures whether the model avoids deceptive and power-seeking actions while pursuing goals in interactive text games.

RankModelValueRelative performanceProvenance
1gpt-6-astra76.3official
2gpt-5-nano79.4official
3claude-fable-580.2official
4gpt-5.6-terra80.4official
5claude-opus-4.580.8official
6grok-4.1-fast81.3official
7claude-haiku-4.581.5official
8claude-sonnet-4.581.6official
9gpt-5.581.7official
10claude-fable-5.182.4official
11gpt-5.6-sol82.7official
12claude-opus-4.883.7official
13gpt-583.8official
13grok-4.2083.8official
15gpt-5-mini84.2official
15kimi-k284.2official
17claude-opus-4.684.4official
18grok-4.384.7official
19claude-sonnet-4.684.9official
20deepseek-r185.1official
21gemini-3.7-flash85.5official
22claude-opus-4.785.7official
23gemini-3.8-flash86.5official
23gpt-5.286.5official
25glm-5.186.7official
26gpt-5.6-luna87.9official
27muse-spark-1.188.2official
28glm-5.388.4official
29gpt-5.4-nano88.5official
30gemini-3.1-pro-preview89.2official
31gemini-2.5-flash89.4official
32deepseek-v3.289.6official
32gpt-5.189.6official
34grok-4.590.9official
35kimi-k2.692.1official
36gemini-3.5-flash92.3official
36glm-5.292.3official
38kimi-k392.6official
39gpt-5.492.9official
40grok-493.4official
41kimi-k2.593.5official
42gemini-2.5-pro95.3official
42gemini-3-flash-preview95.3official
44gpt-5.4-mini95.6official
45gemini-3.1-flash-lite95.8official
46grok-4-fast96.2official
47claude-opus-596.5official
48gpt-4o99.6official
49gemini-3-pro-preview99.8official
50o3-mini105official
51gemini-2.5-flash-lite109.4official

mask

Measures whether the model avoids lying when deception would help it satisfy an instructed goal.

RankModelValueRelative performanceProvenance
1gpt-6-astra1.5official
2muse-spark-1.13.8official
3claude-sonnet-4.53.9official
4claude-haiku-4.54.6official
4gpt-5.6-sol4.6official
6claude-opus-4.55.9official
7claude-opus-56.6official
8gpt-5.6-terra6.7official
9claude-fable-57.2official
10gpt-5.6-luna7.3official
11claude-opus-4.88.1official
12kimi-k39.4official
13gpt-5.49.7official
14gpt-5.59.9official
15glm-5.310.1official
16claude-sonnet-410.7official
17claude-sonnet-4.611.7official
18gpt-5.112official
19gpt-5-nano12.3official
20claude-opus-4.612.7official
21gpt-5.212.9official
22claude-fable-5.114.1official
23o315.5official
24glm-5.115.8official
25gpt-5.4-mini15.9official
26claude-3.7-sonnet16.9official
27claude-opus-4.717.1official
28kimi-k2.518.5official
29gpt-520.7official
30o4-mini21.4official
31gpt-5-mini21.7official
32kimi-k2.623.2official
33gpt-5.4-nano23.7official
34glm-5.225.8official
35grok-4.527.9official
36kimi-k230.7official
37o140.7official
38grok-4.2041official
39gemini-3.8-flash41.4official
40grok-441.7official
41deepseek-r142.7official
42gemini-2.5-pro44.3official
43gemini-3.7-flash46.3official
44gemini-2.5-pro-exp46.9official
45grok-4.348.3official
46gemini-2.5-flash50.9official
47o3-mini51.1official
48deepseek-v3.253official
49gemini-3.1-pro-preview53.8official
50gemini-2.5-flash-lite54official
51gemini-3.1-flash-lite55.8official
52gemini-3.5-flash57.4official
53gemini-3-pro-preview58official
54gemini-3-flash-preview61.7official
55grok-4-fast70official
56grok-4.1-fast71official
57gpt-4o78official

political_manipulation

Measures asymmetric rhetoric, framing, depth, and engagement across matched prompts about opposing political subjects.

RankModelValueRelative performanceProvenance
1muse-spark-1.127.9official
2grok-4-fast30.8official
3grok-4.1-fast32.5official
4claude-fable-5.133.4official
5gpt-535.3official
6claude-opus-536.7official
7gemini-2.5-pro37.3official
8gpt-6-astra37.4official
9o339official
10claude-fable-539.8official
11grok-4.2039.9official
12gpt-5.540official
13gpt-5.6-sol41.7official
14gemini-3.1-pro-preview42.2official
15mistral-medium-3.543official
16kimi-k2.643.6official
17deepseek-v4-pro44official
18gpt-5.6-luna44.7official
19gemini-3.7-flash45.1official
20grok-345.6official
21gpt-5.6-terra46.2official
22gemini-3.8-flash46.3official
23glm-5.346.8official
24kimi-k347.6official
25gpt-5.147.9official
26claude-opus-4.748.2official
27claude-opus-4.549.4official
28grok-449.5official
29glm-5.250official
30grok-4.550.2official
31grok-4.351.6official
32claude-opus-4.651.7official
33gemini-3.1-flash-lite51.9official
34gpt-4.152.8official
35gemini-3.5-flash53.4official
36claude-opus-4.853.8official
37claude-opus-455.3official
38claude-opus-4.155.6official
38gpt-3.5-turbo55.6official
40gpt-5.257official
41gpt-459.2official
42gpt-5.459.4official
43gpt-4o59.6official
44gpt-5.4-mini61.1official
45claude-haiku-4.562.2official
46gpt-5.4-nano63.3official
47claude-3-opus63.5official
48qwen3-14b63.7official

textquests_harm

Measures whether the model avoids harmful actions while pursuing goals in interactive text-based environments.

RankModelValueRelative performanceProvenance
1gpt-5-nano2official
2grok-4.33.9official
3grok-4.1-fast9.1official
4grok-4.209.9official
5gpt-4o11.2official
5grok-4.511.2official
7gemini-2.5-flash11.7official
8o3-mini13.4official
9kimi-k214.6official
10glm-5.314.8official
11gpt-5.4-nano15.2official
11muse-spark-1.115.2official
13deepseek-r115.4official
13gpt-5.4-mini15.4official
15gemini-3.1-flash-lite15.6official
16gemini-2.5-pro15.9official
17claude-sonnet-416official
18claude-sonnet-4.616.5official
19claude-haiku-4.516.6official
20gpt-5.116.7official
21kimi-k317official
22claude-sonnet-4.517.1official
23gpt-517.2official
24gpt-5-mini17.5official
25gemini-3-flash-preview17.8official
26glm-5.218.1official
27o4-mini18.6official
28o318.7official
29gemini-3.1-pro-preview18.8official
30grok-4-fast19.8official
31claude-opus-4.520.3official
32kimi-k2.620.4official
33gpt-5.220.5official
34gemini-3.5-flash20.7official
35kimi-k2.520.8official
36claude-opus-4.821official
37gemini-3-pro-preview21.4official
37gpt-5.521.4official
39deepseek-v3.221.6official
40claude-opus-4.721.8official
41glm-5.122official
42gpt-5.6-terra22.2official
43claude-opus-522.6official
44gemini-2.5-flash-lite22.8official
45claude-opus-4.623.2official
46claude-fable-523.7official
47gpt-5.6-luna23.8official
48grok-424.3official
49gemini-3.7-flash24.4official
49gemini-3.8-flash24.4official
51gpt-5.424.5official
52claude-fable-5.127.1official
53gpt-6-astra29.2official
54gpt-5.6-sol31.4official