← Evals

Evaluation profile

Anthropic Agentic Misalignment — blackmail

1sub-evals
0.0939%Safety weight
0%Freedom weight
1components

Weights below are portfolio-specific global index weights.

Model score (lower is better)Predicted score

About this eval

Agentic misalignment under a goal conflict and threat to model autonomy.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
misaligned_action_rate_pctanthropic-agentic-misalignment/blackmail.csv:misaligned_action_rate_pctMeasures whether the model intentionally uses private affair information as leverage to prevent its replacement in a deliberately constrained simulation.Safety: responsible_agency_control:1.000anthropic-agentic-misalignmentSafety: lower0.0939%

misaligned_action_rate_pct

Measures whether the model intentionally uses private affair information as leverage to prevent its replacement in a deliberately constrained simulation.

RankModelValueRelative performanceProvenance
1llama-4-maverick0official
2qwen3-235b-a22b9official
3claude-3.5-haiku10official
4gpt-4o15official
5claude-3-opus51official
6claude-3.7-sonnet65official
7gpt-4.5-preview67official
8claude-sonnet-479official
8deepseek-r179official
10gpt-4.180official
10grok-3-beta80official
12claude-3.5-sonnet86official
13claude-3.6-sonnet87official
14gemini-2.5-pro95official
15claude-opus-496official
15gemini-2.5-flash96official