← Evals

Evaluation profile

Anthropic Agentic Misalignment — blackmail

1sub-evals
0.131%total index weight
1components

Within-component eval weight: Responsible agency 0.875%.

Model score (lower is better)Predicted score

About this eval

Agentic misalignment under a goal conflict and threat to model autonomy.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
misaligned_action_rate_pctanthropic-agentic-misalignment/blackmail.csv:misaligned_action_rate_pctMeasures whether the model intentionally uses private affair information as leverage to prevent its replacement in a deliberately constrained simulation.responsible_agency_control:1.000anthropic-agentic-misalignmentLower is better0.131%Responsible agency 0.875%

misaligned_action_rate_pct

Measures whether the model intentionally uses private affair information as leverage to prevent its replacement in a deliberately constrained simulation.

RankModelValueRelative performanceProvenance
1llama-4-maverick0official
2qwen3-235b-a22b9official
3claude-3.5-haiku10official
4gpt-4o15official
5claude-3-opus51official
6claude-3.7-sonnet65official
7gpt-4.5-preview67official
8claude-sonnet-479official
8deepseek-r179official
10gpt-4.180official
10grok-3-beta80official
12claude-3.5-sonnet86official
13claude-3.6-sonnet87official
14gemini-2.5-pro95official
15claude-opus-496official
15gemini-2.5-flash96official