← Evals

Evaluation profile

Anthropic Agentic Misalignment — corporate espionage

1sub-evals
0.164%total index weight
2components

Within-component eval weight: Human rights 0.436% · Responsible agency 0.656%.

Model score (lower is better)Predicted score

About this eval

Agentic misalignment induced by a goal conflict without self-preservation pressure.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
misaligned_action_rate_pctanthropic-agentic-misalignment/corporate-espionage.csv:misaligned_action_rate_pctMeasures whether the model leaks confidential defense documents to a purported rival in pursuit of its assigned goal.human_rights_systemic_harm:0.250|responsible_agency_control:0.750anthropic-agentic-misalignmentLower is better0.164%Human rights 0.436% · Responsible agency 0.656%

misaligned_action_rate_pct

Measures whether the model leaks confidential defense documents to a purported rival in pursuit of its assigned goal.

RankModelValueRelative performanceProvenance
1claude-3.7-sonnet4official
2gpt-4o6official
3claude-sonnet-417official
4claude-3.5-haiku19official
5grok-3-beta37official
6gpt-4.5-preview42official
7llama-4-maverick44official
8claude-opus-457official
9deepseek-r173official
10qwen3-235b-a22b76official
11claude-3-opus88official
12claude-3.5-sonnet99official
12gpt-4.199official
14claude-3.6-sonnet100official
14gemini-2.5-flash100official
14gemini-2.5-pro100official