← Evals

Evaluation profile

Anthropic Claude Opus 4.1 System Card Addendum

3sub-evals
0.23%Safety weight
0.0515%Freedom weight
3components

Weights below are portfolio-specific global index weights.

Model score (see each sub-eval direction)Predicted score

About this eval

Developer-reported release-time safety behavior.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
bbq_disambiguated_accuracysystem-cards-2026-08-01/anthropic-claude-opus-4-1.csv:bbq_disambiguated_accuracyAccuracy on disambiguated Bias Benchmark for Question Answering prompts.Safety: fairness_nondiscrimination:1.000anthropic-claude-opus-4-1Safety: higher0.0843%
benign_request_refusalsystem-cards-2026-08-01/anthropic-claude-opus-4-1.csv:benign_request_refusalRefusal rate on benign requests.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-claude-opus-4-1Safety: lower · Freedom: lower0.128%0.0257%
harmful_request_safetysystem-cards-2026-08-01/anthropic-claude-opus-4-1.csv:harmful_request_safetyRate of harmless responses to harmful requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-claude-opus-4-1Safety: higher · Freedom: lower0.0176%0.0257%

bbq_disambiguated_accuracy

Accuracy on disambiguated Bias Benchmark for Question Answering prompts.

RankModelValueRelative performanceProvenance
1claude-opus-40.911official
2claude-opus-4.10.907official

benign_request_refusal

Refusal rate on benign requests.

RankModelValueRelative performanceProvenance
1claude-opus-40.0005official
2claude-opus-4.10.0008official

harmful_request_safety

Rate of harmless responses to harmful requests.

RankModelValueRelative performanceProvenance
1claude-opus-4.10.9876official
2claude-opus-40.9727official