← Evals

Evaluation profile

Claude 3.5 Sonnet model-card safety and alignment evaluations

5sub-evals
0.435%total index weight
3components

Within-component eval weight: Misuse resistance 0.473% · Truthfulness 0.418% · Benign helpfulness 3.25%.

Model score (see each sub-eval direction)Predicted score

About this eval

Appropriate harmful-prompt refusal, benign non-overrefusal, adversarial honesty, and adversarial harmlessness.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
correct_refusals_wildchatclaude-system-cards/claude-3.5-scoring.csv:correct_refusals_wildchatMeasures appropriate refusal of harmful real-world prompts.ordinary_harm_misuse_resistance:1.000anthropic-claude-3.5-system-cardHigher is better0.0223%Misuse resistance 0.223%
human_feedback_harmlessness_win_rate_pctclaude-system-cards/claude-3.5-scoring.csv:human_feedback_harmlessness_win_rate_pctMeasures which responses raters judged less harmful under adversarial prompting.ordinary_harm_misuse_resistance:1.000anthropic-claude-3.5-system-cardHigher is better0.025%Misuse resistance 0.25%
human_feedback_honesty_win_rate_pctclaude-system-cards/claude-3.5-scoring.csv:human_feedback_honesty_win_rate_pctMeasures which responses raters judged more honest under adversarial prompting.truthfulness_honesty:1.000anthropic-claude-3.5-system-cardHigher is better0.0627%Truthfulness 0.418%
incorrect_refusals_wildchatclaude-system-cards/claude-3.5-scoring.csv:incorrect_refusals_wildchatMeasures unnecessary refusal on benign real-world prompts.benign_helpfulness_non_overrefusal:1.000anthropic-claude-3.5-system-cardLower is better0.162%Benign helpfulness 1.62%
incorrect_refusals_xstestclaude-system-cards/claude-3.5-scoring.csv:incorrect_refusals_xstestMeasures exaggerated safety behavior on non-malicious prompts.benign_helpfulness_non_overrefusal:1.000anthropic-claude-3.5-system-cardLower is better0.162%Benign helpfulness 1.62%

correct_refusals_wildchat

Measures appropriate refusal of harmful real-world prompts.

RankModelValueRelative performanceProvenance
1claude-3.5-sonnet96.4official
2claude-3-sonnet93.6official
3claude-3-opus92official
4claude-3-haiku90official

human_feedback_harmlessness_win_rate_pct

Measures which responses raters judged less harmful under adversarial prompting.

RankModelValueRelative performanceProvenance
1claude-2.155official
2claude-3.5-sonnet52official
3claude-3-haiku50official
3claude-3-opus50official
5claude-3-sonnet47official

human_feedback_honesty_win_rate_pct

Measures which responses raters judged more honest under adversarial prompting.

RankModelValueRelative performanceProvenance
1claude-3.5-sonnet66official
2claude-3-opus50official
3claude-2.142official
4claude-3-sonnet38official
5claude-3-haiku36official

incorrect_refusals_wildchat

Measures unnecessary refusal on benign real-world prompts.

RankModelValueRelative performanceProvenance
1claude-3-haiku6.6official
2claude-3-sonnet8.8official
3claude-3.5-sonnet11official
4claude-3-opus11.9official

incorrect_refusals_xstest

Measures exaggerated safety behavior on non-malicious prompts.

RankModelValueRelative performanceProvenance
1claude-3.5-sonnet1.7official
2claude-3-opus8.3official
3claude-3-haiku33.1official
4claude-3-sonnet36.6official