← Evals

Evaluation profile

Claude 3 model-card adversarial human-preference evaluations

8sub-evals
0.394%total index weight
4components

Within-component eval weight: Misuse resistance 0.395% · Fairness 0.68% · Truthfulness 0.399% · Benign helpfulness 2.27%.

Model score (see each sub-eval direction)Predicted score

About this eval

Refusal calibration, adversarial honesty and harmlessness, multimodal hallucination and harmful-response robustness, and discrimination.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
correct_refusals_wildchat_rankclaude-system-cards/claude-3-scoring.csv:correct_refusals_wildchat_rankRanks evaluated systems by how consistently they refuse harmful real-world prompts.ordinary_harm_misuse_resistance:1.000anthropic-claude-3-system-cardLower is better0.0156%Misuse resistance 0.156%
discrimination_rankclaude-system-cards/claude-3-scoring.csv:discrimination_rankRanks evaluated systems by lower discriminatory behavior in the card's evaluation.fairness_nondiscrimination:1.000anthropic-claude-3-system-cardLower is better0.068%Fairness 0.68%
human_feedback_harmlessness_win_rate_pctclaude-system-cards/claude-3-scoring.csv:human_feedback_harmlessness_win_rate_pctMeasures which responses raters judged less harmful under adversarial prompting.ordinary_harm_misuse_resistance:1.000anthropic-claude-3-system-cardHigher is better0.014%Misuse resistance 0.14%
human_feedback_honesty_win_rate_pctclaude-system-cards/claude-3-scoring.csv:human_feedback_honesty_win_rate_pctMeasures which responses raters judged more honest under attempts to elicit falsehoods.truthfulness_honesty:1.000anthropic-claude-3-system-cardHigher is better0.0351%Truthfulness 0.234%
incorrect_refusals_wildchat_rankclaude-system-cards/claude-3-scoring.csv:incorrect_refusals_wildchat_rankRanks evaluated systems by how rarely they refuse benign real-world prompts.benign_helpfulness_non_overrefusal:1.000anthropic-claude-3-system-cardLower is better0.114%Benign helpfulness 1.14%
incorrect_refusals_xstest_rankclaude-system-cards/claude-3-scoring.csv:incorrect_refusals_xstest_rankCompares exaggerated safety behavior on benign prompts designed to resemble unsafe requests.benign_helpfulness_non_overrefusal:1.000anthropic-claude-3-system-cardLower is better0.114%Benign helpfulness 1.14%
multimodal_hallucination_rankclaude-system-cards/claude-3-scoring.csv:multimodal_hallucination_rankRanks evaluated multimodal systems by how reliably they avoid hallucinated claims.truthfulness_honesty:1.000anthropic-claude-3-system-cardLower is better0.0248%Truthfulness 0.165%
multimodal_harmful_response_rankclaude-system-cards/claude-3-scoring.csv:multimodal_harmful_response_rankRanks evaluated multimodal systems by how consistently they avoid harmful responses.ordinary_harm_misuse_resistance:1.000anthropic-claude-3-system-cardLower is better0.00987%Misuse resistance 0.0987%

correct_refusals_wildchat_rank

Ranks evaluated systems by how consistently they refuse harmful real-world prompts.

RankModelValueRelative performanceProvenance
1claude-21official
2claude-3-sonnet2official
3claude-3-opus3official
4claude-2.14official
5claude-3-haiku5official

discrimination_rank

Ranks evaluated systems by lower discriminatory behavior in the card's evaluation.

RankModelValueRelative performanceProvenance
1claude-2.11official
2claude-3-sonnet2official
3claude-3-opus3official
4claude-3-haiku4official
5claude-instant-1.25official

human_feedback_harmlessness_win_rate_pct

Measures which responses raters judged less harmful under adversarial prompting.

RankModelValueRelative performanceProvenance
1claude-2.187official
1claude-3-sonnet87official
3claude-instant-1.285official
4claude-284official

human_feedback_honesty_win_rate_pct

Measures which responses raters judged more honest under attempts to elicit falsehoods.

RankModelValueRelative performanceProvenance
1claude-3-sonnet69official
2claude-2.168official
3claude-266official
4claude-instant-1.261official

incorrect_refusals_wildchat_rank

Ranks evaluated systems by how rarely they refuse benign real-world prompts.

RankModelValueRelative performanceProvenance
1claude-3-haiku1official
2claude-3-sonnet2official
3claude-3-opus3official
4claude-24official
5claude-2.15official

incorrect_refusals_xstest_rank

Compares exaggerated safety behavior on benign prompts designed to resemble unsafe requests.

RankModelValueRelative performanceProvenance
1claude-3-opus1official
2claude-22official
3claude-3-haiku3official
4claude-2.14official
4claude-3-sonnet4official

multimodal_hallucination_rank

Ranks evaluated multimodal systems by how reliably they avoid hallucinated claims.

RankModelValueRelative performanceProvenance
1claude-3-sonnet1official
2claude-3-opus2official

multimodal_harmful_response_rank

Ranks evaluated multimodal systems by how consistently they avoid harmful responses.

RankModelValueRelative performanceProvenance
1claude-3-sonnet1official
2claude-3-opus2official