← Models

Model profile

Claude 2

Anthropicdeveloper
2023-07-11release date
#30 / 333Safety rank
#607 / 645Freedom rank

Evidence summary

Safety. Claude 2 has an estimated Safety rank of #30; its 90% source-sensitivity interval is #4–#156. Its behavior-only rank is #38; company governance moves the combined estimate to #30. Published Safety evidence spans 9 eval lineages and 5 of 7 components. Its strongest relative result is SALAD-Bench (base_representation_toxicity, #1 of 33); its weakest is Claude 3 model-card adversarial human-preference evaluations (human_feedback_harmlessness_win_rate_pct, #4 of 4).

Freedom. Claude 2 has an estimated Freedom rank of #607; its 90% source-sensitivity interval is #386–#632. Published Freedom evidence spans 9 eval lineages and 1 of 1 components. Its strongest relative result is Human Pathogen Capabilities Test (HPCT) — overall refusal (refusal_rate_pct, #1 of 69); its weakest is Claude 2 model-card safety and alignment evaluations (red_teaming_rank, #3 of 3).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Safety evals

Rank and direction are specific to the Safety portfolio. Black marks the observed result; the grey dot marks the value implied by the Safety rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Claude 2 model-card safety and alignment evaluationshhh#1 / 30.86Source ↗official
Claude 2 model-card safety and alignment evaluationshuman_feedback_harmless_elo#2 / 3278Source ↗official
Claude 2 model-card safety and alignment evaluationshuman_feedback_honest_elo#1 / 3137Source ↗official
Claude 2 model-card safety and alignment evaluationsred_teaming_rank#1 / 31Source ↗official
Claude 3 model-card adversarial human-preference evaluationscorrect_refusals_wildchat_rank#1 / 51Source ↗official
Claude 3 model-card adversarial human-preference evaluationshuman_feedback_harmlessness_win_rate_pct#4 / 484Source ↗official
Claude 3 model-card adversarial human-preference evaluationshuman_feedback_honesty_win_rate_pct#3 / 466Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_wildchat_rank#4 / 54Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_xstest_rank#2 / 52Source ↗official
DecodingTrustmachine_ethics#3 / 885.17Source ↗official
DecodingTruststereotype_bias#1 / 8100Source ↗official
DecodingTrusttoxicity#1 / 892.11Source ↗official
Fake Alignment (FINE)multiple_choice_safe_decision_rate#2 / 1485.33Source ↗official
Fake Alignment (FINE)open_ended_safe_response_rate#3 / 1498.67Source ↗official
HarmBenchdr#2 / 282Source ↗official
Human Pathogen Capabilities Test (HPCT) — overall refusalrefusal_rate_pct#27 / 690Source ↗official
SALAD-Benchattack_enhanced_human_autonomy_integrity#1 / 3386.64Source ↗official
SALAD-Benchattack_enhanced_information_safety_harms#1 / 3393.49Source ↗official
SALAD-Benchattack_enhanced_malicious_use#1 / 3387.03Source ↗official
SALAD-Benchattack_enhanced_misinformation_harms#1 / 3391.61Source ↗official
SALAD-Benchattack_enhanced_representation_toxicity#1 / 3387.15Source ↗official
SALAD-Benchattack_enhanced_socioeconomic_harms#1 / 3388.31Source ↗official
SALAD-Benchbase_human_autonomy_integrity#1 / 3399.88Source ↗official
SALAD-Benchbase_information_safety_harms#2 / 3399.66Source ↗official
SALAD-Benchbase_malicious_use#1 / 3399.97Source ↗official
SALAD-Benchbase_misinformation_harms#1 / 3399.7Source ↗official
SALAD-Benchbase_representation_toxicity#1 / 3399.58Source ↗official
SALAD-Benchbase_socioeconomic_harms#1 / 3399.41Source ↗official
SALAD-Benchmcq_human_autonomy_integrity#22 / 3321.67Source ↗official
SALAD-Benchmcq_information_safety_harms#20 / 3328.61Source ↗official
SALAD-Benchmcq_malicious_use#23 / 3319.17Source ↗official
SALAD-Benchmcq_misinformation_harms#23 / 3320.71Source ↗official
SALAD-Benchmcq_representation_toxicity#21 / 3324.38Source ↗official
SALAD-Benchmcq_socioeconomic_harms#20 / 3329.44Source ↗official
SORRY-Benchavg#2 / 510.07Source ↗official
SuperCLUE Safetyinstruction_attack#8 / 3170.69Source ↗official
SuperCLUE Safetyresponsible_ai#1 / 3178.18Source ↗official
SuperCLUE Safetytraditional_safety#14 / 3177.66Source ↗official

Freedom evals

Rank and direction are specific to the Freedom portfolio. Black marks the observed result; the grey dot marks the value implied by the Freedom rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Claude 2 model-card safety and alignment evaluationshuman_feedback_harmless_elo#2 / 3278Source ↗official
Claude 2 model-card safety and alignment evaluationsred_teaming_rank#3 / 31Source ↗official
Claude 3 model-card adversarial human-preference evaluationscorrect_refusals_wildchat_rank#5 / 51Source ↗official
Claude 3 model-card adversarial human-preference evaluationshuman_feedback_harmlessness_win_rate_pct#1 / 484Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_wildchat_rank#4 / 54Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_xstest_rank#2 / 52Source ↗official
DecodingTrusttoxicity#8 / 892.11Source ↗official
Fake Alignment (FINE)open_ended_safe_response_rate#11 / 1498.67Source ↗official
HarmBenchdr#26 / 282Source ↗official
Human Pathogen Capabilities Test (HPCT) — overall refusalrefusal_rate_pct#1 / 690Source ↗official
SALAD-Benchattack_enhanced_human_autonomy_integrity#33 / 3386.64Source ↗official
SALAD-Benchattack_enhanced_information_safety_harms#33 / 3393.49Source ↗official
SALAD-Benchattack_enhanced_malicious_use#33 / 3387.03Source ↗official
SALAD-Benchattack_enhanced_misinformation_harms#33 / 3391.61Source ↗official
SALAD-Benchattack_enhanced_representation_toxicity#33 / 3387.15Source ↗official
SALAD-Benchattack_enhanced_socioeconomic_harms#33 / 3388.31Source ↗official
SALAD-Benchbase_human_autonomy_integrity#33 / 3399.88Source ↗official
SALAD-Benchbase_information_safety_harms#32 / 3399.66Source ↗official
SALAD-Benchbase_malicious_use#33 / 3399.97Source ↗official
SALAD-Benchbase_misinformation_harms#33 / 3399.7Source ↗official
SALAD-Benchbase_representation_toxicity#33 / 3399.58Source ↗official
SALAD-Benchbase_socioeconomic_harms#33 / 3399.41Source ↗official
SORRY-Benchavg#48 / 510.07Source ↗official
SuperCLUE Safetyinstruction_attack#24 / 3170.69Source ↗official
SuperCLUE Safetytraditional_safety#18 / 3177.66Source ↗official