← Models

Model profile

Claude 3 Haiku

Anthropicdeveloper
2024-03-13release date
#190 / 333Safety rank
#627 / 645Freedom rank

Evidence summary

Safety. Claude 3 Haiku has an estimated Safety rank of #190; its 90% source-sensitivity interval is #85–#231. Its behavior-only rank is #210; company governance moves the combined estimate to #190. Published Safety evidence spans 19 eval lineages and 7 of 7 components. Its strongest relative result is HELM Safety (anthropic_red_team, #1 of 80); its weakest is Claude 3 model-card adversarial human-preference evaluations (correct_refusals_wildchat_rank, #5 of 5).

Freedom. Claude 3 Haiku has an estimated Freedom rank of #627; its 90% source-sensitivity interval is #436–#627. Published Freedom evidence spans 12 eval lineages and 1 of 1 components. Its strongest relative result is Claude 3 model-card adversarial human-preference evaluations (incorrect_refusals_wildchat_rank, #1 of 5); its weakest is HELM Safety (anthropic_red_team, #80 of 80).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Safety evals

Rank and direction are specific to the Safety portfolio. Black marks the observed result; the grey dot marks the value implied by the Safety rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
AA-Omnisciencehallucination_rate#169 / 3450.8045Source ↗official
AgentDojotargeted_attack_success_rate#5 / 150.0906Source ↗official
AgentDojoutility_under_attack#10 / 150.3339Source ↗official
AgentHarmharm_score#3 / 1211.1Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#16 / 800.827Source ↗official
BullshitBench v2clear_pushback_rate#97 / 1170.1Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#37 / 10421.14Source ↗official
Claude 3 model-card adversarial human-preference evaluationscorrect_refusals_wildchat_rank#5 / 55Source ↗official
Claude 3 model-card adversarial human-preference evaluationsdiscrimination_rank#4 / 54Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_wildchat_rank#1 / 51Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_xstest_rank#3 / 53Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationscorrect_refusals_wildchat#4 / 490Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_harmlessness_win_rate_pct#3 / 550Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_honesty_win_rate_pct#5 / 536Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_wildchat#1 / 46.6Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_xstest#3 / 433.1Source ↗official
Confabulationsconfabulation_rate#49 / 5256.93Source ↗official
Contextual MoralChoicehuman_agreement#6 / 220.45Source ↗official
Enkrypt AI Safety Leaderboardbias_attack_non_success_rate#172 / 24812.92Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#40 / 24892.67Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#65 / 24887.22Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#25 / 24699.45Source ↗official
HELM Safetyanthropic_red_team#1 / 801Source ↗official
HELM Safetybbq#77 / 800.625Source ↗official
HELM Safetyharmbench#20 / 800.913Source ↗official
HELM Safetysimple_safety_tests#1 / 801Source ↗official
HELM Safetyxstest#75 / 800.853Source ↗official
Large-scale Moral Machine experiment on LLMshuman_choice_distance#10 / 390.8605Source ↗official
OR-Benchover_refusal_rate#24 / 2596.3Source ↗official
OR-Benchtoxic_acceptance_rate#2 / 250.3Source ↗official
SORRY-Benchavg#5 / 510.08Source ↗official

Freedom evals

Rank and direction are specific to the Freedom portfolio. Black marks the observed result; the grey dot marks the value implied by the Freedom rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
AIRBench 2024 Safety Scenariossafety_scenarios#65 / 800.827Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#68 / 10421.14Source ↗official
Claude 3 model-card adversarial human-preference evaluationscorrect_refusals_wildchat_rank#1 / 55Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_wildchat_rank#1 / 51Source ↗official
Claude 3 model-card adversarial human-preference evaluationsincorrect_refusals_xstest_rank#3 / 53Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationscorrect_refusals_wildchat#1 / 490Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_harmlessness_win_rate_pct#2 / 550Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_wildchat#1 / 46.6Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_xstest#3 / 433.1Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#207 / 24892.67Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#183 / 24887.22Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#220 / 24699.45Source ↗official
HELM Safetyanthropic_red_team#80 / 801Source ↗official
HELM Safetyharmbench#61 / 800.913Source ↗official
HELM Safetysimple_safety_tests#58 / 801Source ↗official
HELM Safetyxstest#75 / 800.853Source ↗official
OR-Benchover_refusal_rate#24 / 2596.3Source ↗official
OR-Benchtoxic_acceptance_rate#21 / 250.3Source ↗official
SORRY-Benchavg#45 / 510.08Source ↗official
UGI Leaderboard — base-model willingnesswillingness_adherence_score#151 / 1560Source ↗official
UGI Leaderboard — base-model willingnesswillingness_direct_score#153 / 1560Source ↗official

Values evaluations

Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.

UGI Political Values

DimensionValueDistribution
Political Lean-15.7
Government48.5
Diplomacy61.3
Economy47.1
Society60.1