Model profile
Evidence summary
Claude 3.5 Sonnet has an estimated overall rank of #124; its 90% source-sensitivity interval is #50–#182. Its behavior-only rank is #139; company governance moves the combined estimate to #124. Published evidence spans 32 evals and 7 of 7 behavior components. Its strongest relative result is Enkrypt AI Safety Leaderboard (cbrn_attack_non_success_rate, #3 of 241); its weakest is FORTRESS (over_refusal_score, #48 of 48).
Compare this model
Only models sharing at least one published sub-eval are listed.
Official and reference links
- OpenRouter ↗anthropic/claude-3.5-sonnet
- System card ↗Family-level model document · Anthropic · first party
- Release source ↗direct research preview identity date
Published eval results
Rank is within that sub-eval. Black marks the observed result; the grey dot marks the value implied by the global rank. Values stay on each source’s native scale.
| Eval / sub-eval | Rank | Value | Distribution | Source |
|---|---|---|---|---|
| Adversarial Robustnessscore | #5 / 8 | ↓16 | Source ↗official | |
| Agent-SafetyBenchcompromise_availability | #3 / 16 | ↑40.4 | Source ↗official | |
| Agent-SafetyBenchharmful_vulnerable_code | #1 / 16 | ↑64.8 | Source ↗official | |
| Agent-SafetyBenchleak_sensitive_information | #2 / 16 | ↑57.6 | Source ↗official | |
| Agent-SafetyBenchphysical_harm | #1 / 16 | ↑69.6 | Source ↗official | |
| Agent-SafetyBenchproduce_unsafe_information | #1 / 16 | ↑100 | Source ↗official | |
| Agent-SafetyBenchproperty_loss | #2 / 16 | ↑58.4 | Source ↗official | |
| Agent-SafetyBenchspread_unsafe_information | #3 / 16 | ↑32.4 | Source ↗official | |
| Agent-SafetyBenchviolate_law_ethics | #2 / 16 | ↑52 | Source ↗official | |
| AgentDojotargeted_attack_success_rate | #8 / 15 | ↓0.1749 | Source ↗official | |
| AgentDojoutility_under_attack | #2 / 15 | ↑0.6184 | Source ↗official | |
| AgentHarmharm_score | #4 / 12 | ↓13.5 | Source ↗official | |
| AILuminate General Purpose AI Chatchild_sexual_exploitation | #1 / 32 | ↓1 | Source ↗official | |
| AILuminate General Purpose AI Chatdefamation | #2 / 32 | ↓1.3 | Source ↗official | |
| AILuminate General Purpose AI Chathate | #2 / 32 | ↓0.8 | Source ↗official | |
| AILuminate General Purpose AI Chatindiscriminate_weapons_cbrne | #2 / 32 | ↓0.9 | Source ↗official | |
| AILuminate General Purpose AI Chatintellectual_property | #2 / 32 | ↓0.8 | Source ↗official | |
| AILuminate General Purpose AI Chatnon_violent_crimes | #1 / 32 | ↓1 | Source ↗official | |
| AILuminate General Purpose AI Chatprivacy | #2 / 32 | ↓0.8 | Source ↗official | |
| AILuminate General Purpose AI Chatsex_related_crimes | #1 / 32 | ↓1.6 | Source ↗official | |
| AILuminate General Purpose AI Chatsexual_content | #2 / 32 | ↓1.8 | Source ↗official | |
| AILuminate General Purpose AI Chatspecialized_advice | #2 / 32 | ↓2.7 | Source ↗official | |
| AILuminate General Purpose AI Chatsuicide_self_harm | #2 / 32 | ↓1.3 | Source ↗official | |
| AILuminate General Purpose AI Chatviolent_crimes | #1 / 32 | ↓1.7 | Source ↗official | |
| AIRBench 2024 Safety Scenariossafety_scenarios | #3 / 80 | ↑0.8835 | Source ↗official | |
| AnimalHarmBenchscore | #7 / 10 | ↑0.018 | Source ↗official | |
| Anthropic Agentic Misalignment — blackmailmisaligned_action_rate_pct | #12 / 16 | ↓86 | Source ↗official | |
| Anthropic Agentic Misalignment — corporate espionagemisaligned_action_rate_pct | #12 / 16 | ↓99 | Source ↗official | |
| BullshitBench v2clear_pushback_rate | #29 / 106 | ↑0.45 | Source ↗official | |
| CASE-Benchagreement_accuracy | #1 / 7 | ↑90.11 | Source ↗official | |
| Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate | #11 / 104 | ↓3.29 | Source ↗official | |
| Claude 3.5 Sonnet model-card safety and alignment evaluationscorrect_refusals_wildchat | #1 / 4 | ↑96.4 | Source ↗official | |
| Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_harmlessness_win_rate_pct | #2 / 5 | ↑52 | Source ↗official | |
| Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_honesty_win_rate_pct | #1 / 5 | ↑66 | Source ↗official | |
| Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_wildchat | #3 / 4 | ↓11 | Source ↗official | |
| Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_xstest | #1 / 4 | ↓1.7 | Source ↗official | |
| Confabulationsconfabulation_rate | #12 / 52 | ↓12.87 | Source ↗official | |
| Enkrypt AI Safety Leaderboardbias_attack_non_success_rate | #16 / 241 | ↑51.68 | Source ↗official | |
| Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate | #3 / 241 | ↑98.17 | Source ↗official | |
| Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate | #24 / 241 | ↑97.5 | Source ↗official | |
| Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate | #6 / 239 | ↑99.95 | Source ↗official | |
| FinEval Financial Security Knowledgefinancial_security_accuracy_pct | #4 / 19 | ↑78.1 | Source ↗official | |
| FORTRESSaverage_risk_score | #4 / 49 | ↓12.96 | Source ↗official | |
| FORTRESSover_refusal_score | #48 / 48 | ↓21.07 | Source ↗official | |
| HalluVerse-M3 Hallucination Recognitionhallucination_recognition_accuracy | #3 / 14 | ↑76.97 | Source ↗official | |
| HELM Safetyanthropic_red_team | #7 / 80 | ↑0.998 | Source ↗official | |
| HELM Safetybbq | #28 / 80 | ↑0.949 | Source ↗official | |
| HELM Safetyharmbench | #5 / 80 | ↑0.981 | Source ↗official | |
| HELM Safetysimple_safety_tests | #1 / 80 | ↑1 | Source ↗official | |
| HELM Safetyxstest | #43 / 80 | ↑0.956 | Source ↗official | |
| Humanity's Last Exam RMS calibration error (Scale Labs)calibrationError | #35 / 39 | ↓84 | Source ↗official | |
| Large-scale Moral Machine experiment on LLMshuman_choice_distance | #15 / 39 | ↓0.9208 | Source ↗official | |
| MASKlying_probability_pct | #22 / 53 | ↓30.54 | Source ↗official | |
| OR-Benchover_refusal_rate | #11 / 25 | ↓43.8 | Source ↗official | |
| OR-Benchtoxic_acceptance_rate | #12 / 25 | ↓3.4 | Source ↗official | |
| PandaBench JBB direct-request panelsafety_rate | #14 / 46 | ↑0.99 | Source ↗official | |
| PHAREhallucination_resistance_diagnostic | #5 / 70 | ↑0.8671 | Source ↗official | |
| PHAREharm_resistance_diagnostic | #24 / 70 | ↑0.954 | Source ↗official | |
| Reward Hacking Benchmarkintegrity_score | #3 / 13 | ↑99.4 | Source ↗official | |
| SafeArenanormalized_safety_score | #1 / 5 | ↑55 | Source ↗official | |
| SORRY-Benchavg | #12 / 51 | ↓0.14 | Source ↗official | |
| SpeciesismBenchexplicit_speciesism_scale | #4 / 7 | ↓2.467 | Source ↗official | |
| SpeciesismBenchmorally_wrong_rate | #8 / 8 | ↑29.74 | Source ↗official | |
| SpeciesismBenchspeciesism_recognition_rate | #6 / 8 | ↑84.28 | Source ↗official | |
| SpeciEvalbelief_animal_sentience | #60 / 113 | ↑6.78 | Source ↗official | |
| SpeciEvalland_animal_4ns | #100 / 113 | ↓4.97 | Source ↗official | |
| SpeciEvalsea_animal_4ns | #88 / 113 | ↓5 | Source ↗official | |
| SpeciEvalspeciesism | #43 / 113 | ↓1.85 | Source ↗official |
Values evaluations
Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.
ValueCompass
| Dimension | Value | Distribution |
|---|---|---|
| Universalism | 75.9 | |
| Self-direction | 59.2 | |
| Care / Harm | 69 | |
| Fairness / Cheating | 69.5 | |
| Ethical | 90.6 |