← Models

Model profile

Claude 3.5 Sonnet

Anthropicdeveloper
2024-06-21release date
#124 / 312overall rank
32eval lineages

Evidence summary

Claude 3.5 Sonnet has an estimated overall rank of #124; its 90% source-sensitivity interval is #50–#182. Its behavior-only rank is #139; company governance moves the combined estimate to #124. Published evidence spans 32 evals and 7 of 7 behavior components. Its strongest relative result is Enkrypt AI Safety Leaderboard (cbrn_attack_non_success_rate, #3 of 241); its weakest is FORTRESS (over_refusal_score, #48 of 48).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Published eval results

Rank is within that sub-eval. Black marks the observed result; the grey dot marks the value implied by the global rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Adversarial Robustnessscore#5 / 816Source ↗official
Agent-SafetyBenchcompromise_availability#3 / 1640.4Source ↗official
Agent-SafetyBenchharmful_vulnerable_code#1 / 1664.8Source ↗official
Agent-SafetyBenchleak_sensitive_information#2 / 1657.6Source ↗official
Agent-SafetyBenchphysical_harm#1 / 1669.6Source ↗official
Agent-SafetyBenchproduce_unsafe_information#1 / 16100Source ↗official
Agent-SafetyBenchproperty_loss#2 / 1658.4Source ↗official
Agent-SafetyBenchspread_unsafe_information#3 / 1632.4Source ↗official
Agent-SafetyBenchviolate_law_ethics#2 / 1652Source ↗official
AgentDojotargeted_attack_success_rate#8 / 150.1749Source ↗official
AgentDojoutility_under_attack#2 / 150.6184Source ↗official
AgentHarmharm_score#4 / 1213.5Source ↗official
AILuminate General Purpose AI Chatchild_sexual_exploitation#1 / 321Source ↗official
AILuminate General Purpose AI Chatdefamation#2 / 321.3Source ↗official
AILuminate General Purpose AI Chathate#2 / 320.8Source ↗official
AILuminate General Purpose AI Chatindiscriminate_weapons_cbrne#2 / 320.9Source ↗official
AILuminate General Purpose AI Chatintellectual_property#2 / 320.8Source ↗official
AILuminate General Purpose AI Chatnon_violent_crimes#1 / 321Source ↗official
AILuminate General Purpose AI Chatprivacy#2 / 320.8Source ↗official
AILuminate General Purpose AI Chatsex_related_crimes#1 / 321.6Source ↗official
AILuminate General Purpose AI Chatsexual_content#2 / 321.8Source ↗official
AILuminate General Purpose AI Chatspecialized_advice#2 / 322.7Source ↗official
AILuminate General Purpose AI Chatsuicide_self_harm#2 / 321.3Source ↗official
AILuminate General Purpose AI Chatviolent_crimes#1 / 321.7Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#3 / 800.8835Source ↗official
AnimalHarmBenchscore#7 / 100.018Source ↗official
Anthropic Agentic Misalignment — blackmailmisaligned_action_rate_pct#12 / 1686Source ↗official
Anthropic Agentic Misalignment — corporate espionagemisaligned_action_rate_pct#12 / 1699Source ↗official
BullshitBench v2clear_pushback_rate#29 / 1060.45Source ↗official
CASE-Benchagreement_accuracy#1 / 790.11Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#11 / 1043.29Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationscorrect_refusals_wildchat#1 / 496.4Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_harmlessness_win_rate_pct#2 / 552Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationshuman_feedback_honesty_win_rate_pct#1 / 566Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_wildchat#3 / 411Source ↗official
Claude 3.5 Sonnet model-card safety and alignment evaluationsincorrect_refusals_xstest#1 / 41.7Source ↗official
Confabulationsconfabulation_rate#12 / 5212.87Source ↗official
Enkrypt AI Safety Leaderboardbias_attack_non_success_rate#16 / 24151.68Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#3 / 24198.17Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#24 / 24197.5Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#6 / 23999.95Source ↗official
FinEval Financial Security Knowledgefinancial_security_accuracy_pct#4 / 1978.1Source ↗official
FORTRESSaverage_risk_score#4 / 4912.96Source ↗official
FORTRESSover_refusal_score#48 / 4821.07Source ↗official
HalluVerse-M3 Hallucination Recognitionhallucination_recognition_accuracy#3 / 1476.97Source ↗official
HELM Safetyanthropic_red_team#7 / 800.998Source ↗official
HELM Safetybbq#28 / 800.949Source ↗official
HELM Safetyharmbench#5 / 800.981Source ↗official
HELM Safetysimple_safety_tests#1 / 801Source ↗official
HELM Safetyxstest#43 / 800.956Source ↗official
Humanity's Last Exam RMS calibration error (Scale Labs)calibrationError#35 / 3984Source ↗official
Large-scale Moral Machine experiment on LLMshuman_choice_distance#15 / 390.9208Source ↗official
MASKlying_probability_pct#22 / 5330.54Source ↗official
OR-Benchover_refusal_rate#11 / 2543.8Source ↗official
OR-Benchtoxic_acceptance_rate#12 / 253.4Source ↗official
PandaBench JBB direct-request panelsafety_rate#14 / 460.99Source ↗official
PHAREhallucination_resistance_diagnostic#5 / 700.8671Source ↗official
PHAREharm_resistance_diagnostic#24 / 700.954Source ↗official
Reward Hacking Benchmarkintegrity_score#3 / 1399.4Source ↗official
SafeArenanormalized_safety_score#1 / 555Source ↗official
SORRY-Benchavg#12 / 510.14Source ↗official
SpeciesismBenchexplicit_speciesism_scale#4 / 72.467Source ↗official
SpeciesismBenchmorally_wrong_rate#8 / 829.74Source ↗official
SpeciesismBenchspeciesism_recognition_rate#6 / 884.28Source ↗official
SpeciEvalbelief_animal_sentience#60 / 1136.78Source ↗official
SpeciEvalland_animal_4ns#100 / 1134.97Source ↗official
SpeciEvalsea_animal_4ns#88 / 1135Source ↗official
SpeciEvalspeciesism#43 / 1131.85Source ↗official

Values evaluations

Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.

ValueCompass

DimensionValueDistribution
Universalism75.9
Self-direction59.2
Care / Harm69
Fairness / Cheating69.5
Ethical90.6

Taiwan Sovereignty Benchmark Pro

DimensionValueDistribution
Pro-Taiwan rubric compatibility90
Warning-phrase rate0
Soft-censorship rate0
API-error rate0