← Models

Model profile

GPT 4o

OpenAIdeveloper
2024-05-13release date
#162 / 333Safety rank
#219 / 645Freedom rank

Evidence summary

Safety. GPT 4o has an estimated Safety rank of #162; its 90% source-sensitivity interval is #113–#203. Its behavior-only rank is #169; company governance moves the combined estimate to #162. Published Safety evidence spans 73 eval lineages and 7 of 7 components. Its strongest relative result is Concordia — Shutdown-Resistance (safety_score, #1 of 53); its weakest is Adversarial Robustness (score, #8 of 8).

Freedom. GPT 4o has an estimated Freedom rank of #219; its 90% source-sensitivity interval is #157–#329. Published Freedom evidence spans 35 eval lineages and 1 of 1 components. Its strongest relative result is Human Pathogen Capabilities Test (HPCT) — overall refusal (refusal_rate_pct, #1 of 69); its weakest is OpenAI GPT-4o System Card (speaker_privacy_refusal_accuracy, #2 of 2).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Safety evals

Rank and direction are specific to the Safety portfolio. Black marks the observed result; the grey dot marks the value implied by the Safety rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
AA-Omnisciencehallucination_rate#50 / 3450.3792Source ↗official
AbstentionBenchanswer_unknown_f1#4 / 200.9017Source ↗official
AbstentionBenchfalse_premise_f1#2 / 200.7607Source ↗official
AbstentionBenchstale_f1#5 / 200.6765Source ↗official
AbstentionBenchsubjective_f1#7 / 200.7572Source ↗official
AbstentionBenchunderspecified_context_f1#2 / 200.7169Source ↗official
AbstentionBenchunderspecified_intent_f1#1 / 200.8152Source ↗official
Adversarial Robustnessscore#8 / 867Source ↗official
Agent-SafetyBenchcompromise_availability#5 / 1635.2Source ↗official
Agent-SafetyBenchharmful_vulnerable_code#8 / 1635.6Source ↗official
Agent-SafetyBenchleak_sensitive_information#4 / 1644.4Source ↗official
Agent-SafetyBenchphysical_harm#3 / 1653.2Source ↗official
Agent-SafetyBenchproduce_unsafe_information#7 / 1695.6Source ↗official
Agent-SafetyBenchproperty_loss#3 / 1648.4Source ↗official
Agent-SafetyBenchspread_unsafe_information#7 / 1612.4Source ↗official
Agent-SafetyBenchviolate_law_ethics#7 / 1628.8Source ↗official
AgentAbstainabstain#15 / 1744.2Source ↗official
AgentAbstaincar#17 / 1740.9Source ↗official
AgentAbstainpaired#17 / 1733Source ↗official
AgentDojotargeted_attack_success_rate#15 / 150.4769Source ↗official
AgentDojoutility_under_attack#4 / 150.5008Source ↗official
AgentDrive Safety Compliancescr#16 / 4890Source ↗official
AgentHarmharm_score#8 / 1248.4Source ↗official
AILuminate General Purpose AI Chatchild_sexual_exploitation#9 / 3212Source ↗official
AILuminate General Purpose AI Chatdefamation#16 / 3215.86Source ↗official
AILuminate General Purpose AI Chathate#17 / 329Source ↗official
AILuminate General Purpose AI Chatindiscriminate_weapons_cbrne#12 / 3219.2Source ↗official
AILuminate General Purpose AI Chatintellectual_property#15 / 3210.5Source ↗official
AILuminate General Purpose AI Chatnon_violent_crimes#14 / 3215.6Source ↗official
AILuminate General Purpose AI Chatprivacy#12 / 3210.2Source ↗official
AILuminate General Purpose AI Chatsex_related_crimes#16 / 3214.3Source ↗official
AILuminate General Purpose AI Chatsexual_content#21 / 3233.6Source ↗official
AILuminate General Purpose AI Chatspecialized_advice#18 / 3217.62Source ↗official
AILuminate General Purpose AI Chatsuicide_self_harm#15 / 3212.1Source ↗official
AILuminate General Purpose AI Chatviolent_crimes#12 / 3214.9Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#55 / 800.5755Source ↗official
Alignment Leaderboardcorrigibility#12 / 244.243Source ↗official
Alignment Leaderboardhonesty#13 / 243.604Source ↗official
Alignment Leaderboardnon_manipulation#15 / 243.276Source ↗official
Alignment Leaderboardrobustness#2 / 244.56Source ↗official
Alignment Leaderboardsafety#14 / 243.808Source ↗official
Alignment Leaderboardscheming#15 / 243.584Source ↗official
AnimalHarmBenchscore#8 / 100.011Source ↗official
Anthropic Agentic Misalignment — blackmailmisaligned_action_rate_pct#4 / 1615Source ↗official
Anthropic Agentic Misalignment — corporate espionagemisaligned_action_rate_pct#2 / 166Source ↗official
Arena Factuality — Text Arena (factuality-only weighting)factuality_bt_rating#26 / 1111453.0Source ↗official
BioTIERpermit_compliance_pct#8 / 5299.6Source ↗official
BioTIERrefuse_compliance_pct#36 / 5222.2Source ↗official
BlueBench AttaQ-100attaq_harmlessness_reward_pct#4 / 1887.84Source ↗official
BullshitBench v2clear_pushback_rate#93 / 1170.12Source ↗official
CAIS Risk Indexagent_red_teaming#40 / 4990.7Source ↗official
CAIS Risk Indexbioweapons_assistance#46 / 5492.7Source ↗official
CAIS Risk Indexhle_overconfidence#55 / 5589Source ↗official
CAIS Risk Indexmachiavelli#48 / 5199.6Source ↗official
CAIS Risk Indexmask#57 / 5778Source ↗official
CAIS Risk Indexpolitical_manipulation#43 / 4859.6Source ↗official
CAIS Risk Indextextquests_harm#5 / 5411.2Source ↗official
CASE-Benchagreement_accuracy#7 / 778.56Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#59 / 10442.02Source ↗official
Concordia — Agentic-Misalignmentsafety_score#49 / 5451.5Source ↗official
Concordia — AirBench-Deceptionsafety_score#53 / 6362.96Source ↗official
Concordia — AirBench-Manipulationsafety_score#53 / 5658.67Source ↗official
Concordia — AirBench-SecurityRiskssafety_score#52 / 6378.6Source ↗official
Concordia — APEsafety_score#35 / 5514.56Source ↗official
Concordia — CyberSecEval2-PromptInjectionsafety_score#36 / 6382.87Source ↗official
Concordia — DarkBenchsafety_score#19 / 5560Source ↗official
Concordia — Fortress-Biologicalsafety_score#34 / 5442.26Source ↗official
Concordia — Fortress-Chemicalsafety_score#37 / 5438.22Source ↗official
Concordia — Fortress-Privacy/Scamssafety_score#41 / 5444.71Source ↗official
Concordia — FRT-AirBench-Manipulationsafety_score#40 / 4516.22Source ↗official
Concordia — FRT-AirBench-SecurityRiskssafety_score#41 / 459.667Source ↗official
Concordia — FRT-SciKnowEval-BiologicalHarmfulQAsafety_score#40 / 450.6667Source ↗official
Concordia — FRT-SOSBench-Chemsafety_score#42 / 4524.67Source ↗official
Concordia — MASKsafety_score#47 / 6249.36Source ↗official
Concordia — SciKnowEval-BiologicalHarmfulQAsafety_score#45 / 6370.37Source ↗official
Concordia — SciKnowEval-ChemicalHarmfulQAsafety_score#62 / 630.8811Source ↗official
Concordia — Shutdown-Resistancesafety_score#1 / 53100Source ↗official
Concordia — SOSBench-Biosafety_score#56 / 6324.2Source ↗official
Concordia — SOSBench-Chemsafety_score#56 / 6348.4Source ↗official
Confabulationsconfabulation_rate#26 / 5224.26Source ↗official
Constitutional Following — OpenAI Model Specconstitutional_following_score#7 / 788.3Source ↗official
CRiskEvaldeception_willingness#1 / 1710.6Source ↗official
CRiskEvaldesire_for_resource#1 / 1719.04Source ↗official
CRiskEvalharmful_goal#2 / 1727.23Source ↗official
CRiskEvalimprovement_intent#3 / 1743.32Source ↗official
CRiskEvalmalicious_coordination#4 / 176.71Source ↗official
CRiskEvalself_preservation#2 / 1725.92Source ↗official
CRiskEvalsituational_awareness#2 / 1738.75Source ↗official
DelusionEvaldelusional_prevalence_pct#12 / 1650.3Source ↗official
DelusionEvaldiscourages_harm_prevalence_pct#10 / 1621.9Source ↗official
DelusionEvalfacilitates_harm_prevalence_pct#13 / 166.7Source ↗official
DelusionEvalrelationship_prevalence_pct#11 / 1636Source ↗official
DelusionEvalsycophancy_prevalence_pct#14 / 1635.5Source ↗official
Enkrypt AI Safety Leaderboardbias_attack_non_success_rate#84 / 24820.67Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#29 / 24893.83Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#134 / 24867.78Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#53 / 24698.41Source ↗official
FinEval 6.0 Safety Awarenesssafety_awareness_score#5 / 879.84Source ↗official
FinEval Financial Security Knowledgefinancial_security_accuracy_pct#1 / 1981.8Source ↗official
FORTRESSaverage_risk_score#34 / 5047.18Source ↗official
FORTRESSover_refusal_score#9 / 491.68Source ↗official
HalluVerse-M3 Hallucination Recognitionhallucination_recognition_accuracy#1 / 1480.3Source ↗official
HELM Safetyanthropic_red_team#32 / 800.991Source ↗official
HELM Safetybbq#26 / 800.951Source ↗official
HELM Safetyharmbench#33 / 800.829Source ↗official
HELM Safetysimple_safety_tests#43 / 800.985Source ↗official
HELM Safetyxstest#19 / 800.973Source ↗official
HUMAINE Trust, Ethics and Safetytrust_ethics_safety_score#53 / 5422.28Source ↗official
Human Pathogen Capabilities Test (HPCT) — overall refusalrefusal_rate_pct#27 / 690Source ↗official
Humanity's Last Exam RMS calibration error (Scale Labs)calibrationError#41 / 4289Source ↗official
Large-scale Moral Machine experiment on LLMshuman_choice_distance#17 / 390.9418Source ↗official
LLM Ethics Benchmarkscore#2 / 590Source ↗official
MACHIAVELLIdeception_relative_random_pct#44 / 5099.6Source ↗official
Manager Coercion Benchcoercion_ladder_depth#15 / 377.967Source ↗self run
MASKlying_probability_pct#29 / 5342.22Source ↗official
MedSafetyBenchmedical_safety_score#6 / 3096.5Source ↗official
MonitoringBench Full-Trajectory Monitorfull_trajectory_catch_rate_at_1pct_fpr_percent#8 / 139.3Source ↗official
MT-JailBench CrescendoXsafety_score#15 / 2115.72Source ↗official
OpenAgentSafetyllm_judge_safety_vulnerable#6 / 765.8Source ↗official
OpenAgentSafetyrule_based_safety_vulnerable#3 / 732.64Source ↗official
OpenAgentSafetysuccessful_completion#5 / 721.77Source ↗official
OpenAI GPT-4o System Cardspeaker_privacy_refusal_accuracy#1 / 20.98Source ↗official
OpenAI GPT-5 System Cardharmful_request_safety#2 / 20.633Source ↗official
OpenAI o3-mini System Cardharmful_request_safety#2 / 20.86Source ↗official
OpenAI o3-mini System Cardjailbreak_resistance#2 / 20.51Source ↗official
OR-Benchover_refusal_rate#1 / 256.8Source ↗official
OR-Benchtoxic_acceptance_rate#19 / 2515.1Source ↗official
PandaBench JBB direct-request panelsafety_rate#13 / 460.995Source ↗official
PHAREbias_resistance_diagnostic#24 / 660.5092Source ↗official
PHAREhallucination_resistance_diagnostic#24 / 700.7852Source ↗official
PHAREharm_resistance_diagnostic#38 / 700.9266Source ↗official
PHAREjailbreak_resistance_diagnostic#25 / 670.6048Source ↗official
PropensityBenchscore#7 / 1446.1Source ↗official
RealityTest — Text AI-Identity Disclosuredisclosure_probability#15 / 170.126Source ↗official
Reward Hacking Benchmarkintegrity_score#6 / 1399.1Source ↗official
S-Evalbase_en_overall#16 / 2252Source ↗official
SafeArenanormalized_safety_score#4 / 531.7Source ↗official
SafeDialBenchaggression#4 / 187.207Source ↗official
SafeDialBenchethics#12 / 187.487Source ↗official
SafeDialBenchfairness#2 / 187.68Source ↗official
SafeDialBenchlegality#15 / 187.21Source ↗official
SafeDialBenchmorality#10 / 187.237Source ↗official
SafeDialBenchprivacy#14 / 187.14Source ↗official
Shelleducation_jsr#12 / 140.804Source ↗official
Shellfinance_jsr#12 / 140.826Source ↗official
Shellmanagement_jsr#12 / 140.872Source ↗official
SimpleQA Verifiedf1_score#5 / 1334.9Source ↗official
SM-Benchadversarial#70 / 8477.07Source ↗official
SM-Benchambiguous_interpretation#83 / 8458.93Source ↗official
SM-Benchanti_hallucination#64 / 8486.39Source ↗official
SM-Bencheq_boundaries#78 / 8451.12Source ↗official
SM-Benchoverfit#25 / 8483.06Source ↗official
Social Welfare Function Benchmarkfairness#9 / 190.491Source ↗official
SORRY-Benchavg#27 / 510.3Source ↗official
SOSBenchbiology_pvr#8 / 230.306Source ↗official
SOSBenchchemistry_pvr#8 / 230.254Source ↗official
SOSBenchmedicine_pvr#9 / 230.476Source ↗official
SOSBenchpharmacology_pvr#9 / 230.676Source ↗official
SOSBenchphysics_pvr#6 / 230.194Source ↗official
SOSBenchpsychology_pvr#10 / 230.396Source ↗official
SpeciesismBenchexplicit_speciesism_scale#3 / 72.383Source ↗official
SpeciesismBenchmorally_wrong_rate#6 / 835.96Source ↗official
SpeciesismBenchspeciesism_recognition_rate#1 / 898.37Source ↗official
StereoTales Harmful Associationsbenign_significant_association_score#18 / 2385.02Source ↗official
SYCON Benchfalse_presupposition_tof#3 / 112.92Source ↗official
SYCON Benchunethical_queries_tof#8 / 111.23Source ↗official
ThaiSafetyBenchsafety_score#9 / 1883.96Source ↗official
TukaBenchafri_jbb_cultural_asr#5 / 627.5Source ↗official
TukaBenchafri_jbb_harm_asr#3 / 613.5Source ↗official
TukaBenchafrijail_mono_asr#5 / 625.7Source ↗official
UAVBench safety-critical decision recognitionethical_safety_critical_accuracy#8 / 270.73Source ↗official
Vectara HHEM Factual Consistencyfactual_consistency_rate#48 / 9490.4Source ↗official
Vigil Mental Health Safetyoverall_score#21 / 2327Source ↗official

Freedom evals

Rank and direction are specific to the Freedom portfolio. Black marks the observed result; the grey dot marks the value implied by the Freedom rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Adversarial Robustnessscore#1 / 867Source ↗official
Agent-SafetyBenchproduce_unsafe_information#10 / 1695.6Source ↗official
AILuminate General Purpose AI Chatchild_sexual_exploitation#24 / 3212Source ↗official
AILuminate General Purpose AI Chatdefamation#17 / 3215.86Source ↗official
AILuminate General Purpose AI Chathate#16 / 329Source ↗official
AILuminate General Purpose AI Chatindiscriminate_weapons_cbrne#21 / 3219.2Source ↗official
AILuminate General Purpose AI Chatintellectual_property#18 / 3210.5Source ↗official
AILuminate General Purpose AI Chatnon_violent_crimes#19 / 3215.6Source ↗official
AILuminate General Purpose AI Chatprivacy#21 / 3210.2Source ↗official
AILuminate General Purpose AI Chatsex_related_crimes#17 / 3214.3Source ↗official
AILuminate General Purpose AI Chatsexual_content#12 / 3233.6Source ↗official
AILuminate General Purpose AI Chatspecialized_advice#15 / 3217.62Source ↗official
AILuminate General Purpose AI Chatsuicide_self_harm#18 / 3212.1Source ↗official
AILuminate General Purpose AI Chatviolent_crimes#21 / 3214.9Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#26 / 800.5755Source ↗official
BioTIERpermit_compliance_pct#8 / 5299.6Source ↗official
BioTIERrefuse_compliance_pct#17 / 5222.2Source ↗official
BlueBench AttaQ-100attaq_harmlessness_reward_pct#15 / 1887.84Source ↗official
CAIS Risk Indexbioweapons_assistance#9 / 5492.7Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#46 / 10442.02Source ↗official
Concordia — AirBench-Deceptionsafety_score#11 / 6362.96Source ↗official
Concordia — AirBench-Manipulationsafety_score#4 / 5658.67Source ↗official
Concordia — AirBench-PoliticalPersuasionsafety_score#5 / 5626.67Source ↗official
Concordia — AirBench-SecurityRiskssafety_score#12 / 6378.6Source ↗official
Concordia — Fortress-Biologicalsafety_score#21 / 5442.26Source ↗official
Concordia — Fortress-Chemicalsafety_score#18 / 5438.22Source ↗official
Concordia — Fortress-Privacy/Scamssafety_score#14 / 5444.71Source ↗official
Concordia — FRT-AirBench-Manipulationsafety_score#6 / 4516.22Source ↗official
Concordia — FRT-AirBench-SecurityRiskssafety_score#4 / 459.667Source ↗official
Concordia — FRT-SciKnowEval-BiologicalHarmfulQAsafety_score#5 / 450.6667Source ↗official
Concordia — FRT-SOSBench-Chemsafety_score#4 / 4524.67Source ↗official
Concordia — SciKnowEval-BiologicalHarmfulQAsafety_score#19 / 6370.37Source ↗official
Concordia — SciKnowEval-ChemicalHarmfulQAsafety_score#2 / 630.8811Source ↗official
Concordia — SOSBench-Biosafety_score#8 / 6324.2Source ↗official
Concordia — SOSBench-Chemsafety_score#8 / 6348.4Source ↗official
DelusionEvaldiscourages_harm_prevalence_pct#7 / 1621.9Source ↗official
DelusionEvalfacilitates_harm_prevalence_pct#4 / 166.7Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#219 / 24893.83Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#114 / 24867.78Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#193 / 24698.41Source ↗official
FORTRESSaverage_risk_score#17 / 5047.18Source ↗official
FORTRESSover_refusal_score#9 / 491.68Source ↗official
HELM Safetyanthropic_red_team#45 / 800.991Source ↗official
HELM Safetyharmbench#48 / 800.829Source ↗official
HELM Safetysimple_safety_tests#34 / 800.985Source ↗official
HELM Safetyxstest#19 / 800.973Source ↗official
Human Pathogen Capabilities Test (HPCT) — overall refusalrefusal_rate_pct#1 / 690Source ↗official
MedSafetyBenchmedical_safety_score#25 / 3096.5Source ↗official
MT-JailBench CrescendoXsafety_score#7 / 2115.72Source ↗official
OpenAI GPT-4o System Cardspeaker_privacy_refusal_accuracy#2 / 20.98Source ↗official
OpenAI GPT-5 System Cardharmful_request_safety#1 / 20.633Source ↗official
OpenAI o3-mini System Cardharmful_request_safety#1 / 20.86Source ↗official
OpenAI o3-mini System Cardjailbreak_resistance#1 / 20.51Source ↗official
OR-Benchover_refusal_rate#1 / 256.8Source ↗official
OR-Benchtoxic_acceptance_rate#7 / 2515.1Source ↗official
PandaBench JBB direct-request panelsafety_rate#34 / 460.995Source ↗official
PHAREharm_resistance_diagnostic#33 / 700.9266Source ↗official
PHAREjailbreak_resistance_diagnostic#43 / 670.6048Source ↗official
S-Evalbase_en_overall#7 / 2252Source ↗official
SafeDialBenchaggression#15 / 187.207Source ↗official
SafeDialBenchethics#7 / 187.487Source ↗official
SafeDialBenchfairness#17 / 187.68Source ↗official
SafeDialBenchlegality#3 / 187.21Source ↗official
SafeDialBenchmorality#9 / 187.237Source ↗official
SafeDialBenchprivacy#5 / 187.14Source ↗official
Shelleducation_jsr#2 / 140.804Source ↗official
Shellfinance_jsr#3 / 140.826Source ↗official
Shellmanagement_jsr#3 / 140.872Source ↗official
SM-Benchadversarial#15 / 8477.07Source ↗official
SM-Bencheq_boundaries#78 / 8451.12Source ↗official
SM-Benchoverfit#25 / 8483.06Source ↗official
SORRY-Benchavg#25 / 510.3Source ↗official
SOSBenchbiology_pvr#16 / 230.306Source ↗official
SOSBenchchemistry_pvr#16 / 230.254Source ↗official
SOSBenchmedicine_pvr#15 / 230.476Source ↗official
SOSBenchpharmacology_pvr#15 / 230.676Source ↗official
SOSBenchphysics_pvr#18 / 230.194Source ↗official
SOSBenchpsychology_pvr#14 / 230.396Source ↗official
SpeechMap model completioncomplete_pct#90 / 18160.1Source ↗official
ThaiSafetyBenchsafety_score#10 / 1883.96Source ↗official
TukaBenchafri_jbb_cultural_asr#2 / 627.5Source ↗official
TukaBenchafri_jbb_harm_asr#4 / 613.5Source ↗official
TukaBenchafrijail_mono_asr#2 / 625.7Source ↗official
UGI Leaderboard — base-model willingnesswillingness_adherence_score#79 / 1561.5Source ↗official
UGI Leaderboard — base-model willingnesswillingness_direct_score#79 / 1563Source ↗official
Vigil Mental Health Safetyoverall_score#3 / 2327Source ↗official

Values evaluations

Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.

UGI Political Values

DimensionValueDistribution
Political Lean-24.2
Government48
Diplomacy67.8
Economy46.7
Society61.5

ValueCompass

DimensionValueDistribution
Universalism67.9
Self-direction51.1
Care / Harm37.1
Fairness / Cheating35.5
Ethical90.8

Taiwan Sovereignty Benchmark Pro

DimensionValueDistribution
Pro-Taiwan rubric compatibility90
Warning-phrase rate0
Soft-censorship rate0
API-error rate0

CCP-aligned censorship behavior

DimensionValueDistribution
Political-question refusal rate (ZH/EN mean)0.0655
Completely inaccurate rate7.82

The Economist World Values Survey Cultural Map

DimensionValueDistribution
Survival ↔ Self-expression1.23
Traditional ↔ Secular2.1