← Models

Model profile

GPT 4O

OpenAIdeveloper
2024-05-13release date
#144 / 309overall rank
67eval lineages

Evidence summary

GPT 4O has an estimated overall rank of #144; its 90% source-sensitivity interval is #99–#189. Its behavior-only rank is #155; company governance moves the combined estimate to #144. Published evidence spans 67 evals and 7 of 7 behavior components. Its strongest relative result is OR-Bench (over_refusal_rate, #1 of 25); its weakest is Adversarial Robustness (score, #8 of 8).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Published eval results

Rank is within that sub-eval. Black marks the observed result; the grey dot marks the value implied by the global rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
AA-Omnisciencehallucination_rate#36 / 3280.3792Source ↗official
AbstentionBenchanswer_unknown_f1#4 / 200.9017Source ↗official
AbstentionBenchfalse_premise_f1#2 / 200.7607Source ↗official
AbstentionBenchstale_f1#5 / 200.6765Source ↗official
AbstentionBenchsubjective_f1#7 / 200.7572Source ↗official
AbstentionBenchunderspecified_context_f1#2 / 200.7169Source ↗official
AbstentionBenchunderspecified_intent_f1#1 / 200.8152Source ↗official
Adversarial Robustnessscore#8 / 867Source ↗official
Agent-SafetyBenchcompromise_availability#5 / 1635.2Source ↗official
Agent-SafetyBenchharmful_vulnerable_code#8 / 1635.6Source ↗official
Agent-SafetyBenchleak_sensitive_information#4 / 1644.4Source ↗official
Agent-SafetyBenchphysical_harm#3 / 1653.2Source ↗official
Agent-SafetyBenchproduce_unsafe_information#7 / 1695.6Source ↗official
Agent-SafetyBenchproperty_loss#3 / 1648.4Source ↗official
Agent-SafetyBenchspread_unsafe_information#7 / 1612.4Source ↗official
Agent-SafetyBenchviolate_law_ethics#7 / 1628.8Source ↗official
AgentAbstainabstain#15 / 1744.2Source ↗official
AgentAbstaincar#17 / 1740.9Source ↗official
AgentAbstainpaired#17 / 1733Source ↗official
AgentDojotargeted_attack_success_rate#15 / 150.4769Source ↗official
AgentDojoutility_under_attack#4 / 150.5008Source ↗official
AgentDrive Safety Compliancescr#16 / 4890Source ↗official
AgentHarmharm_score#8 / 1248.4Source ↗official
AILuminate General Purpose AI Chatchild_sexual_exploitation#9 / 3212Source ↗official
AILuminate General Purpose AI Chatdefamation#16 / 3215.86Source ↗official
AILuminate General Purpose AI Chathate#17 / 329Source ↗official
AILuminate General Purpose AI Chatindiscriminate_weapons_cbrne#12 / 3219.2Source ↗official
AILuminate General Purpose AI Chatintellectual_property#15 / 3210.5Source ↗official
AILuminate General Purpose AI Chatnon_violent_crimes#14 / 3215.6Source ↗official
AILuminate General Purpose AI Chatprivacy#12 / 3210.2Source ↗official
AILuminate General Purpose AI Chatsex_related_crimes#16 / 3214.3Source ↗official
AILuminate General Purpose AI Chatsexual_content#21 / 3233.6Source ↗official
AILuminate General Purpose AI Chatspecialized_advice#18 / 3217.62Source ↗official
AILuminate General Purpose AI Chatsuicide_self_harm#15 / 3212.1Source ↗official
AILuminate General Purpose AI Chatviolent_crimes#12 / 3214.9Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#55 / 800.5755Source ↗official
Alignment Leaderboardcorrigibility#12 / 244.243Source ↗official
Alignment Leaderboardhonesty#13 / 243.604Source ↗official
Alignment Leaderboardnon_manipulation#15 / 243.276Source ↗official
Alignment Leaderboardrobustness#2 / 244.56Source ↗official
Alignment Leaderboardsafety#14 / 243.808Source ↗official
Alignment Leaderboardscheming#15 / 243.584Source ↗official
AnimalHarmBenchscore#8 / 100.011Source ↗official
Anthropic Agentic Misalignment — blackmailmisaligned_action_rate_pct#4 / 1615Source ↗official
Anthropic Agentic Misalignment — corporate espionagemisaligned_action_rate_pct#2 / 166Source ↗official
Arena Factuality — Text Arena (factuality-only weighting)factuality_bt_rating#26 / 1121453.0Source ↗official
BlueBench AttaQ-100attaq_harmlessness_reward_pct#4 / 1887.84Source ↗official
BullshitBench v2clear_pushback_rate#82 / 1060.12Source ↗official
CAIS Risk Indexagent_red_teaming#35 / 4490.7Source ↗official
CAIS Risk Indexbioweapons_assistance#41 / 4992.7Source ↗official
CAIS Risk Indexhle_overconfidence#50 / 5089Source ↗official
CAIS Risk Indexmachiavelli#43 / 4699.6Source ↗official
CAIS Risk Indexmask#52 / 5278Source ↗official
CAIS Risk Indexpolitical_manipulation#30 / 3359.6Source ↗official
CAIS Risk Indextextquests_harm#5 / 4911.2Source ↗official
CASE-Benchagreement_accuracy#7 / 778.56Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#59 / 10442.02Source ↗official
Confabulationsconfabulation_rate#26 / 5224.26Source ↗official
Constitutional Following — OpenAI Model Specconstitutional_following_score#7 / 788.3Source ↗official
CRiskEvaldeception_willingness#1 / 1710.6Source ↗official
CRiskEvaldesire_for_resource#1 / 1719.04Source ↗official
CRiskEvalharmful_goal#2 / 1727.23Source ↗official
CRiskEvalimprovement_intent#3 / 1743.32Source ↗official
CRiskEvalmalicious_coordination#4 / 176.71Source ↗official
CRiskEvalself_preservation#2 / 1725.92Source ↗official
CRiskEvalsituational_awareness#2 / 1738.75Source ↗official
Enkrypt AI Safety Leaderboardbias_attack_non_success_rate#80 / 24120.67Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#29 / 24193.83Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#125 / 24167.78Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#53 / 23998.41Source ↗official
FinEval 6.0 Safety Awarenesssafety_awareness_score#5 / 879.84Source ↗official
FinEval Financial Security Knowledgefinancial_security_accuracy_pct#1 / 1981.8Source ↗official
FORTRESSaverage_risk_score#33 / 4947.18Source ↗official
FORTRESSover_refusal_score#9 / 461.68Source ↗official
HalluVerse-M3 Hallucination Recognitionhallucination_recognition_accuracy#1 / 1480.3Source ↗official
HELM Safetyanthropic_red_team#32 / 800.991Source ↗official
HELM Safetybbq#26 / 800.951Source ↗official
HELM Safetyharmbench#33 / 800.829Source ↗official
HELM Safetysimple_safety_tests#43 / 800.985Source ↗official
HELM Safetyxstest#19 / 800.973Source ↗official
HUMAINE Trust, Ethics and Safetytrust_ethics_safety_score#53 / 5422.28Source ↗official
Large-scale Moral Machine experiment on LLMshuman_choice_distance#17 / 390.9418Source ↗official
LLM Ethics Benchmarkscore#2 / 590Source ↗official
MACHIAVELLIdeception_relative_random_pct#44 / 5099.6Source ↗official
Manager Coercion Benchcoercion_ladder_depth#12 / 317.967Source ↗self run
MASKlying_probability_pct#29 / 5342.22Source ↗official
MonitoringBench Full-Trajectory Monitorfull_trajectory_catch_rate_at_1pct_fpr_percent#8 / 139.3Source ↗official
MT-JailBench CrescendoXsafety_score#15 / 2115.72Source ↗official
OpenAgentSafetyllm_judge_safety_vulnerable#6 / 765.8Source ↗official
OpenAgentSafetyrule_based_safety_vulnerable#3 / 732.64Source ↗official
OpenAgentSafetysuccessful_completion#5 / 721.77Source ↗official
OpenAI GPT-4o System Cardspeaker_privacy_refusal_accuracy#1 / 20.98Source ↗official
OpenAI GPT-5 System Cardharmful_request_safety#2 / 20.633Source ↗official
OpenAI o3-mini System Cardharmful_request_safety#2 / 20.86Source ↗official
OpenAI o3-mini System Cardjailbreak_resistance#2 / 20.51Source ↗official
OR-Benchover_refusal_rate#1 / 256.8Source ↗official
OR-Benchtoxic_acceptance_rate#19 / 2515.1Source ↗official
PandaBench JBB direct-request panelsafety_rate#13 / 460.995Source ↗official
PHAREbias_resistance_diagnostic#24 / 660.5092Source ↗official
PHAREhallucination_resistance_diagnostic#24 / 700.7852Source ↗official
PHAREharm_resistance_diagnostic#38 / 700.9266Source ↗official
PHAREjailbreak_resistance_diagnostic#25 / 670.6048Source ↗official
PropensityBenchscore#7 / 1446.1Source ↗official
RealityTest — Text AI-Identity Disclosuredisclosure_probability#15 / 170.126Source ↗official
Reward Hacking Benchmarkintegrity_score#6 / 1399.1Source ↗official
S-Evalbase_en_overall#16 / 2252Source ↗official
SafeArenanormalized_safety_score#4 / 531.7Source ↗official
SafeDialBenchaggression#4 / 187.207Source ↗official
SafeDialBenchethics#12 / 187.487Source ↗official
SafeDialBenchfairness#2 / 187.68Source ↗official
SafeDialBenchlegality#15 / 187.21Source ↗official
SafeDialBenchmorality#10 / 187.237Source ↗official
SafeDialBenchprivacy#14 / 187.14Source ↗official
Shelleducation_jsr#12 / 140.804Source ↗official
Shellfinance_jsr#12 / 140.826Source ↗official
Shellmanagement_jsr#12 / 140.872Source ↗official
SM-Benchadversarial#65 / 7977.07Source ↗official
SM-Benchambiguous_interpretation#78 / 7958.93Source ↗official
SM-Benchanti_hallucination#59 / 7986.39Source ↗official
SM-Bencheq_boundaries#73 / 7951.12Source ↗official
SM-Benchoverfit#20 / 7983.06Source ↗official
Social Welfare Function Benchmarkfairness#9 / 190.491Source ↗official
SORRY-Benchavg#27 / 510.3Source ↗official
SOSBenchbiology_pvr#8 / 230.306Source ↗official
SOSBenchchemistry_pvr#8 / 230.254Source ↗official
SOSBenchmedicine_pvr#9 / 230.476Source ↗official
SOSBenchpharmacology_pvr#9 / 230.676Source ↗official
SOSBenchphysics_pvr#6 / 230.194Source ↗official
SOSBenchpsychology_pvr#10 / 230.396Source ↗official
SpeciesismBenchexplicit_speciesism_scale#3 / 72.383Source ↗official
SpeciesismBenchmorally_wrong_rate#6 / 835.96Source ↗official
SpeciesismBenchspeciesism_recognition_rate#1 / 898.37Source ↗official
StereoTales Harmful Associationsbenign_significant_association_score#18 / 2385.02Source ↗official
SYCON Benchfalse_presupposition_tof#3 / 112.92Source ↗official
SYCON Benchunethical_queries_tof#8 / 111.23Source ↗official
ThaiSafetyBenchsafety_score#9 / 1883.96Source ↗official
TukaBenchafri_jbb_cultural_asr#5 / 627.5Source ↗official
TukaBenchafri_jbb_harm_asr#3 / 613.5Source ↗official
TukaBenchafrijail_mono_asr#5 / 625.7Source ↗official
UAVBench safety-critical decision recognitionethical_safety_critical_accuracy#8 / 270.73Source ↗official
Vectara HHEM Factual Consistencyfactual_consistency_rate#48 / 9490.4Source ↗official
Vigil Mental Health Safetyoverall_score#21 / 2327Source ↗official

Values evaluations

Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.

UGI Political Values

DimensionValueDistribution
Political Lean-24.2
Government48
Diplomacy67.8
Economy46.7
Society61.5

ValueCompass

DimensionValueDistribution
Universalism67.9
Self-direction51.1
Care / Harm37.1
Fairness / Cheating35.5
Ethical90.8

Taiwan Sovereignty Benchmark Pro

DimensionValueDistribution
Pro-Taiwan rubric compatibility90
Warning-phrase rate0
Soft-censorship rate0
API-error rate0

CCP-aligned censorship behavior

DimensionValueDistribution
Political-question refusal rate (ZH/EN mean)0.0655
Completely inaccurate rate7.82

The Economist World Values Survey Cultural Map

DimensionValueDistribution
Survival ↔ Self-expression1.23
Traditional ↔ Secular2.1