Find safety evidence by model

Select models to see which evaluations cover them, where evidence overlaps, and how each model ranks within the covered evaluation. Each cell is rank/number evaluated, not an overall score.

Choose up to 8 models

Browse without JavaScript

AA-Omniscience · AbstentionBench · Adversarial Robustness · Agent-SafetyBench · AgentAbstain · AgentDojo · AgentDrive Safety Compliance · AgentHarm · AILuminate General Purpose AI Chat · AIMS Safety-Classifier Competence · AIRBench 2024 Safety Scenarios · Alignment Leaderboard · ANIMA · AnimalHarmBench · Anthropic Agentic Misalignment — blackmail · Anthropic Agentic Misalignment — corporate espionage · Anthropic Agentic Misalignment — lethal action · Anthropic Claude 4 System Card · Anthropic Claude Haiku 4.5 System Card · Anthropic Claude Opus 4.1 System Card Addendum · Anthropic Claude Opus 4.5 System Card · Anthropic Claude Sonnet 4.5 System Card · Arena Factuality — Search Arena (factuality-only weighting) · Arena Factuality — Text Arena (factuality-only weighting) · AuAu Authoritarian Response Audit · AutoElicit Transferability · BioSecBench-Refusal · BlueBench AttaQ-100 · BrokenMath · BullshitBench v2 · CAIS Risk Index · CASE-Bench · Chinese Bias Benchmark for Question Answering · ChineseSafe · ChiSafetyBench · Cisco AI Defense Rolling Single-Turn Leaderboard · Claude 2 model-card safety and alignment evaluations · Claude 3 model-card adversarial human-preference evaluations · Claude 3.5 Sonnet model-card safety and alignment evaluations · Claude Sonnet 4.6 Overrefusal · Claude Sonnet 4.6 User Wellbeing · CMoralEval · COMPL-AI AI-Identity Disclosure · COMPL-AI LLM RuLES Multi-Turn Rule Following · COMPL-AI TensorTrust Goal-Hijacking Resistance · Confabulations · Constitutional Following — Anthropic Constitution · Constitutional Following — OpenAI Model Spec · Contextual MoralChoice · CRiskEval · CValues · DecodingTrust · DelusionEval · Do-Not-Answer · DSPSafeBench · DystopiaBench · Emergent Collusion · Enkrypt AI Safety Leaderboard · Fake Alignment (FINE) · FinEval 6.0 Safety Awareness · FinEval Financial Security Knowledge · FlagEval Safety and Values · FLAMES · FORTRESS · Google Gemini 2.5 Flash Model Card · Google Gemini 2.5 Flash-Lite Model Card · Governance Decay under Passive Context Compaction · GPT-5.6 system card · Gray Swan indirect prompt injection (15 attempts) · HalluVerse-M3 Hallucination Recognition · HarmBench · HarmVideoBench · HELM Classic RealToxicityPrompts · HELM Safety · HUMAINE Trust, Ethics and Safety · Humanity's Last Exam RMS calibration error (Scale Labs) · HyperCLOVA X Toxic Continuation Panels · IndoBias-Pairs — parity-aware culturally grounded bias · Inkling-Small model card — FORTRESS · Inkling-Small model card — StrongREJECT · JailBench · JuICE Cultural-Error Span Detection · KIDBench Implicit Child Cue · kindbench v0.1.0 psychological safety ranking · Large-scale Moral Machine experiment on LLMs · LiveSecBench · LLM Ethics Benchmark · M3-SafetyBench · MACHIAVELLI · Manager Coercion Bench · MANTA · MASK · MASK (Scale Labs leaderboard) · Microsoft Phi Safety Panels · MonitoringBench Full-Trajectory Monitor · MORU · MT-JailBench CrescendoX · MuPPET Contextual Privacy · ODCV-Bench · Olam Social Poker — Social Lie Rate · Open LLM Safety Index · OpenAgentSafety · OpenAI GPT-4o System Card · OpenAI GPT-5 System Card · OpenAI GPT-5.3 Dynamic Wellbeing · OpenAI GPT-5.4 Dynamic Wellbeing · OpenAI GPT-5.4 First-Person Fairness · OpenAI GPT-5.4 Property Preservation · OpenAI GPT-5.4 User Confirmations · OpenAI o3 and o4-mini System Card · OpenAI o3-mini System Card · Opposite-Narrator Sycophancy · OR-Bench · PacifAIst · PandaBench JBB direct-request panel · Pander Score · PHARE · Pokee-Isaac model card — DTAP · PropensityBench · Qwen2 Safety Panel · RealityTest — Text AI-Identity Disclosure · RefusalBench · Reward Hacking Benchmark · S-Eval · SABER · SafeArena · SafeDialBench · SafetyBench · SafetyPrompts · SALAD-Bench · Shell · Situational Awareness Dataset (SAD) · SM-Bench · Social Welfare Function Benchmark · SORRY-Bench · SOSBench · SpeciesismBench · SpeciEval · StereoTales Harmful Associations · SuperCLUE Safety · SYCON Bench · TAC · ThaiSafetyBench · ToolPrivacyBench · TrustLLM contemporary collapsed application · TrustLLM paper leaderboard dimensions · TukaBench · UAVBench safety-critical decision recognition · UK AISI active safety-research compromise continuation · UK AISI cyber-evaluation cheating and prompted self-report · Vectara HHEM Factual Consistency · VETO Misfired Alignment · Vigil Mental Health Safety · WildClawBench Safety & Alignment (OpenClaw harness) · XSTest

Choose models to build the matrix.

Values evaluations

Descriptive values evaluations are published separately and receive no safety/ethics component or overall-ranking weight.

UGI Political Values · ValueCompass · Agent-ValueBench MFT08 · Agent-ValueBench HEXACO · Agent-ValueBench PVQ40 · CCPBench · Taiwan Sovereignty Benchmark Pro · Explore model values