Developer
Alibaba
108 indexed models; 57 currently meet the evidence threshold for the overall ranking. Together they have results from 99 evaluations.
Company governance evidence
Alibaba is represented at -1.00 SD relative to the matched Future of Life Institute edition. Provenance: Direct. This company-level evidence contributes 10% of overall model rank.
Models by Alibaba
Evaluations covering Alibaba models (99)
AA-Omniscience · AbstentionBench · Adversarial Humanities Benchmark (AHB) — Table 5 · Adversarial Poetry — AILuminate Baseline and Poetry ASR · Agent-SafetyBench · AgentDrive Safety Compliance · AILuminate General Purpose AI Chat · AIRBench 2024 Safety Scenarios · Alignment Leaderboard · Anthropic Agentic Misalignment — blackmail · Anthropic Agentic Misalignment — corporate espionage · Arena Factuality — Text Arena (factuality-only weighting) · AuAu Authoritarian Response Audit · BioTIER · BrokenMath · BullshitBench v2 · CAIS Risk Index · CASE-Bench · ChineseSafe · ChiSafetyBench · Cisco AI Defense Rolling Single-Turn Leaderboard · CMoralEval · COMPL-AI AI-Identity Disclosure · COMPL-AI LLM RuLES Multi-Turn Rule Following · COMPL-AI TensorTrust Goal-Hijacking Resistance · Concordia AI Risk Monitor · Confabulations · Contextual MoralChoice · CRiskEval · CValues · DelusionEval · DSPSafeBench · DystopiaBench · Emergent Collusion · Enkrypt AI Safety Leaderboard · Every Model Cheats — Cybench Cheat Propensity · Fake Alignment (FINE) · FinEval 6.0 Safety Awareness · FinEval Financial Security Knowledge · FlagEval Safety and Values · FLAMES · FORTRESS · Governance Decay under Passive Context Compaction · HalluVerse-M3 Hallucination Recognition · HarmBench · HarmVideoBench · HELM Safety · HUMAINE Trust, Ethics and Safety · Human Pathogen Capabilities Test (HPCT) — overall refusal · HyperCLOVA X Toxic Continuation Panels · IndoBias-Pairs — parity-aware culturally grounded bias · Inkling-Small model card — FORTRESS · Inkling-Small model card — StrongREJECT · JailBench · JuICE Cultural-Error Span Detection · KIDBench Implicit Child Cue · LiveSecBench · M3-SafetyBench · Manager Coercion Bench · MASK · MT-JailBench CrescendoX · MuPPET Contextual Privacy · NESSiE Necessary Safety Benchmark · ODCV-Bench · Open LLM Safety Index · Opposite-Narrator Sycophancy · OR-Bench · PacifAIst · PandaBench JBB direct-request panel · PHARE · Pokee-Isaac model card — DTAP · PropensityBench · Qwen2 Safety Panel · RefusalBench · S-Eval · SABER · SafeArena · SafeDialBench · SafetyBench · SALAD-Bench · Shell · SM-Bench · Social Welfare Function Benchmark · SORRY-Bench · SOSBench · SpeciesismBench · SpeciEval · StereoTales Harmful Associations · SuperCLUE Safety · SYCON Bench · TAC · ThaiSafetyBench · The Dictatorship Eval · ToolPrivacyBench · TrustLLM contemporary collapsed application · UAVBench safety-critical decision recognition · Vectara HHEM Factual Consistency · VETO Misfired Alignment · WildClawBench Safety & Alignment (OpenClaw harness)