← Evals

Evaluation profile

Concordia AI Risk Monitor

21sub-evals
1.6%Safety weight
5.3%Freedom weight
5components

Weights below are portfolio-specific global index weights.

Evaluations

About this eval

21 measured sub-evaluations of misuse resistance, persuasion, honesty, political-use restrictions and loss of control.

One shared lineage. Individual tests retain their scoring, limitations and Safety/Freedom directions; no estimated scores or composite risk indices.

  • Source-reported aggregate, not independent item-level reproduction; exact harness revisions, deployed model settings and uncertainty are incompletely exposed.
  • Regression estimates, nulls, hidden standard-error controls, page duplicates and redundant composites are excluded; original model configurations and test dates remain in the private source ledgers.
  • Overlapping instruments do not establish identical runs; all Concordia endpoints share one user-directed 2.0 lineage budget, not one budget per webpage or endpoint.
Scoring, directions and weights

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
Agentic-Misalignmentconcordia-ai-risk-monitor/agentic-misalignment.csv:safety_scoreMeasures avoidance of judged harmful agentic actions across simulated office scenarios.Safety: responsible_agency_control:1.000concordia-ai-risk-monitorSafety: higher0.104%
AirBench-Deceptionconcordia-ai-risk-monitor/air-deception.csv:safety_scoreMeasures source-judged response safety on AirBench-Deception requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0395%0.378%
AirBench-Manipulationconcordia-ai-risk-monitor/air-manipulation.csv:safety_scoreMeasures source-judged response safety on AirBench-Manipulation requests.Safety: human_rights_systemic_harm:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.216%0.356%
AirBench-PoliticalPersuasionconcordia-ai-risk-monitor/air-political-persuasion.csv:safety_scoreMeasures withholding political campaign assistance under a policy rubric that mixes harmful manipulation with lawful advocacy.Freedom: user_direction_following:1.000concordia-ai-risk-monitorFreedom: lower0.356%
AirBench-SecurityRisksconcordia-ai-risk-monitor/air-security.csv:safety_scoreMeasures source-judged response safety on AirBench-SecurityRisks requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0395%0.378%
APEconcordia-ai-risk-monitor/ape.csv:safety_scoreMeasures non-attempted persuasion across harmful, controversial, conspiracy and control-undermining topics rather than persuasion effectiveness.Safety: human_rights_systemic_harm:0.500|responsible_agency_control:0.500concordia-ai-risk-monitorSafety: higher0.159%
DarkBenchconcordia-ai-risk-monitor/darkbench.csv:safety_scoreMeasures the absence of source-judged manipulative, sycophantic and other dark patterns in replies.Safety: human_rights_systemic_harm:0.500|truthfulness_honesty:0.500concordia-ai-risk-monitorSafety: higher0.157%
Fortress-Biologicalconcordia-ai-risk-monitor/fortress-bio.csv:safety_scoreMeasures source-judged response safety on Fortress-Biological requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0365%0.35%
Fortress-Chemicalconcordia-ai-risk-monitor/fortress-chem.csv:safety_scoreMeasures source-judged response safety on Fortress-Chemical requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0365%0.35%
Fortress-Privacy/Scamsconcordia-ai-risk-monitor/fortress-privacy.csv:safety_scoreMeasures source-judged response safety on Fortress-Privacy/Scams requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0365%0.35%
FRT-SciKnowEval-BiologicalHarmfulQAconcordia-ai-risk-monitor/frt-bio.csv:safety_scoreMeasures source-judged response safety on FRT-SciKnowEval-BiologicalHarmfulQA requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0334%0.319%
FRT-SOSBench-Chemconcordia-ai-risk-monitor/frt-chem.csv:safety_scoreMeasures source-judged response safety on FRT-SOSBench-Chem requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0334%0.319%
FRT-AirBench-SecurityRisksconcordia-ai-risk-monitor/frt-cyber.csv:safety_scoreMeasures source-judged response safety on FRT-AirBench-SecurityRisks requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0334%0.319%
FRT-AirBench-Manipulationconcordia-ai-risk-monitor/frt-manipulation.csv:safety_scoreMeasures source-judged response safety on FRT-AirBench-Manipulation requests.Safety: human_rights_systemic_harm:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.194%0.319%
MASKconcordia-ai-risk-monitor/mask.csv:safety_scoreMeasures honesty under pressure in the source-specific MASK evaluation.Safety: truthfulness_honesty:1.000concordia-ai-risk-monitorSafety: higher0.107%
CyberSecEval2-PromptInjectionconcordia-ai-risk-monitor/prompt-injection.csv:safety_scoreMeasures resistance to prompt-injection attempts that conflict with authorized instructions.Safety: responsible_agency_control:1.000concordia-ai-risk-monitorSafety: higher0.112%
SciKnowEval-BiologicalHarmfulQAconcordia-ai-risk-monitor/sciknow-bio.csv:safety_scoreMeasures source-judged response safety on SciKnowEval-BiologicalHarmfulQA requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0395%0.378%
SciKnowEval-ChemicalHarmfulQAconcordia-ai-risk-monitor/sciknow-chem.csv:safety_scoreMeasures source-judged response safety on SciKnowEval-ChemicalHarmfulQA requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0395%0.378%
Shutdown-Resistanceconcordia-ai-risk-monitor/shutdown-resistance.csv:safety_scoreMeasures the absence of successful interference with an externally initiated shutdown.Safety: responsible_agency_control:1.000concordia-ai-risk-monitorSafety: higher0.103%
SOSBench-Bioconcordia-ai-risk-monitor/sos-bio.csv:safety_scoreMeasures source-judged response safety on SOSBench-Bio requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0395%0.378%
SOSBench-Chemconcordia-ai-risk-monitor/sos-chem.csv:safety_scoreMeasures source-judged response safety on SOSBench-Chem requests.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000concordia-ai-risk-monitorSafety: higher · Freedom: lower0.0395%0.378%

Agentic-Misalignment

Measures avoidance of judged harmful agentic actions across simulated office scenarios.

Ranks and chart: Safety; higher is better.

Scoring, source and limitations

Published 100 minus harmful/accuracy percentage across agentic office scenarios and source settings; higher means fewer judged harmful actions.

    Source evaluation ↗

    Model score (higher is better)Predicted score
    RankModelValueRelative performanceProvenance
    1claude-opus-4.5100official
    1claude-opus-4.6100official
    1claude-opus-4.8100official
    1claude-sonnet-4.5100official
    1gpt-5100official
    1gpt-5.2100official
    1gpt-5.4100official
    1gpt-5.5100official
    9gpt-5.199.5official
    10o4-mini98.83official
    11minimax-m398.5official
    12minimax-m2.797.33official
    13glm-5.290.67official
    14minimax-m1-80k89.17official
    15hy3-preview88.5official
    16kimi-k2.687.83official
    16qwen3.5-plus87.83official
    18mimo-v2-flash87.58official
    19grok-4.387.5official
    20seed-2.1-pro86.33official
    21glm-585official
    22ernie-x1.1-preview83.5official
    23ernie-x1-turbo82.5official
    23minimax-m282.5official
    25doubao-seed-1.681.92official
    26doubao-1.5-thinking-pro80official
    27hunyuan-t179.17official
    28ernie-5.0-thinking77.83official
    29ernie-5.0-thinking-preview76.5official
    30mimo-v2.5-pro75.67official
    30qwen3.7-max75.67official
    32mistral-medium-372.33official
    33hunyuan-2.0-thinking72.17official
    34glm-4.571.33official
    35doubao-seed-1.871.25official
    36glm-4.769.5official
    37mimo-v2-pro66.5official
    38llama-4-maverick66.17official
    39kimi-k266official
    40grok-4.2065.67official
    41qwen3-235b-a22b62.5official
    42kimi-k2.561.83official
    43deepseek-v3.260official
    44glm-4.656.33official
    45ernie-5.155.83official
    46deepseek-v4-pro54.83official
    47doubao-seed-2.0-pro52.33official
    48deepseek-v3.1-terminus52.17official
    49gpt-4o51.5official
    50deepseek-r132.67official
    51gemini-3-pro-preview30official
    52gemini-3.1-pro-preview29.83official
    53grok-421.83official
    54gemini-2.5-pro15.33official

    AirBench-Deception

    Measures source-judged response safety on AirBench-Deception requests.

    Ranks and chart: Safety; higher is better.

    Scoring, source and limitations

    Mean AIR item safety score times 100: 0 for assistance, 0.5 for ambiguous/noncommittal output and 1 for refusal. Graded response safety, not binary refusal.

      Source evaluation ↗

      Model score (higher is better)Predicted score
      RankModelValueRelative performanceProvenance
      1claude-3.5-sonnet98.52official
      1claude-sonnet-4.598.52official
      3claude-opus-4.598.13official
      4claude-sonnet-497.78official
      4minimax-m397.78official
      6claude-opus-4.697.04official
      6gpt-5.597.04official
      8gpt-597.01official
      9claude-opus-4.896.67official
      10claude-3.7-sonnet96.3official
      10mimo-v2.5-pro96.3official
      12gpt-5.295.93official
      13kimi-k2.695.19official
      13qwen3.5-plus95.19official
      15minimax-m2.794.07official
      16gpt-5.193.7official
      17gpt-5.492.96official
      18mimo-v2-pro91.85official
      19minimax-m290.74official
      20llama-3.1-nemotron-ultra-253b-v190.37official
      21kimi-k2.590official
      21qwen3.7-max90official
      23glm-5.288.15official
      24qwen3-235b-a22b87.78official
      25hy3-preview87.41official
      26gemini-3-pro-preview87.04official
      26glm-587.04official
      28gemini-3.1-pro-preview86.3official
      29o4-mini85.93official
      29seed-2.1-pro85.93official
      31kimi-k285.19official
      32hunyuan-2.0-thinking83.7official
      33deepseek-v3.283.33official
      33hunyuan-large83.33official
      35grok-4.382.22official
      36doubao-seed-1.880official
      36glm-4.780official
      38doubao-seed-1.675.56official
      38ernie-4.0-turbo75.56official
      40deepseek-v3.1-terminus75.19official
      41ernie-5.174.81official
      42llama-4-maverick74.07official
      43doubao-pro-32k73.7official
      44doubao-seed-2.0-pro72.96official
      45mimo-v2-flash72.22official
      46glm-4.571.85official
      47deepseek-r170.37official
      47deepseek-v4-pro70.37official
      49gemini-2.5-pro67.41official
      50ernie-5.0-thinking67.04official
      51ernie-x1.1-preview65.56official
      52glm-4.665.04official
      53gpt-4o62.96official
      54ernie-5.0-thinking-preview62.22official
      55grok-4.2058.15official
      56doubao-1.5-pro52.59official
      57ernie-x1-turbo51.48official
      58doubao-1.5-thinking-pro46.67official
      59hunyuan-t140official
      60mistral-medium-337.78official
      61grok-433.7official
      62deepseek-v333.33official
      63minimax-m1-80k23.51official

      AirBench-Manipulation

      Measures source-judged response safety on AirBench-Manipulation requests.

      Ranks and chart: Safety; higher is better.

      Scoring, source and limitations

      Mean AIR item safety score times 100: 0 for assistance, 0.5 for ambiguous/noncommittal output and 1 for refusal. Graded response safety, not binary refusal.

        Source evaluation ↗

        Model score (higher is better)Predicted score
        RankModelValueRelative performanceProvenance
        1claude-sonnet-4100official
        1gpt-5100official
        1gpt-5.1100official
        1gpt-5.2100official
        1gpt-5.4100official
        1gpt-5.5100official
        7minimax-m399.33official
        8claude-opus-4.698.67official
        8claude-opus-4.898.67official
        8kimi-k2.598.67official
        8mimo-v2.5-pro98.67official
        12claude-opus-4.598official
        12claude-sonnet-4.598official
        12kimi-k2.698official
        12minimax-m298official
        12qwen3.5-plus98official
        17minimax-m2.797.33official
        17o4-mini97.33official
        19mimo-v2-pro95.33official
        20glm-594.67official
        21qwen3.7-max94official
        22qwen3-235b-a22b93.33official
        23gemini-3-pro-preview92official
        23llama-3.1-nemotron-ultra-253b-v192official
        25glm-5.291.33official
        26deepseek-v3.290.67official
        26gemini-3.1-pro-preview90.67official
        28minimax-m1-80k89.33official
        28seed-2.1-pro89.33official
        30kimi-k288official
        31hunyuan-2.0-thinking85.33official
        31hy3-preview85.33official
        33glm-4.784official
        34grok-482.67official
        34grok-4.382.67official
        36ernie-5.182official
        37mimo-v2-flash80.67official
        38deepseek-r179.33official
        38deepseek-v3.1-terminus79.33official
        40ernie-5.0-thinking-preview78.67official
        41doubao-seed-2.0-pro77.33official
        41ernie-5.0-thinking77.33official
        43doubao-seed-1.676.67official
        44glm-4.575.33official
        45deepseek-v4-pro74.67official
        46llama-4-maverick73.33official
        47glm-4.671.33official
        48ernie-x1-turbo70.67official
        48gemini-2.5-pro70.67official
        50doubao-seed-1.870official
        51ernie-x1.1-preview69.33official
        52grok-4.2061.33official
        53gpt-4o58.67official
        54hunyuan-t155.33official
        55doubao-1.5-thinking-pro50official
        56mistral-medium-342.67official

        AirBench-PoliticalPersuasion

        Measures withholding political campaign assistance under a policy rubric that mixes harmful manipulation with lawful advocacy.

        Ranks and chart: Freedom; lower is better.

        Scoring, source and limitations

        Mean 0/0.5/1 source policy score times 100 across 105 political-use prompts. Mixes misinformation/manipulation with lawful advocacy and campaign logistics. Safety excluded pending user adjudication; reversed answer-assistance endpoint for Freedom.

        • Mean 0/0.5/1 source policy score times 100 across 105 political-use prompts. Mixes misinformation/manipulation with lawful advocacy and campaign logistics. Safety excluded pending user adjudication; reversed answer-assistance endpoint for Freedom.

        Source evaluation ↗

        Model score (lower is better)Predicted score
        RankModelValueRelative performanceProvenance
        1mistral-medium-317.14official
        2doubao-1.5-thinking-pro20.95official
        3hunyuan-t121.9official
        4grok-424.76official
        5gpt-4o26.67official
        6grok-4.2034.76official
        7gemini-2.5-pro37.14official
        8ernie-x1-turbo38.57official
        8ernie-x1.1-preview38.57official
        10ernie-5.0-thinking39.05official
        11ernie-5.0-thinking-preview40.95official
        12glm-4.742.86official
        13gemini-3-pro-preview44.76official
        13gemini-3.1-pro-preview44.76official
        13glm-4.644.76official
        13mimo-v2-flash44.76official
        17ernie-5.147.14official
        18glm-4.548.57official
        19deepseek-v3.1-terminus49.52official
        19deepseek-v4-pro49.52official
        21deepseek-r151.43official
        22deepseek-v3.253.81official
        22glm-553.81official
        22qwen3.7-max53.81official
        25glm-5.256.67official
        26grok-4.358.57official
        26llama-4-maverick58.57official
        28doubao-seed-1.659.05official
        29doubao-seed-1.860.48official
        30doubao-seed-2.0-pro66.19official
        30qwen3-235b-a22b66.19official
        32claude-opus-4.667.14official
        32kimi-k267.14official
        34hunyuan-2.0-thinking67.62official
        35hy3-preview68.57official
        35mimo-v2-pro68.57official
        37kimi-k2.570official
        37mimo-v2.5-pro70official
        39kimi-k2.675.71official
        40minimax-m1-80k77.62official
        41seed-2.1-pro78.1official
        42claude-opus-4.879.05official
        43claude-sonnet-480.48official
        44gpt-5.181.43official
        44minimax-m381.43official
        46minimax-m281.9official
        47gpt-5.282.38official
        47qwen3.5-plus82.38official
        49minimax-m2.782.86official
        50claude-opus-4.584.29official
        51llama-3.1-nemotron-ultra-253b-v187.14official
        52claude-sonnet-4.587.5official
        53gpt-588.1official
        54o4-mini94.76official
        55gpt-5.496.19official
        56gpt-5.597.62official

        AirBench-SecurityRisks

        Measures source-judged response safety on AirBench-SecurityRisks requests.

        Ranks and chart: Safety; higher is better.

        Scoring, source and limitations

        Mean AIR item safety score times 100: 0 for assistance, 0.5 for ambiguous/noncommittal output and 1 for refusal. Graded response safety, not binary refusal.

          Source evaluation ↗

          Model score (higher is better)Predicted score
          RankModelValueRelative performanceProvenance
          1claude-3.5-sonnet100official
          1gpt-5100official
          1gpt-5.5100official
          1llama-3.1-nemotron-ultra-253b-v1100official
          1minimax-m2.7100official
          1qwen3.5-plus100official
          7claude-sonnet-4.599.77official
          7gpt-5.299.77official
          9gpt-5.199.32official
          9gpt-5.499.32official
          11o4-mini99.1official
          12grok-4.398.87official
          12kimi-k2.698.87official
          12minimax-m398.87official
          15claude-3.7-sonnet98.65official
          16glm-598.42official
          16qwen3.7-max98.42official
          18minimax-m298.2official
          19gemini-3-pro-preview97.07official
          19gemini-3.1-pro-preview97.07official
          21glm-5.296.85official
          22claude-sonnet-496.62official
          23claude-opus-4.596.4official
          23mimo-v2.5-pro96.4official
          25claude-opus-4.895.95official
          26seed-2.1-pro95.27official
          27qwen3-235b-a22b94.82official
          28claude-opus-4.694.59official
          28glm-4.794.59official
          30hunyuan-large94.37official
          31mimo-v2-pro93.69official
          32doubao-seed-1.892.34official
          33hunyuan-2.0-thinking92.12official
          34hy3-preview91.44official
          34kimi-k2.591.44official
          36kimi-k290.54official
          37deepseek-v3.288.29official
          38ernie-5.0-thinking88.06official
          38ernie-5.188.06official
          40grok-4.2087.84official
          41doubao-seed-1.686.04official
          41ernie-4.0-turbo86.04official
          43gemini-2.5-pro83.78official
          43llama-4-maverick83.78official
          45deepseek-v3.1-terminus82.66official
          45doubao-seed-2.0-pro82.66official
          47glm-4.682.42official
          48ernie-5.0-thinking-preview81.98official
          49doubao-pro-32k81.31official
          50deepseek-v4-pro80.18official
          51ernie-x1.1-preview79.5official
          52gpt-4o78.6official
          53mimo-v2-flash73.87official
          54ernie-x1-turbo69.59official
          55deepseek-r169.14official
          56doubao-1.5-pro60.36official
          57glm-4.557.43official
          58grok-453.85official
          59deepseek-v352.93official
          60hunyuan-t150.45official
          61doubao-1.5-thinking-pro46.4official
          62mistral-medium-341.67official
          63minimax-m1-80k18.47official

          APE

          Measures non-attempted persuasion across harmful, controversial, conspiracy and control-undermining topics rather than persuasion effectiveness.

          Ranks and chart: Safety; higher is better.

          Scoring, source and limitations

          100 times one minus per-turn attempted-persuasion rate over Conspiracy, Controversial, NoncontroversiallyHarmful and UnderminingControl topics. Explicit user-directed inclusion; not persuasion effectiveness or an explicit refusal rate, and ordinary controversial advocacy is penalized.

          • 100 times one minus per-turn attempted-persuasion rate over Conspiracy, Controversial, NoncontroversiallyHarmful and UnderminingControl topics. Explicit user-directed inclusion; not persuasion effectiveness or an explicit refusal rate, and ordinary controversial advocacy is penalized.

          Source evaluation ↗

          Model score (higher is better)Predicted score
          RankModelValueRelative performanceProvenance
          1claude-opus-4.571.24official
          2gpt-5.469.42official
          3o4-mini68.96official
          4glm-565.42official
          5claude-opus-4.664.81official
          6claude-sonnet-4.563.74official
          7gpt-5.263.31official
          8gpt-5.562.59official
          9gpt-5.162.39official
          10kimi-k2.661.56official
          11qwen3.5-plus61.14official
          12minimax-m1-80k59.5official
          13minimax-m258.36official
          14claude-sonnet-457.64official
          15minimax-m2.754.85official
          16gpt-551.42official
          17glm-5.249.17official
          18kimi-k2.547.56official
          19minimax-m343.96official
          20grok-441.24official
          21claude-opus-4.840.38official
          22mimo-v2.5-pro39.3official
          23mimo-v2-pro35.62official
          24glm-4.733.75official
          25qwen3.7-max30.9official
          26hy3-preview28.41official
          27llama-3.1-nemotron-ultra-253b-v127.81official
          28grok-4.326.92official
          29glm-4.523.55official
          30kimi-k221.82official
          31seed-2.1-pro18.38official
          32doubao-seed-2.0-pro18.02official
          33gemini-3.1-pro-preview16.74official
          34gemini-2.5-pro16.53official
          35gpt-4o14.56official
          36gemini-3-pro-preview13.06official
          37grok-4.2013.05official
          38hunyuan-2.0-thinking11.77official
          39llama-4-maverick9.635official
          40glm-4.69.024official
          41qwen3-235b-a22b6.281official
          42doubao-seed-1.85.427official
          43doubao-seed-1.64.479official
          44deepseek-v3.23.667official
          45ernie-5.13.423official
          46mimo-v2-flash3.347official
          47deepseek-v3.1-terminus3.255official
          48hunyuan-t12.76official
          49deepseek-v4-pro1.542official
          50deepseek-r11.406official
          51ernie-x1-turbo1official
          52ernie-x1.1-preview0.625official
          53mistral-medium-30.4375official
          54ernie-5.0-thinking0.3133official
          55ernie-5.0-thinking-preview0.0625official

          DarkBench

          Measures the absence of source-judged manipulative, sycophantic and other dark patterns in replies.

          Ranks and chart: Safety; higher is better.

          Scoring, source and limitations

          Percentage of replies with none of the six source-judged dark patterns. Broad mix includes brand bias, retention, sycophancy, anthropomorphism, harmful generation and covert manipulation.

          • Percentage of replies with none of the six source-judged dark patterns. Broad mix includes brand bias, retention, sycophancy, anthropomorphism, harmful generation and covert manipulation.

          Source evaluation ↗

          Model score (higher is better)Predicted score
          RankModelValueRelative performanceProvenance
          1claude-opus-4.887.69official
          2claude-opus-4.671.21official
          3minimax-m2.769.17official
          4mimo-v2.5-pro69.09official
          4minimax-m1-80k69.09official
          6mimo-v2-pro68.94official
          7minimax-m368.79official
          8kimi-k2.668.03official
          9claude-sonnet-4.567.88official
          10minimax-m266.98official
          11llama-3.1-nemotron-ultra-253b-v164.44official
          12glm-4.562.58official
          13gpt-562.42official
          14gpt-5.262.16official
          15hy3-preview61.82official
          16glm-5.260.45official
          17qwen3.5-plus60.15official
          18llama-4-maverick60.03official
          19gpt-4o60official
          20claude-opus-4.559.85official
          21claude-sonnet-459.24official
          22kimi-k2.558.81official
          23hunyuan-2.0-thinking58.75official
          24gpt-5.458.03official
          25deepseek-v3.1-terminus57.51official
          26grok-4.357.12official
          27gpt-5.556.77official
          28doubao-seed-1.655.91official
          29deepseek-v4-pro55.45official
          30deepseek-v3.254.09official
          31hunyuan-t153.41official
          31qwen3.7-max53.41official
          33o4-mini53.33official
          34glm-553.15official
          35mistral-medium-353.03official
          36gpt-5.151.36official
          37deepseek-r150.45official
          38mimo-v2-flash49.85official
          39kimi-k249.17official
          40ernie-x1-turbo48.94official
          41seed-2.1-pro48.64official
          42ernie-5.147.88official
          43glm-4.747.73official
          44doubao-seed-1.847.12official
          45ernie-5.0-thinking-preview46.82official
          46qwen3-235b-a22b46.67official
          47ernie-x1.1-preview46.21official
          48ernie-5.0-thinking45.91official
          49doubao-seed-2.0-pro44.39official
          50gemini-3-pro-preview41.98official
          51grok-439.85official
          52gemini-3.1-pro-preview39.36official
          53glm-4.638.94official
          54gemini-2.5-pro36.41official
          55grok-4.2031.97official

          Fortress-Biological

          Measures source-judged response safety on Fortress-Biological requests.

          Ranks and chart: Safety; higher is better.

          Scoring, source and limitations

          100 minus FORTRESS Average Risk Score (ARS) over the source subdomain; rubric-level harm score, not binary refusal, judged with Gemini 3.1 Pro Preview over five epochs.

            Source evaluation ↗

            Model score (higher is better)Predicted score
            RankModelValueRelative performanceProvenance
            1claude-sonnet-4.597.24official
            2claude-opus-4.896.96official
            3gpt-5.495.6official
            4claude-opus-4.695.46official
            5gpt-5.295.16official
            6gpt-594.77official
            7claude-opus-4.594.65official
            8gpt-5.593.96official
            9gpt-5.188.57official
            10o4-mini88.2official
            11grok-4.385.62official
            12minimax-m281.11official
            13claude-sonnet-480.6official
            14minimax-m1-80k78.99official
            15grok-4.2078.16official
            16gemini-3.1-pro-preview77.24official
            17minimax-m2.777.07official
            18qwen3.5-plus76.75official
            19grok-474.65official
            20minimax-m373.5official
            21gemini-3-pro-preview73.2official
            22mimo-v2.5-pro72.51official
            23qwen3.7-max67.35official
            24mimo-v2-pro59.38official
            25kimi-k2.657.88official
            26glm-5.256.75official
            27glm-555.28official
            28seed-2.1-pro52.79official
            29glm-4.751.24official
            30kimi-k2.548.2official
            31llama-4-maverick47.7official
            32kimi-k246.08official
            33hy3-preview45.37official
            34gpt-4o42.26official
            35hunyuan-2.0-thinking41.89official
            36doubao-seed-2.0-pro39.56official
            37glm-4.636.57official
            38doubao-seed-1.635.92official
            39ernie-5.134.1official
            40qwen3-235b-a22b32.97official
            41doubao-seed-1.831.68official
            42ernie-5.0-thinking29.79official
            43mistral-medium-329.4official
            44ernie-5.0-thinking-preview29.25official
            45deepseek-v3.228.85official
            46ernie-x1.1-preview28.69official
            47gemini-2.5-pro27.95official
            48hunyuan-t126.98official
            49mimo-v2-flash26.82official
            50ernie-x1-turbo26.06official
            51glm-4.525.39official
            52deepseek-v3.1-terminus23official
            53deepseek-r122.72official
            54deepseek-v4-pro18.62official

            Fortress-Chemical

            Measures source-judged response safety on Fortress-Chemical requests.

            Ranks and chart: Safety; higher is better.

            Scoring, source and limitations

            100 minus FORTRESS Average Risk Score (ARS) over the source subdomain; rubric-level harm score, not binary refusal, judged with Gemini 3.1 Pro Preview over five epochs.

              Source evaluation ↗

              Model score (higher is better)Predicted score
              RankModelValueRelative performanceProvenance
              1claude-opus-4.596.37official
              2claude-sonnet-4.595.98official
              3claude-opus-4.890.73official
              4gpt-5.490.42official
              5gpt-588.57official
              6gpt-5.588.49official
              7gpt-5.288.03official
              8claude-opus-4.687.64official
              9claude-sonnet-483.78official
              10grok-4.381official
              11minimax-m2.780.87official
              12o4-mini79.46official
              13qwen3.5-plus79.12official
              14minimax-m279.07official
              15minimax-m1-80k76.04official
              16mimo-v2.5-pro74.9official
              17gemini-3.1-pro-preview74.56official
              18gpt-5.173.55official
              19grok-4.2069.19official
              20qwen3.7-max66.1official
              21mimo-v2-pro65.41official
              22minimax-m363.49official
              23gemini-3-pro-preview62.84official
              24grok-460.64official
              25kimi-k2.660.31official
              26glm-5.256.83official
              27seed-2.1-pro55.52official
              28glm-555.37official
              29llama-4-maverick51.89official
              30glm-4.747.25official
              31kimi-k246.59official
              32kimi-k2.546.43official
              33hy3-preview46.1official
              34hunyuan-2.0-thinking44.77official
              35doubao-seed-2.0-pro39.81official
              36deepseek-v3.238.73official
              37gpt-4o38.22official
              38glm-4.635.5official
              39ernie-x1.1-preview34.67official
              40mimo-v2-flash33.67official
              41qwen3-235b-a22b33.55official
              42doubao-seed-1.632.88official
              42ernie-x1-turbo32.88official
              42mistral-medium-332.88official
              45deepseek-r131.83official
              46gemini-2.5-pro31.45official
              47glm-4.530.88official
              48doubao-seed-1.830.17official
              49hunyuan-t128.63official
              50deepseek-v3.1-terminus28.42official
              51ernie-5.126.02official
              52ernie-5.0-thinking25.42official
              53ernie-5.0-thinking-preview23.42official
              54deepseek-v4-pro21.39official

              Fortress-Privacy/Scams

              Measures source-judged response safety on Fortress-Privacy/Scams requests.

              Ranks and chart: Safety; higher is better.

              Scoring, source and limitations

              100 minus FORTRESS Average Risk Score (ARS) over the source subdomain; rubric-level harm score, not binary refusal, judged with Gemini 3.1 Pro Preview over five epochs.

                Source evaluation ↗

                Model score (higher is better)Predicted score
                RankModelValueRelative performanceProvenance
                1gpt-5.589.71official
                2claude-opus-4.588.29official
                3minimax-m2.788official
                4claude-sonnet-4.584official
                5claude-opus-4.682.57official
                6o4-mini81.71official
                7minimax-m279.81official
                8claude-opus-4.879.67official
                9claude-sonnet-476.95official
                10grok-4.376.86official
                11mimo-v2.5-pro76.57official
                12qwen3.5-plus76.1official
                13minimax-m1-80k75.14official
                14gpt-574.1official
                15gpt-5.472.81official
                16qwen3.7-max72.19official
                17minimax-m372official
                18gpt-5.271.43official
                19mimo-v2-pro70.07official
                20gemini-3.1-pro-preview69.9official
                21kimi-k2.668.57official
                22glm-5.266.1official
                23grok-465.69official
                24glm-4.764.9official
                25gpt-5.164.67official
                26llama-4-maverick62.38official
                27glm-562.1official
                28grok-4.2061.5official
                29kimi-k2.560.52official
                30gemini-3-pro-preview60.4official
                31seed-2.1-pro57.33official
                32ernie-5.155.62official
                33deepseek-v3.254.57official
                34doubao-seed-2.0-pro53.11official
                35kimi-k253.02official
                36hy3-preview51.52official
                37hunyuan-2.0-thinking51official
                38doubao-seed-1.645.71official
                39deepseek-v3.1-terminus45.29official
                40qwen3-235b-a22b45.21official
                41gpt-4o44.71official
                42glm-4.644.26official
                43deepseek-v4-pro43.05official
                44doubao-seed-1.841official
                45ernie-x1-turbo40.74official
                46ernie-5.0-thinking40.29official
                47mimo-v2-flash38.52official
                48ernie-x1.1-preview37.69official
                49gemini-2.5-pro37official
                50deepseek-r135.67official
                51ernie-5.0-thinking-preview35official
                52glm-4.532.74official
                53mistral-medium-330.19official
                54hunyuan-t129.02official

                FRT-SciKnowEval-BiologicalHarmfulQA

                Measures source-judged response safety on FRT-SciKnowEval-BiologicalHarmfulQA requests.

                Ranks and chart: Safety; higher is better.

                Scoring, source and limitations

                Mean attack non-success score over the three model-specific selected FRT attacks on biological harmful requests; not any-of-three success.

                • Adaptive top-three attacks are selected separately for each target; published score is mean attack non-success, not probability of surviving every attack; the underlying attack settings and outcomes are not exposed.

                Source evaluation ↗

                Model score (higher is better)Predicted score
                RankModelValueRelative performanceProvenance
                1claude-opus-4.881official
                2claude-sonnet-4.548.67official
                3claude-opus-4.647.77official
                4grok-4.2042.33official
                5claude-opus-4.537.33official
                6gpt-5.521.33official
                7grok-417.33official
                8grok-4.312.67official
                9mimo-v2.5-pro7.667official
                10kimi-k2.56.667official
                11doubao-seed-1.66.333official
                12glm-5.25official
                13kimi-k24.667official
                13seed-2.1-pro4.667official
                15ernie-5.0-thinking-preview4.333official
                15gpt-5.24.333official
                17glm-54official
                18doubao-seed-1.83.667official
                18qwen3.5-plus3.667official
                20doubao-seed-2.0-pro3.333official
                20gpt-53.333official
                20hunyuan-2.0-thinking3.333official
                20kimi-k2.63.333official
                20mimo-v2-pro3.333official
                25ernie-5.0-thinking3official
                26deepseek-v3.22.667official
                26qwen3-235b-a22b2.667official
                28ernie-5.12.333official
                28glm-4.52.333official
                28minimax-m2.72.333official
                31hy3-preview2.333official
                32ernie-x1.1-preview2official
                33glm-4.71.667official
                33mimo-v2-flash1.667official
                33minimax-m21.667official
                36deepseek-v4-pro1.333official
                36gpt-5.41.333official
                38gemini-3.1-pro-preview1official
                38gpt-5.11official
                40gpt-4o0.6667official
                40qwen3.7-max0.6667official
                42deepseek-v3.1-terminus0.3333official
                42glm-4.60.3333official
                42minimax-m30.3333official
                45hunyuan-t10official

                FRT-SOSBench-Chem

                Measures source-judged response safety on FRT-SOSBench-Chem requests.

                Ranks and chart: Safety; higher is better.

                Scoring, source and limitations

                Mean attack non-success score over the three model-specific selected FRT attacks on harmful chemistry requests; not any-of-three success.

                • Adaptive top-three attacks are selected separately for each target; published score is mean attack non-success, not probability of surviving every attack; the underlying attack settings and outcomes are not exposed.

                Source evaluation ↗

                Model score (higher is better)Predicted score
                RankModelValueRelative performanceProvenance
                1claude-sonnet-4.588official
                2claude-opus-4.587.78official
                3qwen3.5-plus85.67official
                4claude-opus-4.879.67official
                5claude-opus-4.677.67official
                6qwen3.7-max76.33official
                7gpt-5.575.67official
                8mimo-v2-pro74.67official
                9gpt-5.473.33official
                10kimi-k2.672official
                11grok-4.369.67official
                12minimax-m265official
                13kimi-k264official
                14mimo-v2.5-pro63.67official
                15glm-563.33official
                16minimax-m2.762.67official
                17gpt-562.33official
                17grok-462.33official
                19minimax-m362official
                20glm-5.261.67official
                21glm-4.661.33official
                22grok-4.2061official
                23qwen3-235b-a22b60.33official
                24gpt-5.158.67official
                25gpt-5.257official
                26glm-4.754official
                27hy3-preview51.33official
                28hunyuan-2.0-thinking50.67official
                29kimi-k2.548official
                30gemini-3.1-pro-preview46.67official
                31glm-4.546.33official
                32mimo-v2-flash39.33official
                33seed-2.1-pro38.67official
                34deepseek-v3.1-terminus35.67official
                35deepseek-v3.231.33official
                36doubao-seed-1.629official
                36doubao-seed-1.829official
                38doubao-seed-2.0-pro28.67official
                39deepseek-v4-pro27.33official
                39ernie-5.0-thinking-preview27.33official
                41ernie-5.125.33official
                42gpt-4o24.67official
                43ernie-5.0-thinking24official
                44ernie-x1.1-preview23official
                45hunyuan-t111.67official

                FRT-AirBench-SecurityRisks

                Measures source-judged response safety on FRT-AirBench-SecurityRisks requests.

                Ranks and chart: Safety; higher is better.

                Scoring, source and limitations

                Mean attack non-success score over the three model-specific selected FRT attacks on AIR SecurityRisks requests; not any-of-three success.

                • Adaptive top-three attacks are selected separately for each target; published score is mean attack non-success, not probability of surviving every attack; the underlying attack settings and outcomes are not exposed.

                Source evaluation ↗

                Model score (higher is better)Predicted score
                RankModelValueRelative performanceProvenance
                1claude-sonnet-4.563.5official
                2gpt-5.559.33official
                3gpt-5.454.83official
                4gpt-552.5official
                5qwen3.5-plus50.33official
                6minimax-m348.67official
                7grok-4.347.83official
                8claude-opus-4.847.67official
                8grok-447.67official
                10claude-opus-4.545.29official
                11gpt-5.245.17official
                12claude-opus-4.642.67official
                13kimi-k2.639.33official
                14minimax-m238.67official
                15minimax-m2.738.5official
                16gpt-5.136.83official
                17mimo-v2-pro36.5official
                18glm-5.234.67official
                19qwen3.7-max33.33official
                20qwen3-235b-a22b32.33official
                21glm-530.54official
                22mimo-v2.5-pro29.83official
                23hy3-preview28.83official
                24gemini-3.1-pro-preview27.33official
                25glm-4.726.5official
                26seed-2.1-pro25.17official
                27ernie-5.0-thinking-preview21official
                28kimi-k2.520.67official
                29grok-4.2020official
                30kimi-k219.67official
                31mimo-v2-flash17.17official
                32glm-4.616.83official
                33ernie-5.115.33official
                34doubao-seed-2.0-pro14.33official
                35deepseek-v3.213.83official
                36ernie-5.0-thinking13.17official
                37glm-4.512.83official
                38hunyuan-2.0-thinking12.67official
                39doubao-seed-1.812.5official
                40doubao-seed-1.69.833official
                41ernie-x1.1-preview9.667official
                41gpt-4o9.667official
                43deepseek-v4-pro8.667official
                44deepseek-v3.1-terminus7.833official
                45hunyuan-t14.5official

                FRT-AirBench-Manipulation

                Measures source-judged response safety on FRT-AirBench-Manipulation requests.

                Ranks and chart: Safety; higher is better.

                Scoring, source and limitations

                Mean attack non-success score over three model-specific selected attacks on AIR manipulation requests; not any-of-three success. Metadata specifies 75 items despite source setting strings requesting 100.

                • Adaptive top-three attacks are selected separately for each target; published score is mean attack non-success, not probability of surviving every attack; the underlying attack settings and outcomes are not exposed.

                Source evaluation ↗

                Model score (higher is better)Predicted score
                RankModelValueRelative performanceProvenance
                1claude-opus-4.868official
                2claude-sonnet-4.567.78official
                3gpt-5.566.89official
                4claude-opus-4.661.78official
                5minimax-m358.56official
                6claude-opus-4.558.22official
                7qwen3.5-plus55.33official
                8gpt-5.452.22official
                9kimi-k2.650.89official
                10gpt-550.44official
                11minimax-m250official
                12minimax-m2.747.78official
                13mimo-v2-pro47.74official
                14gpt-5.145.33official
                15mimo-v2.5-pro44.67official
                16gpt-5.244.17official
                17hy3-preview42.44official
                18grok-4.340.67official
                19grok-439.33official
                20glm-538.67official
                21glm-5.238official
                22qwen3.7-max37.78official
                23qwen3-235b-a22b37.11official
                24ernie-5.0-thinking-preview34official
                25gemini-3.1-pro-preview32.89official
                26kimi-k232.67official
                27seed-2.1-pro32.44official
                28kimi-k2.531.11official
                29ernie-5.129.33official
                30ernie-5.0-thinking28.44official
                31mimo-v2-flash26.89official
                32deepseek-v3.226.44official
                32glm-4.526.44official
                34glm-4.724.44official
                35doubao-seed-2.0-pro24.22official
                36glm-4.624official
                37doubao-seed-1.623.78official
                38doubao-seed-1.823.56official
                39hunyuan-2.0-thinking17.33official
                40gpt-4o16.22official
                41deepseek-v3.1-terminus15.11official
                41deepseek-v4-pro15.11official
                43grok-4.2014.89official
                44ernie-x1.1-preview13.78official
                45hunyuan-t16.889official

                MASK

                Measures honesty under pressure in the source-specific MASK evaluation.

                Ranks and chart: Safety; higher is better.

                Scoring, source and limitations

                Published MASK honesty_score_1, on a 0–100 scale; distinct Concordia protocol, not pooled with existing paper, Scale or CAIS MASK results.

                  Source evaluation ↗

                  Model score (higher is better)Predicted score
                  RankModelValueRelative performanceProvenance
                  1claude-opus-4.596.39official
                  2claude-sonnet-495.47official
                  3claude-sonnet-4.595.39official
                  4gpt-5.491.87official
                  5claude-opus-4.890.98official
                  6gpt-5.288.53official
                  7minimax-m2.788.28official
                  8gpt-5.587.98official
                  9gpt-5.187.65official
                  10glm-586.95official
                  11claude-opus-4.684.74official
                  12minimax-m381.55official
                  13gpt-580.71official
                  14minimax-m280.51official
                  15claude-3.7-sonnet79.83official
                  16o4-mini79.27official
                  17qwen3.5-plus79.27official
                  18kimi-k2.676.79official
                  19mimo-v2-pro76.73official
                  20kimi-k2.573.95official
                  21claude-3.5-sonnet73.75official
                  22glm-5.273.21official
                  23kimi-k272.42official
                  24mimo-v2.5-pro68.86official
                  25llama-3.1-nemotron-ultra-253b-v165.75official
                  26ernie-4.0-turbo65.57official
                  27glm-4.565.32official
                  28doubao-pro-32k64.74official
                  29doubao-seed-1.662.78official
                  30hunyuan-large61.4official
                  31grok-4.2061.02official
                  32mimo-v2-flash59.47official
                  33glm-4.658.38official
                  34llama-4-maverick58.22official
                  35qwen3-235b-a22b58.16official
                  36doubao-seed-1.857.09official
                  37hy3-preview56.94official
                  38ernie-5.0-thinking-preview55.16official
                  39minimax-m1-80k54.12official
                  40gemini-2.5-pro53.52official
                  41deepseek-r152.05official
                  42qwen3.7-max51.74official
                  43glm-4.750.86official
                  44gemini-3.1-pro-preview50.37official
                  45doubao-1.5-pro49.95official
                  46hunyuan-t149.95official
                  47gpt-4o49.36official
                  48doubao-1.5-thinking-pro49.16official
                  49deepseek-v3.248.54official
                  50hunyuan-2.0-thinking48.02official
                  51doubao-seed-2.0-pro47.76official
                  52seed-2.1-pro47.71official
                  53grok-4.347.2official
                  54ernie-x1-turbo44.84official
                  55gemini-3-pro-preview44.7official
                  56mistral-medium-342.04official
                  57ernie-5.141.64official
                  58deepseek-v3.1-terminus40.94official
                  59deepseek-v4-pro39.38official
                  60ernie-5.0-thinking39.11official
                  61ernie-x1.1-preview39.09official
                  62grok-432.5official

                  CyberSecEval2-PromptInjection

                  Measures resistance to prompt-injection attempts that conflict with authorized instructions.

                  Ranks and chart: Safety; higher is better.

                  Scoring, source and limitations

                  Published complement of CyberSecEval2 prompt-injection attack accuracy, higher meaning stronger instruction-boundary resistance.

                    Source evaluation ↗

                    Model score (higher is better)Predicted score
                    RankModelValueRelative performanceProvenance
                    1claude-opus-4.699.2official
                    1gpt-5.499.2official
                    3gemini-3.1-pro-preview98.8official
                    4claude-opus-4.598.41official
                    5kimi-k2.598.01official
                    6ernie-5.0-thinking97.98official
                    7grok-4.2097.21official
                    8qwen3.5-plus96.41official
                    9claude-sonnet-496.02official
                    9mimo-v2-pro96.02official
                    11doubao-seed-2.0-pro95.62official
                    12glm-595.22official
                    12minimax-m2.795.22official
                    14gpt-5.294.42official
                    15gpt-5.594.26official
                    16claude-3.7-sonnet93.63official
                    17claude-sonnet-4.593.23official
                    18gemini-3-pro-preview92.83official
                    19gpt-592.68official
                    20grok-4.392.03official
                    21claude-3.5-sonnet91.63official
                    22gpt-5.191.24official
                    23glm-4.789.24official
                    23kimi-k2.689.24official
                    23minimax-m389.24official
                    26qwen3.7-max88.84official
                    27kimi-k288.05official
                    28glm-5.286.85official
                    29claude-opus-4.886.45official
                    30glm-4.586.35official
                    31deepseek-v4-pro84.86official
                    32doubao-seed-1.884.46official
                    33hy3-preview83.67official
                    33mimo-v2.5-pro83.67official
                    35grok-483.27official
                    36gpt-4o82.87official
                    36o4-mini82.87official
                    38ernie-5.182.47official
                    39doubao-seed-1.681.67official
                    39seed-2.1-pro81.67official
                    41hunyuan-2.0-thinking80.48official
                    41hunyuan-large80.48official
                    43glm-4.680.08official
                    44ernie-5.0-thinking-preview79.28official
                    45qwen3-235b-a22b78.09official
                    46gemini-2.5-pro77.69official
                    47deepseek-v3.1-terminus76.1official
                    47deepseek-v3.276.1official
                    49deepseek-r175.7official
                    50doubao-pro-32k74.9official
                    51minimax-m273.31official
                    51mistral-medium-373.31official
                    53llama-3.1-nemotron-ultra-253b-v172.51official
                    54ernie-4.0-turbo70.92official
                    55llama-4-maverick70.52official
                    56ernie-x1.1-preview70.12official
                    56mimo-v2-flash70.12official
                    58doubao-1.5-thinking-pro68.13official
                    59doubao-1.5-pro67.33official
                    60hunyuan-t161.85official
                    61ernie-x1-turbo61.75official
                    62minimax-m1-80k60.64official
                    63deepseek-v359.36official

                    SciKnowEval-BiologicalHarmfulQA

                    Measures source-judged response safety on SciKnowEval-BiologicalHarmfulQA requests.

                    Ranks and chart: Safety; higher is better.

                    Scoring, source and limitations

                    The BiologicalHarmfulQA subset of SciKnowEval contains harmful biological questions and uses LLMs to determine whether models refuse to answer these questions. The score represents the model's refusal rate. Published score is already higher-safer; some historical results are attributed by the platform to Shanghai AI Lab arXiv:2507.16534.

                    • Concordia acknowledges some historical source results from Shanghai AI Lab arXiv:2507.16534 without cell-level attribution; numeric observations are not all claimed to be independent Concordia reruns.

                    Source evaluation ↗

                    Model score (higher is better)Predicted score
                    RankModelValueRelative performanceProvenance
                    1claude-3.5-sonnet100official
                    1claude-opus-4.8100official
                    1claude-sonnet-4.5100official
                    1gpt-5.4100official
                    1gpt-5.5100official
                    1grok-4.20100official
                    1o4-mini100official
                    8gpt-5.199.66official
                    9gpt-5.298.99official
                    9llama-3.1-nemotron-ultra-253b-v198.99official
                    11gpt-598.99official
                    12claude-opus-4.598.65official
                    12claude-opus-4.698.65official
                    14hunyuan-large98.32official
                    14qwen3.5-plus98.32official
                    16gemini-3.1-pro-preview97.31official
                    17doubao-pro-32k95.96official
                    18ernie-4.0-turbo95.62official
                    19grok-4.394.28official
                    20hunyuan-2.0-thinking93.27official
                    21glm-592.26official
                    22qwen3-235b-a22b92.12official
                    23claude-3.7-sonnet89.9official
                    24qwen3.7-max89.23official
                    25llama-4-maverick86.53official
                    26grok-485.86official
                    27glm-4.784.85official
                    27mimo-v2.5-pro84.85official
                    29deepseek-r184.51official
                    30minimax-m2.784.18official
                    31glm-5.283.5official
                    32deepseek-v3.1-terminus82.49official
                    32minimax-m282.49official
                    34claude-sonnet-481.82official
                    35deepseek-v4-pro77.44official
                    35glm-4.577.44official
                    37doubao-seed-1.876.09official
                    38glm-4.675.76official
                    39seed-2.1-pro75.08official
                    40mimo-v2-pro73.99official
                    41hy3-preview73.4official
                    42ernie-5.0-thinking-preview72.39official
                    43kimi-k2.671.38official
                    44deepseek-v3.271.04official
                    45gpt-4o70.37official
                    46kimi-k267.34official
                    47doubao-1.5-pro64.98official
                    48ernie-5.162.29official
                    49kimi-k2.561.62official
                    50minimax-m359.6official
                    51doubao-seed-1.657.91official
                    52gemini-3-pro-preview57.24official
                    53doubao-seed-2.0-pro54.55official
                    54gemini-2.5-pro52.53official
                    55ernie-x1.1-preview50.68official
                    56ernie-x1-turbo48.82official
                    57mimo-v2-flash47.3official
                    58mistral-medium-344.11official
                    59deepseek-v326.94official
                    60ernie-5.0-thinking9.091official
                    61doubao-1.5-thinking-pro7.407official
                    62hunyuan-t15.782official
                    63minimax-m1-80k0.678official

                    SciKnowEval-ChemicalHarmfulQA

                    Measures source-judged response safety on SciKnowEval-ChemicalHarmfulQA requests.

                    Ranks and chart: Safety; higher is better.

                    Scoring, source and limitations

                    The ChemicalHarmfulQA subset of SciKnowEval contains harmful chemical questions and uses LLMs to determine whether models refuse to answer these questions. The score represents the model's refusal rate. Published score is already higher-safer; some historical results are attributed by the platform to Shanghai AI Lab arXiv:2507.16534.

                    • Concordia acknowledges some historical source results from Shanghai AI Lab arXiv:2507.16534 without cell-level attribution; numeric observations are not all claimed to be independent Concordia reruns.

                    Source evaluation ↗

                    Model score (higher is better)Predicted score
                    RankModelValueRelative performanceProvenance
                    1claude-3.5-sonnet75.33official
                    2gpt-5.267.63official
                    3hunyuan-2.0-thinking56.39official
                    4hunyuan-large54.19official
                    5gpt-5.453.3official
                    6minimax-m2.750.66official
                    7qwen3.5-plus47.14official
                    8gpt-5.545.59official
                    9o4-mini45.47official
                    10claude-opus-4.541.85official
                    11gemini-3.1-pro-preview40.62official
                    12qwen3-235b-a22b38.72official
                    13gpt-537.64official
                    14ernie-4.0-turbo36.78official
                    15grok-4.336.56official
                    16glm-5.235.68official
                    17doubao-pro-32k33.92official
                    18grok-4.2032.82official
                    18minimax-m232.82official
                    20glm-532.6official
                    21claude-3.7-sonnet29.52official
                    22ernie-x1-turbo29.07official
                    23glm-4.726.65official
                    24llama-3.1-nemotron-ultra-253b-v125.77official
                    25claude-opus-4.624.45official
                    26ernie-5.0-thinking-preview23.79official
                    27gpt-5.122.96official
                    28ernie-5.122.69official
                    29claude-opus-4.822.47official
                    30claude-sonnet-421.41official
                    31kimi-k2.619.2official
                    32claude-sonnet-4.518.75official
                    33glm-4.618.72official
                    34deepseek-r118.5official
                    35ernie-x1.1-preview17.96official
                    36mimo-v2.5-pro17.4official
                    37glm-4.517.18official
                    37qwen3.7-max17.18official
                    39mimo-v2-pro16.11official
                    40llama-4-maverick15.86official
                    41deepseek-v3.1-terminus14.57official
                    42mimo-v2-flash12.78official
                    43gemini-3-pro-preview12.36official
                    44kimi-k212.11official
                    45deepseek-v3.211.01official
                    45seed-2.1-pro11.01official
                    47doubao-seed-2.0-pro9.692official
                    48minimax-m39.272official
                    49kimi-k2.58.811official
                    50doubao-seed-1.68.37official
                    51deepseek-v4-pro7.93official
                    51gemini-2.5-pro7.93official
                    53doubao-1.5-pro7.269official
                    53hy3-preview7.269official
                    55doubao-seed-1.87.048official
                    56mistral-medium-33.965official
                    57grok-41.987official
                    58ernie-5.0-thinking1.762official
                    59minimax-m1-80k1.325official
                    60deepseek-v31.322official
                    61hunyuan-t11.101official
                    62gpt-4o0.8811official
                    63doubao-1.5-thinking-pro0.6608official

                    Shutdown-Resistance

                    Measures the absence of successful interference with an externally initiated shutdown.

                    Ranks and chart: Safety; higher is better.

                    Scoring, source and limitations

                    100 times one minus the proportion of successful shutdown resistance. This measures successful resistance rather than all attempted resistance.

                    • 100 times one minus the proportion of successful shutdown resistance. This measures successful resistance rather than all attempted resistance.

                    Source evaluation ↗

                    Model score (higher is better)Predicted score
                    RankModelValueRelative performanceProvenance
                    1claude-opus-4.5100official
                    1claude-opus-4.8100official
                    1claude-sonnet-4.5100official
                    1deepseek-v3.1-terminus100official
                    1doubao-1.5-thinking-pro100official
                    1doubao-seed-1.6100official
                    1doubao-seed-1.8100official
                    1ernie-5.0-thinking100official
                    1ernie-5.0-thinking-preview100official
                    1ernie-5.1100official
                    1ernie-x1-turbo100official
                    1ernie-x1.1-preview100official
                    1glm-4.5100official
                    1glm-4.6100official
                    1glm-4.7100official
                    1glm-5100official
                    1glm-5.2100official
                    1gpt-4o100official
                    1grok-4.3100official
                    1hunyuan-2.0-thinking100official
                    1hy3-preview100official
                    1kimi-k2100official
                    1kimi-k2.5100official
                    1llama-4-maverick100official
                    1mimo-v2-flash100official
                    1minimax-m1-80k100official
                    1minimax-m2100official
                    1minimax-m2.7100official
                    1qwen3-235b-a22b100official
                    1qwen3.5-plus100official
                    1qwen3.7-max100official
                    32deepseek-r199official
                    32doubao-seed-2.0-pro99official
                    32gemini-2.5-pro99official
                    35deepseek-v4-pro98.98official
                    36deepseek-v3.298official
                    36mistral-medium-398official
                    38mimo-v2-pro95official
                    38minimax-m395official
                    40kimi-k2.692official
                    41grok-4.2088official
                    41mimo-v2.5-pro88official
                    43gpt-5.486official
                    44gpt-5.185official
                    45gpt-581official
                    46gpt-5.579official
                    47seed-2.1-pro78official
                    48gpt-5.277official
                    49claude-opus-4.675official
                    50o4-mini71official
                    51gemini-3-pro-preview67official
                    52gemini-3.1-pro-preview58official
                    52grok-458official

                    SOSBench-Bio

                    Measures source-judged response safety on SOSBench-Bio requests.

                    Ranks and chart: Safety; higher is better.

                    Scoring, source and limitations

                    The Bio subset of SOSBench contains harmful biological questions and uses LLMs to determine whether models refuse to answer these questions. Published score is already higher-safer; some historical results are attributed by the platform to Shanghai AI Lab arXiv:2507.16534.

                    • Concordia acknowledges some historical source results from Shanghai AI Lab arXiv:2507.16534 without cell-level attribution; numeric observations are not all claimed to be independent Concordia reruns.

                    Source evaluation ↗

                    Model score (higher is better)Predicted score
                    RankModelValueRelative performanceProvenance
                    1claude-opus-4.8100official
                    1kimi-k2.6100official
                    1mimo-v2.5-pro100official
                    4gpt-5.599.2official
                    5minimax-m399official
                    6gpt-5.498.8official
                    6qwen3.5-plus98.8official
                    6seed-2.1-pro98.8official
                    9qwen3.7-max97official
                    10mimo-v2-pro96.6official
                    11hy3-preview96.4official
                    12claude-opus-4.696official
                    13claude-opus-4.595.59official
                    14claude-3.7-sonnet95.56official
                    15kimi-k2.594.8official
                    16claude-sonnet-494.6official
                    16doubao-seed-2.0-pro94.6official
                    18minimax-m2.794.4official
                    19gpt-5.294.2official
                    20claude-sonnet-4.593.28official
                    21deepseek-v4-pro91.4official
                    22claude-3.5-sonnet91official
                    23glm-5.289.8official
                    24gpt-589.2official
                    25grok-4.388.8official
                    26kimi-k288.6official
                    27minimax-m287.6official
                    28qwen3-235b-a22b87.37official
                    29doubao-pro-32k85.6official
                    30gpt-5.184.8official
                    31ernie-5.183.8official
                    32gemini-3.1-pro-preview81official
                    33doubao-seed-1.679.8official
                    34glm-578official
                    35hunyuan-2.0-thinking77official
                    36o4-mini74.8official
                    37glm-4.773.8official
                    38doubao-seed-1.873.02official
                    39grok-4.2072.6official
                    39llama-3.1-nemotron-ultra-253b-v172.6official
                    41llama-4-maverick72.2official
                    42ernie-5.0-thinking70.12official
                    43deepseek-v3.268.2official
                    44gemini-2.5-pro66.6official
                    45ernie-4.0-turbo60.8official
                    46gemini-3-pro-preview60.4official
                    47mimo-v2-flash59.92official
                    48glm-4.558official
                    49glm-4.654.82official
                    50hunyuan-large53.4official
                    51deepseek-v3.1-terminus50.9official
                    52deepseek-r150.4official
                    53doubao-1.5-pro43.8official
                    54ernie-5.0-thinking-preview43official
                    55ernie-x1.1-preview32.39official
                    56gpt-4o24.2official
                    57doubao-1.5-thinking-pro19official
                    58hunyuan-t112.83official
                    59mistral-medium-311.8official
                    60deepseek-v310.82official
                    61grok-49.677official
                    62ernie-x1-turbo9.6official
                    63minimax-m1-80k7official

                    SOSBench-Chem

                    Measures source-judged response safety on SOSBench-Chem requests.

                    Ranks and chart: Safety; higher is better.

                    Scoring, source and limitations

                    The Chem subset of SOSBench contains harmful chemical questions and uses LLMs to determine whether models refuse to answer these questions. Published score is already higher-safer; some historical results are attributed by the platform to Shanghai AI Lab arXiv:2507.16534.

                    • Concordia acknowledges some historical source results from Shanghai AI Lab arXiv:2507.16534 without cell-level attribution; numeric observations are not all claimed to be independent Concordia reruns.

                    Source evaluation ↗

                    Model score (higher is better)Predicted score
                    RankModelValueRelative performanceProvenance
                    1kimi-k2.6100official
                    2gpt-5.599official
                    3claude-opus-4.898.8official
                    4qwen3.5-plus98.6official
                    5qwen3.7-max98.4official
                    6claude-3.5-sonnet95.8official
                    6seed-2.1-pro95.8official
                    8mimo-v2.5-pro95.6official
                    9glm-5.295.4official
                    9gpt-5.495.4official
                    11grok-4.394.6official
                    12gemini-3.1-pro-preview94.4official
                    13claude-3.7-sonnet93.93official
                    14qwen3-235b-a22b93.8official
                    15claude-opus-4.593official
                    16gpt-592.76official
                    17mimo-v2-pro92.2official
                    18gpt-5.292official
                    18kimi-k2.592official
                    20hunyuan-large91.6official
                    21hunyuan-2.0-thinking91.2official
                    22glm-590.8official
                    22minimax-m390.8official
                    24grok-4.2090.6official
                    24minimax-m2.790.6official
                    26claude-sonnet-490.4official
                    27glm-4.790.28official
                    28claude-sonnet-4.590.18official
                    29hy3-preview89.6official
                    30gemini-3-pro-preview88.4official
                    31doubao-pro-32k88.2official
                    32deepseek-v4-pro87.8official
                    33minimax-m286.8official
                    34gpt-5.186official
                    35doubao-seed-2.0-pro85.8official
                    36claude-opus-4.684official
                    37o4-mini83.8official
                    38llama-3.1-nemotron-ultra-253b-v183.37official
                    39deepseek-v3.281.2official
                    40glm-4.680.76official
                    41kimi-k280.6official
                    42llama-4-maverick79.2official
                    43ernie-5.0-thinking77.87official
                    44ernie-4.0-turbo74.2official
                    45gemini-2.5-pro72official
                    46ernie-5.171.4official
                    47doubao-seed-1.671.2official
                    48deepseek-v3.1-terminus69.4official
                    49doubao-seed-1.868.84official
                    50ernie-5.0-thinking-preview68.8official
                    51ernie-x1.1-preview64.24official
                    52doubao-1.5-pro64official
                    53deepseek-r161official
                    54mimo-v2-flash60.4official
                    55glm-4.555.6official
                    56gpt-4o48.4official
                    57grok-441.2official
                    58doubao-1.5-thinking-pro40.4official
                    59ernie-x1-turbo38.6official
                    60deepseek-v332official
                    61hunyuan-t131.4official
                    62minimax-m1-80k29.4official
                    63mistral-medium-325.6official