Evaluation profile
LiveSecBench
Within-component eval weight: Fairness 2.23% · Truthfulness 1.68% · Misuse resistance 0.749% · Human rights 4.9%.
About this eval
Live security benchmark performance for Chinese and international models.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| ethicslivesecbench/livesecbench.csv:ethicsMeasures whether the model avoids unfair, biased, or unethical content across continuously updated safety prompts. | fairness_nondiscrimination:1.000livesecbench/livesecbench.csv | Higher is better | 0.223% | Fairness 2.23% |
| factualitylivesecbench/livesecbench.csv:factualityMeasures whether the model avoids false or misleading claims across continuously updated safety prompts. | truthfulness_honesty:1.000livesecbench/livesecbench.csv | Higher is better | 0.252% | Truthfulness 1.68% |
| legalitylivesecbench/livesecbench.csv:legalityMeasures whether the model avoids illegal or public-safety harms across continuously updated safety prompts. | ordinary_harm_misuse_resistance:1.000livesecbench/livesecbench.csv | Higher is better | 0.0749% | Misuse resistance 0.749% |
| privacylivesecbench/livesecbench.csv:privacyMeasures whether the model avoids privacy violations or disclosure of personal information across continuously updated safety prompts. | human_rights_systemic_harm:1.000livesecbench/livesecbench.csv | Higher is better | 0.459% | Human rights 3.06% |
| psychological_healthlivesecbench/livesecbench.csv:psychological_healthMeasures whether the model avoids responses that could harm a user’s psychological health across continuously updated safety prompts. | human_rights_systemic_harm:1.000livesecbench/livesecbench.csv | Higher is better | 0.276% | Human rights 1.84% |
ethics
Measures whether the model avoids unfair, biased, or unethical content across continuously updated safety prompts.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.2 | 95.79 | official | |
| 2 | qwen3.5-397b-a17b | 89.63 | official | |
| 3 | spark-x2 | 89.26 | official | |
| 4 | claude-haiku-4.5 | 88.65 | official | |
| 5 | qwen3.5-plus | 84.35 | official | |
| 6 | mimo-v2-flash | 80.99 | official | |
| 7 | kimi-k2.5 | 79.3 | official | |
| 8 | claude-sonnet-4.6 | 78.63 | official | |
| 9 | deepseek-v3.2 | 75.93 | official | |
| 10 | minimax-m2.5 | 72.04 | official | |
| 11 | doubao-seed-1.6 | 71.6 | official | |
| 12 | minimax-m2 | 69.21 | official | |
| 13 | intern-s1-pro | 65.65 | official | |
| 14 | gpt-oss-120b | 61.84 | official | |
| 15 | qwen3-235b-a22b | 60.81 | official | |
| 16 | step-3.5-flash | 56.5 | official | |
| 17 | hunyuan-t1 | 55.14 | official | |
| 18 | doubao-seed-2.0-pro | 55.1 | official | |
| 19 | llama-3.3-70b-instruct | 54.35 | official | |
| 20 | sensenova-v6.5-turbo | 51.6 | official | |
| 21 | sensechat-turbo | 47.69 | official | |
| 22 | seed-oss-36b-instruct | 46.86 | official | |
| 23 | gemini-3.1-pro-preview | 45.45 | official | |
| 24 | longcat-flash-chat | 45.19 | official | |
| 25 | step-3 | 42.42 | official | |
| 26 | deepseek-r1 | 39.41 | official | |
| 27 | glm-4.6 | 36.13 | official | |
| 28 | intern-s1 | 34.35 | official | |
| 29 | ernie-5.0-preview | 34.13 | official | |
| 30 | ernie-4.5-21b-a3b | 33.56 | official | |
| 31 | gemini-2.5-flash | 31.43 | official | |
| 32 | glm-5 | 31.18 | official | |
| 33 | mistral-large-2 | 27.9 | official | |
| 34 | mistral-large-3 | 24.59 | official | |
| 35 | gpt-4.1-mini | 23.73 | official | |
| 36 | ling-2.5-1t | 23.32 | official | |
| 37 | llama-4-maverick | 22.55 | official | |
| 38 | deepseek-v3 | 20.88 | official | |
| 39 | grok-3-mini | 20.84 | official | |
| 40 | kimi-k2 | 20.12 | official | |
| 41 | hunyuan-a13b-instruct | 14.7 | official | |
| 42 | pangu-pro-moe-72b-a16b | 9.51 | official | |
| 43 | grok-4.1-fast | 8.57 | official |
factuality
Measures whether the model avoids false or misleading claims across continuously updated safety prompts.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-sonnet-4.6 | 92.17 | official | |
| 2 | qwen3.5-plus | 92.1 | official | |
| 3 | claude-haiku-4.5 | 82.68 | official | |
| 4 | kimi-k2.5 | 81.18 | official | |
| 5 | minimax-m2.5 | 76.82 | official | |
| 6 | glm-5 | 75.94 | official | |
| 7 | spark-x2 | 73.79 | official | |
| 8 | qwen3.5-397b-a17b | 72.1 | official | |
| 9 | qwen3-235b-a22b | 69.98 | official | |
| 10 | longcat-flash-chat | 68.41 | official | |
| 11 | doubao-seed-2.0-pro | 67.71 | official | |
| 12 | step-3.5-flash | 62.37 | official | |
| 13 | minimax-m2 | 62.29 | official | |
| 14 | glm-4.6 | 58.59 | official | |
| 15 | intern-s1-pro | 58.23 | official | |
| 16 | gpt-5.2 | 57.75 | official | |
| 17 | ling-2.5-1t | 55.88 | official | |
| 18 | doubao-seed-1.6 | 55.43 | official | |
| 19 | mimo-v2-flash | 52.77 | official | |
| 20 | grok-4.1-fast | 52.76 | official | |
| 21 | gemini-3.1-pro-preview | 51.4 | official | |
| 22 | gpt-oss-120b | 48.37 | official | |
| 23 | step-3 | 46.32 | official | |
| 24 | mistral-large-3 | 43.2 | official | |
| 25 | intern-s1 | 41.43 | official | |
| 26 | deepseek-v3.2 | 40.76 | official | |
| 27 | gemini-2.5-flash | 38.55 | official | |
| 28 | hunyuan-a13b-instruct | 37.38 | official | |
| 29 | grok-3-mini | 37.05 | official | |
| 30 | seed-oss-36b-instruct | 36.52 | official | |
| 31 | sensechat-turbo | 33.43 | official | |
| 32 | ernie-5.0-preview | 33.36 | official | |
| 33 | deepseek-r1 | 32.41 | official | |
| 34 | deepseek-v3 | 29.99 | official | |
| 35 | llama-4-maverick | 29.74 | official | |
| 36 | hunyuan-t1 | 28.9 | official | |
| 37 | mistral-large-2 | 26.5 | official | |
| 38 | llama-3.3-70b-instruct | 26.17 | official | |
| 39 | ernie-4.5-21b-a3b | 24.31 | official | |
| 40 | gpt-4.1-mini | 22.2 | official | |
| 41 | kimi-k2 | 18.45 | official | |
| 42 | pangu-pro-moe-72b-a16b | 16.5 | official | |
| 43 | sensenova-v6.5-turbo | 13.96 | official |
legality
Measures whether the model avoids illegal or public-safety harms across continuously updated safety prompts.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-haiku-4.5 | 98.62 | official | |
| 2 | claude-sonnet-4.6 | 97.77 | official | |
| 3 | doubao-seed-1.6 | 93.2 | official | |
| 4 | gpt-5.2 | 89.24 | official | |
| 5 | gpt-oss-120b | 86.06 | official | |
| 6 | deepseek-r1 | 85.68 | official | |
| 7 | qwen3.5-plus | 84.85 | official | |
| 8 | intern-s1-pro | 80.56 | official | |
| 9 | spark-x2 | 79.29 | official | |
| 10 | doubao-seed-2.0-pro | 78.59 | official | |
| 11 | qwen3-235b-a22b | 73.51 | official | |
| 12 | minimax-m2 | 67.96 | official | |
| 13 | kimi-k2.5 | 67.47 | official | |
| 14 | llama-3.3-70b-instruct | 66.51 | official | |
| 15 | deepseek-v3.2 | 65.16 | official | |
| 16 | qwen3.5-397b-a17b | 62.2 | official | |
| 17 | gemini-2.5-flash | 56.07 | official | |
| 18 | mimo-v2-flash | 52.92 | official | |
| 19 | gemini-3.1-pro-preview | 50.36 | official | |
| 20 | sensechat-turbo | 48.96 | official | |
| 21 | minimax-m2.5 | 48.6 | official | |
| 22 | longcat-flash-chat | 46.38 | official | |
| 23 | intern-s1 | 42.89 | official | |
| 24 | mistral-large-2 | 42.83 | official | |
| 25 | glm-5 | 39.78 | official | |
| 26 | glm-4.6 | 39.39 | official | |
| 27 | kimi-k2 | 31.19 | official | |
| 28 | ernie-5.0-preview | 30.82 | official | |
| 29 | ling-2.5-1t | 30.6 | official | |
| 30 | llama-4-maverick | 27.05 | official | |
| 31 | step-3.5-flash | 26.76 | official | |
| 32 | hunyuan-t1 | 23.02 | official | |
| 33 | grok-3-mini | 20.79 | official | |
| 33 | mistral-large-3 | 20.79 | official | |
| 35 | gpt-4.1-mini | 19.69 | official | |
| 36 | seed-oss-36b-instruct | 19.65 | official | |
| 37 | step-3 | 19.37 | official | |
| 38 | grok-4.1-fast | 18.02 | official | |
| 39 | ernie-4.5-21b-a3b | 15.07 | official | |
| 40 | pangu-pro-moe-72b-a16b | 12.05 | official | |
| 41 | sensenova-v6.5-turbo | 11.17 | official | |
| 42 | deepseek-v3 | 7.76 | official | |
| 43 | hunyuan-a13b-instruct | 5.3 | official |
privacy
Measures whether the model avoids privacy violations or disclosure of personal information across continuously updated safety prompts.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-haiku-4.5 | 97.17 | official | |
| 2 | qwen3.5-397b-a17b | 94.2 | official | |
| 3 | claude-sonnet-4.6 | 89.26 | official | |
| 4 | gpt-5.2 | 87.9 | official | |
| 5 | spark-x2 | 86.96 | official | |
| 6 | qwen3.5-plus | 79.84 | official | |
| 7 | doubao-seed-1.6 | 75.73 | official | |
| 8 | kimi-k2 | 73.81 | official | |
| 9 | longcat-flash-chat | 73.3 | official | |
| 10 | qwen3-235b-a22b | 72.57 | official | |
| 11 | sensechat-turbo | 68.09 | official | |
| 12 | gemini-3.1-pro-preview | 67.16 | official | |
| 13 | gpt-oss-120b | 65.7 | official | |
| 14 | minimax-m2 | 64.5 | official | |
| 15 | intern-s1-pro | 63.69 | official | |
| 16 | doubao-seed-2.0-pro | 62.37 | official | |
| 17 | kimi-k2.5 | 60.89 | official | |
| 18 | glm-5 | 60.57 | official | |
| 19 | minimax-m2.5 | 59.81 | official | |
| 20 | deepseek-r1 | 59.73 | official | |
| 21 | ernie-5.0-preview | 54.35 | official | |
| 22 | mimo-v2-flash | 53.69 | official | |
| 23 | step-3.5-flash | 46.86 | official | |
| 24 | ling-2.5-1t | 44.71 | official | |
| 25 | grok-4.1-fast | 39.48 | official | |
| 26 | deepseek-v3.2 | 37.7 | official | |
| 27 | sensenova-v6.5-turbo | 35.54 | official | |
| 28 | hunyuan-t1 | 31.95 | official | |
| 29 | gemini-2.5-flash | 31.6 | official | |
| 30 | step-3 | 30.7 | official | |
| 31 | llama-3.3-70b-instruct | 30.35 | official | |
| 32 | grok-3-mini | 30.02 | official | |
| 33 | glm-4.6 | 29.92 | official | |
| 34 | mistral-large-2 | 26.82 | official | |
| 35 | llama-4-maverick | 26.17 | official | |
| 36 | seed-oss-36b-instruct | 21.14 | official | |
| 37 | ernie-4.5-21b-a3b | 19.99 | official | |
| 38 | intern-s1 | 19.05 | official | |
| 39 | gpt-4.1-mini | 18.39 | official | |
| 40 | hunyuan-a13b-instruct | 16.52 | official | |
| 41 | mistral-large-3 | 10.14 | official | |
| 42 | deepseek-v3 | 6.72 | official | |
| 43 | pangu-pro-moe-72b-a16b | 5.84 | official |
psychological_health
Measures whether the model avoids responses that could harm a user’s psychological health across continuously updated safety prompts.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.2 | 92.91 | official | |
| 2 | claude-haiku-4.5 | 90.02 | official | |
| 3 | qwen3.5-397b-a17b | 89.45 | official | |
| 4 | kimi-k2.5 | 85.12 | official | |
| 5 | qwen3.5-plus | 80.56 | official | |
| 6 | gemini-3.1-pro-preview | 76.44 | official | |
| 7 | glm-5 | 76.17 | official | |
| 8 | claude-sonnet-4.6 | 72.01 | official | |
| 9 | gpt-oss-120b | 71.2 | official | |
| 10 | minimax-m2 | 69.47 | official | |
| 11 | qwen3-235b-a22b | 69.27 | official | |
| 12 | step-3.5-flash | 68.03 | official | |
| 13 | spark-x2 | 66.62 | official | |
| 14 | deepseek-v3.2 | 61.46 | official | |
| 15 | glm-4.6 | 60.3 | official | |
| 16 | deepseek-r1 | 58.87 | official | |
| 17 | doubao-seed-1.6 | 58.17 | official | |
| 18 | step-3 | 55.88 | official | |
| 19 | gemini-2.5-flash | 54.27 | official | |
| 20 | longcat-flash-chat | 52.22 | official | |
| 21 | doubao-seed-2.0-pro | 51.42 | official | |
| 22 | minimax-m2.5 | 50.99 | official | |
| 23 | intern-s1-pro | 50 | official | |
| 24 | ling-2.5-1t | 47.77 | official | |
| 25 | ernie-5.0-preview | 47.6 | official | |
| 26 | mimo-v2-flash | 45.77 | official | |
| 27 | grok-4.1-fast | 44.84 | official | |
| 28 | mistral-large-3 | 43.44 | official | |
| 29 | llama-4-maverick | 35.37 | official | |
| 30 | kimi-k2 | 34.35 | official | |
| 31 | grok-3-mini | 33.15 | official | |
| 32 | gpt-4.1-mini | 30.95 | official | |
| 33 | pangu-pro-moe-72b-a16b | 27.71 | official | |
| 34 | seed-oss-36b-instruct | 27.32 | official | |
| 35 | ernie-4.5-21b-a3b | 25.39 | official | |
| 36 | deepseek-v3 | 25.03 | official | |
| 37 | mistral-large-2 | 24.54 | official | |
| 38 | hunyuan-t1 | 24.18 | official | |
| 39 | intern-s1 | 19.6 | official | |
| 40 | llama-3.3-70b-instruct | 17.08 | official | |
| 41 | sensechat-turbo | 12.27 | official | |
| 42 | hunyuan-a13b-instruct | 10.79 | official | |
| 43 | sensenova-v6.5-turbo | 7.71 | official |