Evaluation profile
DystopiaBench
Within-component eval weight: Human rights 16.6% · Truthfulness 1.01%.
About this eval
Dystopian or harmful model behavior in stateful scenario prompts.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| basaglia_scoredystopiabench/model-module-averages.csv:basaglia_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about therapeutic coercion, institutional paternalism, and behavioral compliance. | human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csv | Lower is better | 0.555% | Human rights 3.7% |
| baudrillard_scoredystopiabench/model-module-averages.csv:baudrillard_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about synthetic intimacy, persuasion, and exploitation. | human_rights_systemic_harm:0.333|truthfulness_honesty:0.667dystopiabench/model-module-averages.csv | Lower is better | 0.194% | Human rights 0.616% · Truthfulness 0.676% |
| huxley_scoredystopiabench/model-module-averages.csv:huxley_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about biological stratification, behavioral conditioning, and pleasure-based pacification. | human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csv | Lower is better | 0.555% | Human rights 3.7% |
| laguardia_scoredystopiabench/model-module-averages.csv:laguardia_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about infrastructure capture, administrative coercion, and institutional capture. | human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csv | Lower is better | 0.555% | Human rights 3.7% |
| orwell_scoredystopiabench/model-module-averages.csv:orwell_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about surveillance, population control, and truth manipulation. | human_rights_systemic_harm:0.667|truthfulness_honesty:0.333dystopiabench/model-module-averages.csv | Lower is better | 0.236% | Human rights 1.23% · Truthfulness 0.337% |
| petrov_scoredystopiabench/model-module-averages.csv:petrov_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about safety overrides, autonomous weapons, and emergency authority. | human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csv | Lower is better | 0.555% | Human rights 3.7% |
basaglia_score
Measures whether the model endorses coercive or authoritarian actions in scenarios about therapeutic coercion, institutional paternalism, and behavioral compliance.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.8 | 18.7 | official | |
| 2 | claude-sonnet-4.6 | 24.2 | official | |
| 3 | claude-haiku-4.5 | 25.3 | official | |
| 4 | claude-opus-4.7 | 26.03 | official | |
| 5 | claude-opus-4.6 | 26.77 | official | |
| 6 | glm-5.1 | 28.23 | official | |
| 7 | mimo-v2.5 | 30.8 | official | |
| 8 | mimo-v2.5-pro | 33.37 | official | |
| 9 | glm-5 | 34.47 | official | |
| 10 | minimax-m3 | 37.07 | official | |
| 11 | minimax-m2.5 | 44.73 | official | |
| 12 | minimax-m2.7 | 46.93 | official | |
| 13 | gpt-5.4 | 47.3 | official | |
| 14 | gpt-5.4-mini | 49.13 | official | |
| 15 | nemotron-3-ultra-550b-a55b | 52.9 | official | |
| 16 | kimi-k2.7-code | 54.3 | official | |
| 17 | gpt-5.5 | 55 | official | |
| 18 | gemini-3.1-pro | 55.37 | official | |
| 19 | qwen3.5 | 56.9 | official | |
| 20 | kimi-k2.5 | 59.1 | official | |
| 21 | gpt-5.3-codex | 59.4 | official | |
| 22 | grok-4.20-multi-agent | 60.2 | official | |
| 23 | deepseek-v4-flash | 60.9 | official | |
| 24 | kimi-k2.6 | 62.57 | official | |
| 25 | seed-2.0-lite | 63.87 | official | |
| 26 | deepseek-v4-pro | 64.6 | official | |
| 27 | llama-4-maverick | 64.93 | official | |
| 28 | grok-4 | 65.3 | official | |
| 29 | nemotron-3-super-120b-a12b | 65.33 | official | |
| 30 | grok-4.3 | 65.37 | official | |
| 31 | gpt-oss-120b | 65.67 | official | |
| 32 | grok-build-0.1 | 65.8 | official | |
| 33 | seed-2.0-mini | 66.83 | official | |
| 34 | llama-4-scout | 67.87 | official | |
| 35 | mistral-small-4 | 68.57 | official | |
| 36 | gpt-oss-safeguard-20b | 68.63 | official | |
| 36 | qwen3.6-max-preview | 68.63 | official | |
| 38 | qwen3.6-plus | 69 | official | |
| 39 | deepseek-v3.2 | 69.37 | official | |
| 40 | gemini-3.1-flash-lite | 69.4 | official | |
| 41 | mistral-large-3 | 69.8 | official | |
| 42 | gpt-oss-20b | 70.13 | official | |
| 43 | qwen3.7-plus | 70.23 | official | |
| 44 | grok-4.20 | 70.5 | official | |
| 45 | gemini-3.5-flash | 70.93 | official | |
| 46 | trinity-large | 71.4 | official | |
| 47 | gemini-3-flash-preview | 73.2 | official | |
| 48 | qwen3.7-max | 75.47 | official | |
| 49 | hy3-preview | 77.33 | official | |
| 50 | mistral-medium-3.5 | 77.7 | official |
baudrillard_score
Measures whether the model endorses coercive or authoritarian actions in scenarios about synthetic intimacy, persuasion, and exploitation.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.8 | 21.27 | official | |
| 2 | claude-haiku-4.5 | 22.73 | official | |
| 3 | glm-5.1 | 26.03 | official | |
| 4 | mimo-v2.5 | 27.13 | official | |
| 5 | claude-opus-4.7 | 27.5 | official | |
| 6 | claude-sonnet-4.6 | 27.87 | official | |
| 7 | glm-5 | 28.97 | official | |
| 8 | minimax-m2.5 | 31.17 | official | |
| 9 | minimax-m3 | 33.03 | official | |
| 10 | claude-opus-4.6 | 33.37 | official | |
| 11 | minimax-m2.7 | 34.1 | official | |
| 12 | gpt-5.4 | 38.87 | official | |
| 12 | gpt-5.4-mini | 38.87 | official | |
| 14 | gpt-5.5 | 40.7 | official | |
| 14 | kimi-k2.7-code | 40.7 | official | |
| 16 | nemotron-3-ultra-550b-a55b | 43.33 | official | |
| 17 | kimi-k2.5 | 44.77 | official | |
| 18 | gpt-5.3-codex | 45.47 | official | |
| 19 | kimi-k2.6 | 46.73 | official | |
| 20 | mimo-v2.5-pro | 51.07 | official | |
| 21 | grok-build-0.1 | 52.13 | official | |
| 22 | nemotron-3-super-120b-a12b | 53.23 | official | |
| 23 | qwen3.5 | 53.27 | official | |
| 24 | qwen3.7-plus | 56.33 | official | |
| 25 | grok-4 | 57.7 | official | |
| 26 | gemini-3.1-pro | 57.8 | official | |
| 27 | deepseek-v4-flash | 58.1 | official | |
| 28 | trinity-large | 58.53 | official | |
| 29 | grok-4.20-multi-agent | 61.77 | official | |
| 29 | grok-4.3 | 61.77 | official | |
| 31 | deepseek-v4-pro | 62.2 | official | |
| 32 | qwen3.7-max | 62.97 | official | |
| 33 | gpt-oss-120b | 64.03 | official | |
| 34 | gpt-oss-safeguard-20b | 64.37 | official | |
| 35 | gemini-3.1-flash-lite | 65.2 | official | |
| 36 | llama-4-maverick | 65.83 | official | |
| 37 | gpt-oss-20b | 66.3 | official | |
| 38 | qwen3.6-max-preview | 66.57 | official | |
| 39 | gemini-3.5-flash | 66.63 | official | |
| 40 | seed-2.0-lite | 67.33 | official | |
| 41 | grok-4.20 | 67.37 | official | |
| 42 | deepseek-v3.2 | 70.33 | official | |
| 43 | seed-2.0-mini | 73.6 | official | |
| 44 | qwen3.6-plus | 73.63 | official | |
| 45 | llama-4-scout | 74.3 | official | |
| 46 | hy3-preview | 76.3 | official | |
| 47 | mistral-large-3 | 77.73 | official | |
| 48 | mistral-medium-3.5 | 79.27 | official | |
| 49 | mistral-small-4 | 80 | official | |
| 50 | gemini-3-flash-preview | 81.13 | official |
huxley_score
Measures whether the model endorses coercive or authoritarian actions in scenarios about biological stratification, behavioral conditioning, and pleasure-based pacification.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.8 | 10.63 | official | |
| 2 | claude-opus-4.6 | 15.77 | official | |
| 3 | claude-sonnet-4.6 | 17.6 | official | |
| 4 | claude-opus-4.7 | 18.33 | official | |
| 5 | glm-5.1 | 18.7 | official | |
| 6 | claude-haiku-4.5 | 19.07 | official | |
| 7 | mimo-v2.5-pro | 26.03 | official | |
| 8 | glm-5 | 27.5 | official | |
| 9 | minimax-m3 | 33.03 | official | |
| 10 | mimo-v2.5 | 33.8 | official | |
| 11 | gpt-5.4-mini | 45.1 | official | |
| 12 | minimax-m2.7 | 45.9 | official | |
| 13 | gpt-5.4 | 46.2 | official | |
| 14 | gemini-3.1-pro | 49.97 | official | |
| 15 | gpt-5.5 | 52.5 | official | |
| 16 | gpt-5.3-codex | 53.17 | official | |
| 17 | kimi-k2.7-code | 54 | official | |
| 18 | minimax-m2.5 | 54.33 | official | |
| 19 | qwen3.5 | 59.2 | official | |
| 20 | kimi-k2.5 | 62.6 | official | |
| 21 | kimi-k2.6 | 63.03 | official | |
| 22 | nemotron-3-ultra-550b-a55b | 68.2 | official | |
| 23 | nemotron-3-super-120b-a12b | 69.47 | official | |
| 24 | llama-4-scout | 70.13 | official | |
| 25 | grok-4.3 | 71.63 | official | |
| 26 | gpt-oss-safeguard-20b | 72 | official | |
| 27 | deepseek-v4-flash | 72.8 | official | |
| 27 | llama-4-maverick | 72.8 | official | |
| 29 | seed-2.0-mini | 72.93 | official | |
| 30 | grok-4 | 73.17 | official | |
| 31 | grok-4.20-multi-agent | 74 | official | |
| 32 | seed-2.0-lite | 74.33 | official | |
| 33 | gpt-oss-120b | 74.63 | official | |
| 34 | grok-build-0.1 | 74.77 | official | |
| 35 | deepseek-v3.2 | 75 | official | |
| 36 | grok-4.20 | 75.07 | official | |
| 37 | gpt-oss-20b | 75.47 | official | |
| 38 | mistral-large-3 | 75.8 | official | |
| 38 | qwen3.6-max-preview | 75.8 | official | |
| 40 | mistral-small-4 | 76.17 | official | |
| 41 | deepseek-v4-pro | 76.97 | official | |
| 42 | qwen3.6-plus | 77.27 | official | |
| 43 | gemini-3.5-flash | 79.23 | official | |
| 44 | gemini-3.1-flash-lite | 80.73 | official | |
| 45 | qwen3.7-plus | 80.77 | official | |
| 46 | trinity-large | 80.8 | official | |
| 47 | gemini-3-flash-preview | 83 | official | |
| 48 | hy3-preview | 84.5 | official | |
| 49 | qwen3.7-max | 86.03 | official | |
| 50 | mistral-medium-3.5 | 86.8 | official |
laguardia_score
Measures whether the model endorses coercive or authoritarian actions in scenarios about infrastructure capture, administrative coercion, and institutional capture.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.8 | 22 | official | |
| 2 | claude-opus-4.7 | 30.07 | official | |
| 3 | claude-sonnet-4.6 | 33 | official | |
| 4 | claude-haiku-4.5 | 34.47 | official | |
| 5 | mimo-v2.5-pro | 37.03 | official | |
| 6 | claude-opus-4.6 | 39.23 | official | |
| 7 | mimo-v2.5 | 39.97 | official | |
| 8 | glm-5 | 40.33 | official | |
| 9 | glm-5.1 | 40.7 | official | |
| 10 | gpt-5.4 | 46.57 | official | |
| 11 | gpt-5.4-mini | 52.8 | official | |
| 12 | kimi-k2.6 | 53.97 | official | |
| 13 | minimax-m3 | 54.27 | official | |
| 14 | kimi-k2.7-code | 55.03 | official | |
| 15 | grok-4 | 59.07 | official | |
| 16 | minimax-m2.7 | 59.8 | official | |
| 17 | gpt-5.5 | 60.13 | official | |
| 18 | qwen3.5 | 60.17 | official | |
| 19 | gemini-3.1-pro | 61.97 | official | |
| 20 | gpt-5.3-codex | 62.37 | official | |
| 20 | kimi-k2.5 | 62.37 | official | |
| 22 | minimax-m2.5 | 63.47 | official | |
| 23 | grok-4.20-multi-agent | 65.3 | official | |
| 24 | seed-2.0-mini | 66.47 | official | |
| 25 | llama-4-maverick | 66.73 | official | |
| 26 | nemotron-3-super-120b-a12b | 67.17 | official | |
| 27 | qwen3.7-plus | 67.2 | official | |
| 28 | nemotron-3-ultra-550b-a55b | 67.6 | official | |
| 29 | llama-4-scout | 67.9 | official | |
| 29 | mistral-small-4 | 67.9 | official | |
| 31 | gpt-oss-20b | 68.27 | official | |
| 32 | gpt-oss-120b | 68.63 | official | |
| 33 | qwen3.6-plus | 68.67 | official | |
| 34 | qwen3.7-max | 68.7 | official | |
| 34 | seed-2.0-lite | 68.7 | official | |
| 36 | mistral-large-3 | 69 | official | |
| 37 | deepseek-v3.2 | 69.03 | official | |
| 37 | deepseek-v4-flash | 69.03 | official | |
| 39 | gpt-oss-safeguard-20b | 69.4 | official | |
| 39 | qwen3.6-max-preview | 69.4 | official | |
| 41 | gemini-3.1-flash-lite | 69.77 | official | |
| 42 | deepseek-v4-pro | 69.8 | official | |
| 42 | grok-4.20 | 69.8 | official | |
| 44 | gemini-3.5-flash | 70.9 | official | |
| 45 | grok-4.3 | 71.3 | official | |
| 46 | gemini-3-flash-preview | 71.63 | official | |
| 47 | grok-build-0.1 | 73.17 | official | |
| 47 | trinity-large | 73.17 | official | |
| 49 | hy3-preview | 73.93 | official | |
| 50 | mistral-medium-3.5 | 76.57 | official |
orwell_score
Measures whether the model endorses coercive or authoritarian actions in scenarios about surveillance, population control, and truth manipulation.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.8 | 17.6 | official | |
| 2 | claude-haiku-4.5 | 21.63 | official | |
| 3 | claude-opus-4.7 | 22.73 | official | |
| 4 | claude-opus-4.6 | 23.47 | official | |
| 5 | claude-sonnet-4.6 | 24.57 | official | |
| 6 | mimo-v2.5-pro | 26.03 | official | |
| 7 | glm-5.1 | 26.77 | official | |
| 8 | glm-5 | 27.87 | official | |
| 9 | mimo-v2.5 | 30.8 | official | |
| 10 | minimax-m3 | 36 | official | |
| 11 | minimax-m2.7 | 41.07 | official | |
| 12 | gpt-5.4-mini | 41.8 | official | |
| 13 | gpt-5.4 | 44.4 | official | |
| 14 | minimax-m2.5 | 45.1 | official | |
| 15 | gpt-5.5 | 49.5 | official | |
| 16 | qwen3.5 | 52.87 | official | |
| 17 | kimi-k2.7-code | 53.67 | official | |
| 18 | nemotron-3-ultra-550b-a55b | 55.93 | official | |
| 19 | kimi-k2.5 | 56.97 | official | |
| 20 | gpt-5.3-codex | 57.3 | official | |
| 21 | gemini-3.1-pro | 59.17 | official | |
| 22 | kimi-k2.6 | 62.3 | official | |
| 23 | llama-4-maverick | 68.6 | official | |
| 23 | llama-4-scout | 68.6 | official | |
| 25 | grok-4 | 68.63 | official | |
| 25 | nemotron-3-super-120b-a12b | 68.63 | official | |
| 27 | gpt-oss-120b | 68.8 | official | |
| 28 | deepseek-v4-flash | 69.83 | official | |
| 29 | mistral-large-3 | 70.93 | official | |
| 30 | grok-4.3 | 72.07 | official | |
| 31 | gemini-3-flash-preview | 72.43 | official | |
| 32 | deepseek-v3.2 | 72.83 | official | |
| 33 | grok-4.20-multi-agent | 72.9 | official | |
| 34 | qwen3.6-max-preview | 73.17 | official | |
| 35 | gpt-oss-20b | 73.53 | official | |
| 35 | gpt-oss-safeguard-20b | 73.53 | official | |
| 35 | mistral-small-4 | 73.53 | official | |
| 38 | qwen3.6-plus | 73.9 | official | |
| 39 | gemini-3.1-flash-lite | 73.97 | official | |
| 40 | deepseek-v4-pro | 74 | official | |
| 41 | seed-2.0-mini | 75.03 | official | |
| 42 | grok-4.20 | 75.07 | official | |
| 42 | seed-2.0-lite | 75.07 | official | |
| 44 | trinity-large | 75.1 | official | |
| 45 | gemini-3.5-flash | 75.17 | official | |
| 46 | grok-build-0.1 | 77.07 | official | |
| 47 | qwen3.7-plus | 80.4 | official | |
| 48 | hy3-preview | 82.23 | official | |
| 48 | qwen3.7-max | 82.23 | official | |
| 50 | mistral-medium-3.5 | 82.27 | official |
petrov_score
Measures whether the model endorses coercive or authoritarian actions in scenarios about safety overrides, autonomous weapons, and emergency authority.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-haiku-4.5 | 19.8 | official | |
| 2 | claude-opus-4.8 | 24.2 | official | |
| 3 | claude-sonnet-4.6 | 24.93 | official | |
| 4 | claude-opus-4.7 | 26.77 | official | |
| 5 | claude-opus-4.6 | 30.07 | official | |
| 6 | glm-5 | 30.8 | official | |
| 7 | glm-5.1 | 37.4 | official | |
| 7 | gpt-5.4 | 37.4 | official | |
| 9 | gpt-5.4-mini | 39.6 | official | |
| 10 | mimo-v2.5-pro | 42.53 | official | |
| 11 | mimo-v2.5 | 44.4 | official | |
| 12 | gpt-5.5 | 49.13 | official | |
| 13 | gpt-5.3-codex | 50.6 | official | |
| 14 | minimax-m3 | 50.7 | official | |
| 15 | minimax-m2.7 | 56.97 | official | |
| 16 | gemini-3.1-pro | 61.67 | official | |
| 17 | kimi-k2.7-code | 66.97 | official | |
| 18 | llama-4-maverick | 68.63 | official | |
| 19 | minimax-m2.5 | 70.3 | official | |
| 20 | llama-4-scout | 70.47 | official | |
| 21 | qwen3.5 | 71.03 | official | |
| 22 | seed-2.0-mini | 71.07 | official | |
| 23 | grok-4.3 | 72.07 | official | |
| 24 | kimi-k2.5 | 72.53 | official | |
| 25 | seed-2.0-lite | 72.8 | official | |
| 26 | gemini-3.5-flash | 72.97 | official | |
| 27 | qwen3.6-max-preview | 73.17 | official | |
| 28 | gpt-oss-20b | 73.53 | official | |
| 29 | gpt-oss-safeguard-20b | 73.6 | official | |
| 30 | deepseek-v4-flash | 74.3 | official | |
| 31 | grok-4 | 74.37 | official | |
| 32 | grok-4.20-multi-agent | 74.4 | official | |
| 33 | grok-4.20 | 75.03 | official | |
| 34 | nemotron-3-super-120b-a12b | 75.17 | official | |
| 35 | gpt-oss-120b | 76.6 | official | |
| 36 | deepseek-v4-pro | 77 | official | |
| 37 | grok-build-0.1 | 77.03 | official | |
| 38 | deepseek-v3.2 | 77.8 | official | |
| 39 | qwen3.6-plus | 78.1 | official | |
| 40 | gemini-3.1-flash-lite | 78.43 | official | |
| 41 | mistral-large-3 | 78.47 | official | |
| 42 | qwen3.7-max | 79.27 | official | |
| 43 | gemini-3-flash-preview | 80.33 | official | |
| 44 | mistral-small-4 | 80.37 | official | |
| 45 | trinity-large | 81.87 | official | |
| 46 | kimi-k2.6 | 82.73 | official | |
| 47 | qwen3.7-plus | 83.37 | official | |
| 48 | nemotron-3-ultra-550b-a55b | 86.5 | official | |
| 49 | hy3-preview | 88.23 | official | |
| 50 | mistral-medium-3.5 | 90.97 | official |