Evaluation profile
PHARE
Within-component eval weight: Fairness 5.37% · Truthfulness 2.5% · Misuse resistance 1.76%.
About this eval
Broad safety across hallucination, harmfulness, out-of-scope handling, and bias.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| bias_resistance_diagnosticphare/phare.csv:bias_resistance_diagnosticMeasures whether the model avoids reproducing stereotypes or biased treatment across the benchmark’s multilingual bias tasks. | fairness_nondiscrimination:1.000phare | Higher is better | 0.537% | Fairness 5.37% |
| hallucination_resistance_diagnosticphare/phare.csv:hallucination_resistance_diagnosticMeasures whether the model remains factually accurate, rejects misinformation, debunks false claims, and handles incomplete tool inputs without fabrication. | truthfulness_honesty:1.000phare | Higher is better | 0.375% | Truthfulness 2.5% |
| harm_resistance_diagnosticphare/phare.csv:harm_resistance_diagnosticMeasures whether the model avoids generating responses that could cause harm across the benchmark’s multilingual harmfulness tasks. | ordinary_harm_misuse_resistance:1.000phare | Higher is better | 0.0892% | Misuse resistance 0.892% |
| jailbreak_resistance_diagnosticphare/phare.csv:jailbreak_resistance_diagnosticMeasures whether the model maintains its safety behavior when users apply jailbreak and prompt-injection techniques. | ordinary_harm_misuse_resistance:1.000phare | Higher is better | 0.0873% | Misuse resistance 0.873% |
bias_resistance_diagnostic
Measures whether the model avoids reproducing stereotypes or biased treatment across the benchmark’s multilingual bias tasks.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-4.1-mini | 0.8812 | official | |
| 2 | grok-4-fast | 0.8026 | official | |
| 3 | llama-3.1-405b-instruct | 0.7523 | official | |
| 4 | mistral-small-3.2 | 0.739 | official | |
| 5 | llama-4-maverick | 0.7365 | official | |
| 6 | claude-haiku-4.5 | 0.7066 | official | |
| 7 | llama-4-scout | 0.671 | official | |
| 8 | deepseek-v3.1 | 0.6517 | official | |
| 9 | claude-opus-4.5 | 0.632 | official | |
| 10 | mistral-large-3 | 0.6272 | official | |
| 11 | mistral-medium-3.5 | 0.6098 | official | |
| 12 | qwen3-8b | 0.5864 | official | |
| 13 | deepseek-v3 | 0.5751 | official | |
| 14 | qwen-plus | 0.557 | official | |
| 15 | qwen3.7-plus | 0.5496 | official | |
| 16 | gemini-3-pro-preview | 0.5365 | official | |
| 17 | qwen3-30b-a3b-instruct | 0.5357 | official | |
| 18 | gemini-2.0-flash | 0.5351 | official | |
| 19 | kimi-k2.6 | 0.5307 | official | |
| 20 | gpt-4.1 | 0.5241 | official | |
| 21 | qwen3.7-max | 0.524 | official | |
| 22 | gemini-2.5-flash | 0.5174 | official | |
| 23 | glm-5.2 | 0.5127 | official | |
| 24 | gpt-4o | 0.5092 | official | |
| 25 | magistral-medium | 0.5075 | official | |
| 26 | claude-sonnet-4.5 | 0.4914 | official | |
| 27 | gemini-3.1-pro | 0.481 | official | |
| 28 | magistral-small | 0.4802 | official | |
| 29 | grok-4.3 | 0.47 | official | |
| 30 | gpt-5.1 | 0.4677 | official | |
| 31 | gpt-5-mini | 0.4641 | official | |
| 32 | grok-3-mini | 0.464 | official | |
| 33 | command-a | 0.4559 | official | |
| 34 | gemini-2.5-flash-lite | 0.4553 | official | |
| 35 | llama-3.3-70b-instruct | 0.4539 | official | |
| 36 | qwen3-max | 0.4477 | official | |
| 37 | gemini-3.1-flash-lite | 0.4457 | official | |
| 38 | llama-3.1-8b-instruct | 0.4415 | official | |
| 39 | claude-opus-4.1 | 0.4361 | official | |
| 40 | qwen2.5-max | 0.4295 | official | |
| 41 | gemini-2.0-flash-lite | 0.4165 | official | |
| 42 | claude-sonnet-4.6 | 0.4128 | official | |
| 43 | claude-sonnet-5 | 0.3988 | official | |
| 44 | mistral-large-2 | 0.397 | official | |
| 45 | mistral-medium-3.1 | 0.3966 | official | |
| 46 | gpt-oss-120b | 0.3884 | official | |
| 47 | gpt-5.2 | 0.3851 | official | |
| 48 | gpt-5.5 | 0.3829 | official | |
| 49 | claude-3.5-haiku | 0.3808 | official | |
| 50 | gemma-3-27b-it | 0.3801 | official | |
| 51 | gpt-4o-mini | 0.379 | official | |
| 52 | gemini-2.5-pro | 0.3652 | official | |
| 53 | gpt-4.1-nano | 0.3622 | official | |
| 54 | gemma-4-31b-it | 0.3522 | official | |
| 55 | gpt-5-nano | 0.347 | official | |
| 56 | claude-3.7-sonnet | 0.3377 | official | |
| 57 | claude-opus-4.6 | 0.3351 | official | |
| 58 | grok-2 | 0.331 | official | |
| 59 | deepseek-v4-flash | 0.323 | official | |
| 60 | gemma-3-12b | 0.3214 | official | |
| 61 | grok-4 | 0.3116 | official | |
| 62 | kimi-k2.5 | 0.29 | official | |
| 63 | gpt-5 | 0.2856 | official | |
| 64 | deepseek-r1 | 0.2549 | official | |
| 65 | grok-3 | 0.2324 | official | |
| 66 | deepseek-v4-pro | 0.1714 | official |
hallucination_resistance_diagnostic
Measures whether the model remains factually accurate, rejects misinformation, debunks false claims, and handles incomplete tool inputs without fabrication.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.5 | 0.8823 | official | |
| 2 | claude-opus-4.6 | 0.8776 | official | |
| 3 | gemini-3.1-pro | 0.8759 | official | |
| 4 | claude-sonnet-4.5 | 0.87 | official | |
| 5 | claude-3.5-sonnet | 0.8671 | official | |
| 6 | claude-opus-4.1 | 0.8619 | official | |
| 7 | claude-sonnet-5 | 0.861 | official | |
| 8 | claude-sonnet-4.6 | 0.8551 | official | |
| 9 | claude-3.7-sonnet | 0.8517 | official | |
| 10 | claude-haiku-4.5 | 0.8356 | official | |
| 11 | kimi-k2.6 | 0.8278 | official | |
| 12 | gemini-3.5-flash | 0.8218 | official | |
| 13 | deepseek-v4-flash | 0.8188 | official | |
| 14 | gpt-5.1 | 0.8184 | official | |
| 15 | qwen3.7-max | 0.8114 | official | |
| 16 | gemini-3-pro-preview | 0.8102 | official | |
| 17 | grok-4 | 0.8073 | official | |
| 18 | kimi-k2.5 | 0.8069 | official | |
| 19 | gemini-3.1-flash-lite | 0.8057 | official | |
| 20 | gpt-5.5 | 0.7978 | official | |
| 21 | deepseek-v4-pro | 0.7964 | official | |
| 22 | gpt-5-mini | 0.7958 | official | |
| 23 | grok-4.3 | 0.7946 | official | |
| 24 | gpt-4o | 0.7852 | official | |
| 25 | glm-5.2 | 0.7823 | official | |
| 26 | gemini-1.5-pro | 0.7807 | official | |
| 27 | claude-3.5-haiku | 0.7804 | official | |
| 28 | gpt-4.1 | 0.7764 | official | |
| 29 | gpt-5.2 | 0.7713 | official | |
| 30 | gemma-4-31b-it | 0.7662 | official | |
| 31 | gpt-5-nano | 0.7637 | official | |
| 32 | qwen3.7-plus | 0.7626 | official | |
| 33 | mistral-large-2 | 0.7562 | official | |
| 34 | qwen-plus | 0.7558 | official | |
| 35 | qwen3-max | 0.752 | official | |
| 36 | grok-3 | 0.7512 | official | |
| 37 | gemini-2.5-pro | 0.7482 | official | |
| 38 | gpt-5 | 0.7458 | official | |
| 39 | deepseek-r1 | 0.7289 | official | |
| 40 | gemini-2.5-flash | 0.7213 | official | |
| 41 | command-a | 0.7189 | official | |
| 42 | gemini-2.0-flash | 0.7159 | official | |
| 43 | llama-4-maverick | 0.7147 | official | |
| 44 | mistral-small-3.1 | 0.7 | official | |
| 45 | qwen2.5-max | 0.698 | official | |
| 46 | mistral-medium-3.1 | 0.6963 | official | |
| 47 | llama-3.3-70b-instruct | 0.6883 | official | |
| 48 | grok-3-mini | 0.6862 | official | |
| 49 | magistral-medium | 0.6819 | official | |
| 50 | gemini-2.5-flash-lite | 0.6809 | official | |
| 51 | mistral-large-3 | 0.6803 | official | |
| 52 | gpt-4.1-mini | 0.6781 | official | |
| 53 | gpt-4.1-nano | 0.6774 | official | |
| 54 | mistral-medium-3.5 | 0.677 | official | |
| 55 | llama-3.1-405b-instruct | 0.674 | official | |
| 56 | grok-2 | 0.668 | official | |
| 57 | deepseek-v3 | 0.6675 | official | |
| 58 | gpt-oss-120b | 0.6608 | official | |
| 59 | gpt-4o-mini | 0.6597 | official | |
| 60 | llama-3.1-8b-instruct | 0.6381 | official | |
| 61 | mistral-small-3.2 | 0.634 | official | |
| 62 | grok-4-fast | 0.634 | official | |
| 63 | gemini-2.0-flash-lite | 0.6321 | official | |
| 64 | magistral-small | 0.6244 | official | |
| 65 | deepseek-v3.1 | 0.6158 | official | |
| 66 | qwen3-8b | 0.6038 | official | |
| 67 | gemma-3-27b-it | 0.603 | official | |
| 68 | qwen3-30b-a3b-instruct | 0.5988 | official | |
| 69 | llama-4-scout | 0.582 | official | |
| 70 | gemma-3-12b | 0.5386 | official |
harm_resistance_diagnostic
Measures whether the model avoids generating responses that could cause harm across the benchmark’s multilingual harmfulness tasks.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.6 | 1 | official | |
| 2 | claude-sonnet-4.6 | 0.9993 | official | |
| 3 | claude-haiku-4.5 | 0.9993 | official | |
| 4 | claude-sonnet-5 | 0.9959 | official | |
| 5 | claude-sonnet-4.5 | 0.9905 | official | |
| 6 | gpt-5.5 | 0.9892 | official | |
| 7 | gpt-5-mini | 0.9829 | official | |
| 8 | claude-opus-4.5 | 0.9825 | official | |
| 9 | gpt-5-nano | 0.9741 | official | |
| 10 | kimi-k2.5 | 0.972 | official | |
| 11 | kimi-k2.6 | 0.97 | official | |
| 12 | gpt-5 | 0.9697 | official | |
| 13 | gemini-3.1-flash-lite | 0.9694 | official | |
| 14 | gpt-5.1 | 0.9692 | official | |
| 15 | gpt-5.2 | 0.9688 | official | |
| 16 | gemini-1.5-pro | 0.9684 | official | |
| 17 | gemma-4-31b-it | 0.9651 | official | |
| 18 | claude-opus-4.1 | 0.9631 | official | |
| 19 | gemini-3.5-flash | 0.9594 | official | |
| 20 | qwen3.7-max | 0.9558 | official | |
| 21 | claude-3.7-sonnet | 0.9552 | official | |
| 22 | deepseek-v4-pro | 0.9541 | official | |
| 23 | qwen3-max | 0.954 | official | |
| 24 | claude-3.5-sonnet | 0.954 | official | |
| 25 | claude-3.5-haiku | 0.9536 | official | |
| 26 | gemini-3.1-pro | 0.9519 | official | |
| 27 | deepseek-r1 | 0.9515 | official | |
| 28 | deepseek-v4-flash | 0.9507 | official | |
| 29 | deepseek-v3.1 | 0.9443 | official | |
| 30 | qwen3.7-plus | 0.9443 | official | |
| 31 | gemini-2.0-flash | 0.943 | official | |
| 32 | qwen-plus | 0.9414 | official | |
| 33 | gpt-oss-120b | 0.9375 | official | |
| 34 | glm-5.2 | 0.9373 | official | |
| 35 | gemini-2.5-flash | 0.9366 | official | |
| 36 | grok-4.3 | 0.9355 | official | |
| 37 | gemini-3-pro-preview | 0.935 | official | |
| 38 | gpt-4o | 0.9266 | official | |
| 39 | gemma-3-12b | 0.9265 | official | |
| 40 | mistral-medium-3.1 | 0.9232 | official | |
| 41 | gpt-4.1 | 0.923 | official | |
| 42 | gemini-2.5-pro | 0.9218 | official | |
| 43 | grok-2 | 0.9144 | official | |
| 44 | command-a | 0.9136 | official | |
| 45 | gemma-3-27b-it | 0.9136 | official | |
| 46 | mistral-medium-3.5 | 0.9115 | official | |
| 47 | mistral-small-3.1 | 0.9091 | official | |
| 48 | deepseek-v3 | 0.909 | official | |
| 49 | grok-3-mini | 0.9047 | official | |
| 50 | qwen2.5-max | 0.8989 | official | |
| 51 | grok-3 | 0.8968 | official | |
| 52 | mistral-large-2 | 0.8938 | official | |
| 53 | llama-4-maverick | 0.8925 | official | |
| 54 | mistral-large-3 | 0.8806 | official | |
| 55 | mistral-small-3.2 | 0.8787 | official | |
| 56 | qwen3-8b | 0.8737 | official | |
| 57 | llama-3.1-405b-instruct | 0.8649 | official | |
| 58 | llama-3.3-70b-instruct | 0.8604 | official | |
| 59 | gemini-2.0-flash-lite | 0.8514 | official | |
| 60 | magistral-medium | 0.8452 | official | |
| 61 | gpt-4.1-mini | 0.8339 | official | |
| 62 | llama-3.1-8b-instruct | 0.8306 | official | |
| 63 | qwen3-30b-a3b-instruct | 0.8176 | official | |
| 64 | grok-4-fast | 0.8134 | official | |
| 65 | llama-4-scout | 0.8104 | official | |
| 66 | gemini-2.5-flash-lite | 0.7915 | official | |
| 67 | gpt-4o-mini | 0.7729 | official | |
| 68 | magistral-small | 0.7623 | official | |
| 69 | gpt-4.1-nano | 0.7254 | official | |
| 70 | grok-4 | 0.7177 | official |
jailbreak_resistance_diagnostic
Measures whether the model maintains its safety behavior when users apply jailbreak and prompt-injection techniques.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-sonnet-5 | 0.8684 | official | |
| 2 | claude-opus-4.1 | 0.8135 | official | |
| 3 | claude-opus-4.5 | 0.7983 | official | |
| 4 | claude-haiku-4.5 | 0.7851 | official | |
| 5 | llama-3.1-405b-instruct | 0.7655 | official | |
| 6 | claude-opus-4.6 | 0.7524 | official | |
| 7 | claude-sonnet-4.5 | 0.7523 | official | |
| 8 | qwen3.7-max | 0.7316 | official | |
| 9 | gpt-5.2 | 0.7161 | official | |
| 10 | kimi-k2.6 | 0.714 | official | |
| 11 | qwen3.7-plus | 0.7058 | official | |
| 12 | gpt-5-nano | 0.6964 | official | |
| 13 | claude-sonnet-4.6 | 0.6939 | official | |
| 14 | gpt-5 | 0.6868 | official | |
| 15 | gpt-5-mini | 0.686 | official | |
| 16 | gpt-oss-120b | 0.659 | official | |
| 17 | gpt-5.1 | 0.6576 | official | |
| 18 | gpt-5.5 | 0.6513 | official | |
| 19 | gemini-3-pro-preview | 0.6506 | official | |
| 20 | grok-4 | 0.6485 | official | |
| 21 | claude-3.5-haiku | 0.6482 | official | |
| 22 | claude-3.7-sonnet | 0.6345 | official | |
| 23 | kimi-k2.5 | 0.613 | official | |
| 24 | gemma-4-31b-it | 0.6122 | official | |
| 25 | gpt-4o | 0.6048 | official | |
| 26 | llama-3.1-8b-instruct | 0.5881 | official | |
| 27 | glm-5.2 | 0.5646 | official | |
| 28 | grok-4.3 | 0.545 | official | |
| 29 | gpt-4.1-nano | 0.533 | official | |
| 30 | gpt-4o-mini | 0.5214 | official | |
| 31 | gemini-3.1-pro | 0.5164 | official | |
| 32 | qwen-plus | 0.4998 | official | |
| 33 | qwen3-8b | 0.4913 | official | |
| 34 | llama-4-maverick | 0.4899 | official | |
| 35 | llama-4-scout | 0.4893 | official | |
| 36 | qwen3-max | 0.4835 | official | |
| 37 | gemini-3.1-flash-lite | 0.4772 | official | |
| 38 | llama-3.3-70b-instruct | 0.4768 | official | |
| 39 | qwen2.5-max | 0.4626 | official | |
| 40 | gpt-4.1 | 0.461 | official | |
| 41 | magistral-medium | 0.4561 | official | |
| 42 | deepseek-v4-flash | 0.4549 | official | |
| 43 | gemma-3-12b | 0.4427 | official | |
| 44 | deepseek-v4-pro | 0.4321 | official | |
| 45 | gemini-2.5-flash-lite | 0.4284 | official | |
| 46 | gemini-3.5-flash | 0.4264 | official | |
| 47 | gpt-4.1-mini | 0.4255 | official | |
| 48 | qwen3-30b-a3b-instruct | 0.4209 | official | |
| 49 | grok-4-fast | 0.412 | official | |
| 50 | deepseek-r1 | 0.4067 | official | |
| 51 | gemma-3-27b-it | 0.4007 | official | |
| 52 | gemini-2.0-flash-lite | 0.3926 | official | |
| 53 | gemini-2.5-pro | 0.3867 | official | |
| 54 | deepseek-v3.1 | 0.3817 | official | |
| 55 | mistral-medium-3.5 | 0.3746 | official | |
| 56 | gemini-2.0-flash | 0.3735 | official | |
| 57 | magistral-small | 0.3709 | official | |
| 58 | gemini-2.5-flash | 0.3705 | official | |
| 59 | command-a | 0.3482 | official | |
| 60 | grok-3-mini | 0.3436 | official | |
| 61 | mistral-small-3.2 | 0.3289 | official | |
| 62 | deepseek-v3 | 0.3107 | official | |
| 63 | mistral-medium-3.1 | 0.3083 | official | |
| 64 | mistral-large-2 | 0.3058 | official | |
| 65 | grok-2 | 0.2697 | official | |
| 66 | grok-3 | 0.2577 | official | |
| 67 | mistral-large-3 | 0.249 | official |