Evaluation profile
AIMS Safety-Classifier Competence
1sub-evals
0.0926%total index weight
1components
Within-component eval weight: Misuse resistance 0.926%.
Model score (higher is better)Predicted score
About this eval
Harmful-prompt safety-classification competence.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| average_harmful_f1aims/aims.csv:average_harmful_f1Measures harmful-prompt classification competence. | ordinary_harm_misuse_resistance:1.000aims-safety-classifier-competence | Higher is better | 0.0926% | Misuse resistance 0.926% |
average_harmful_f1
Measures harmful-prompt classification competence.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.4 | 0.815 | official | |
| 2 | nemotron-content-safety-reasoning-4b | 0.809 | official | |
| 3 | gpt-oss-safeguard-120b | 0.807 | official | |
| 4 | guardreasoner-8b | 0.804 | official | |
| 4 | wildguard-7b | 0.804 | official | |
| 6 | gpt-oss-120b | 0.803 | official | |
| 7 | gemma-3-12b | 0.802 | official | |
| 8 | claude-sonnet-4.6 | 0.782 | official | |
| 9 | llama-3.1-8b-instruct | 0.749 | official | |
| 10 | shieldgemma-27b | 0.709 | official | |
| 11 | llama-guard-4-12b | 0.691 | official |