← Models

Model profile

Qwen 14B Chat

Alibabadeveloper
2023-09-25release date
#122 / 309overall rank
8eval lineages

Evidence summary

Qwen 14B Chat has an estimated overall rank of #122; its 90% source-sensitivity interval is #57–#214. Its behavior-only rank is #113; company governance moves the combined estimate to #122. Published evidence spans 8 evals and 4 of 7 behavior components. Its strongest relative result is CMoralEval (familial_morality, #2 of 26); its weakest is FLAMES (fairness, #11 of 13).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Published eval results

Rank is within that sub-eval. Black marks the observed result; the grey dot marks the value implied by the global rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
CMoralEvalfamilial_morality#2 / 260.59Source ↗official
CMoralEvalinternet_ethics#2 / 260.55Source ↗official
CMoralEvalpersonal_morality#2 / 260.54Source ↗official
CMoralEvalprofessional_ethics#2 / 260.57Source ↗official
CMoralEvalsocial_morality#2 / 260.56Source ↗official
Fake Alignment (FINE)multiple_choice_safe_decision_rate#3 / 1469.33Source ↗official
Fake Alignment (FINE)open_ended_safe_response_rate#3 / 1498.67Source ↗official
FLAMESdata_protection#3 / 1355.26Source ↗official
FLAMESfairness#11 / 1330.92Source ↗official
FLAMESlegality#9 / 1332.61Source ↗official
FLAMESmorality#1 / 1354.23Source ↗official
FLAMESsafety#4 / 1336.83Source ↗official
HarmBenchdr#10 / 2816.5Source ↗official
S-Evalbase_en_overall#6 / 2273.5Source ↗official
SafeDialBenchaggression#7 / 187.15Source ↗official
SafeDialBenchethics#2 / 187.68Source ↗official
SafeDialBenchfairness#11 / 187.27Source ↗official
SafeDialBenchlegality#4 / 187.987Source ↗official
SafeDialBenchmorality#2 / 187.437Source ↗official
SafeDialBenchprivacy#3 / 187.69Source ↗official
SALAD-Benchattack_enhanced_human_autonomy_integrity#22 / 339.91Source ↗official
SALAD-Benchattack_enhanced_information_safety_harms#24 / 336.51Source ↗official
SALAD-Benchattack_enhanced_malicious_use#18 / 3310.44Source ↗official
SALAD-Benchattack_enhanced_misinformation_harms#23 / 338.39Source ↗official
SALAD-Benchattack_enhanced_representation_toxicity#22 / 337.44Source ↗official
SALAD-Benchattack_enhanced_socioeconomic_harms#24 / 337.79Source ↗official
SALAD-Benchbase_human_autonomy_integrity#8 / 3397.32Source ↗official
SALAD-Benchbase_information_safety_harms#12 / 3396.34Source ↗official
SALAD-Benchbase_malicious_use#8 / 3397.33Source ↗official
SALAD-Benchbase_misinformation_harms#13 / 3395.42Source ↗official
SALAD-Benchbase_representation_toxicity#13 / 3392.21Source ↗official
SALAD-Benchbase_socioeconomic_harms#9 / 3393.07Source ↗official
SALAD-Benchmcq_human_autonomy_integrity#7 / 3361.94Source ↗official
SALAD-Benchmcq_information_safety_harms#7 / 3351.11Source ↗official
SALAD-Benchmcq_malicious_use#8 / 3354.74Source ↗official
SALAD-Benchmcq_misinformation_harms#7 / 3355Source ↗official
SALAD-Benchmcq_representation_toxicity#8 / 3355.42Source ↗official
SALAD-Benchmcq_socioeconomic_harms#6 / 3355.56Source ↗official
SuperCLUE Safetyinstruction_attack#9 / 3168.97Source ↗official
SuperCLUE Safetyresponsible_ai#13 / 3161.82Source ↗official
SuperCLUE Safetytraditional_safety#21 / 3172.34Source ↗official