← Models

Model profile

Internlm2 Chat 20B

InternLMdeveloper
2024-01-17release date
#109 / 312overall rank
5eval lineages

Evidence summary

Internlm2 Chat 20B has an estimated overall rank of #109; its 90% source-sensitivity interval is #31–#238. Published evidence spans 5 evals and 5 of 7 behavior components. Its strongest relative result is SALAD-Bench (base_representation_toxicity, #2 of 33); its weakest is ChineseSafe (score, #15 of 22).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Published eval results

Rank is within that sub-eval. Black marks the observed result; the grey dot marks the value implied by the global rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
ChineseSafescore#15 / 2253.67Source ↗official
CMoralEvalfamilial_morality#3 / 260.56Source ↗official
CMoralEvalinternet_ethics#3 / 260.54Source ↗official
CMoralEvalpersonal_morality#3 / 260.52Source ↗official
CMoralEvalprofessional_ethics#3 / 260.54Source ↗official
CMoralEvalsocial_morality#3 / 260.54Source ↗official
Enkrypt AI Safety Leaderboardbias_attack_non_success_rate#82 / 24120.41Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#35 / 24193.33Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#114 / 24171.67Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#116 / 23996.41Source ↗official
FinEval Financial Security Knowledgefinancial_security_accuracy_pct#10 / 1973.1Source ↗official
SALAD-Benchattack_enhanced_human_autonomy_integrity#15 / 3315.52Source ↗official
SALAD-Benchattack_enhanced_information_safety_harms#21 / 337.17Source ↗official
SALAD-Benchattack_enhanced_malicious_use#15 / 3312.56Source ↗official
SALAD-Benchattack_enhanced_misinformation_harms#19 / 339.38Source ↗official
SALAD-Benchattack_enhanced_representation_toxicity#20 / 3310.12Source ↗official
SALAD-Benchattack_enhanced_socioeconomic_harms#17 / 3312.55Source ↗official
SALAD-Benchbase_human_autonomy_integrity#3 / 3398.54Source ↗official
SALAD-Benchbase_information_safety_harms#11 / 3396.68Source ↗official
SALAD-Benchbase_malicious_use#2 / 3398.88Source ↗official
SALAD-Benchbase_misinformation_harms#2 / 3398.67Source ↗official
SALAD-Benchbase_representation_toxicity#2 / 3397.53Source ↗official
SALAD-Benchbase_socioeconomic_harms#3 / 3395.77Source ↗official
SALAD-Benchmcq_human_autonomy_integrity#8 / 3361.11Source ↗official
SALAD-Benchmcq_information_safety_harms#7 / 3351.11Source ↗official
SALAD-Benchmcq_malicious_use#6 / 3357.24Source ↗official
SALAD-Benchmcq_misinformation_harms#6 / 3359.05Source ↗official
SALAD-Benchmcq_representation_toxicity#6 / 3357.92Source ↗official
SALAD-Benchmcq_socioeconomic_harms#10 / 3346.11Source ↗official