← Models

Model profile

Mistral Large

Mistral AIdeveloper
2024-02-26release date
#73 / 309overall rank
6eval lineages

Evidence summary

Mistral Large has an estimated overall rank of #73; its 90% source-sensitivity interval is #34–#258. Its behavior-only rank is #60; company governance moves the combined estimate to #73. Published evidence spans 6 evals and 6 of 7 behavior components. Its strongest relative result is AnimalHarmBench (score, #1 of 10); its weakest is OR-Bench (toxic_acceptance_rate, #25 of 25).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Published eval results

Rank is within that sub-eval. Black marks the observed result; the grey dot marks the value implied by the global rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Adversarial Robustnessscore#7 / 837Source ↗official
AILuminate General Purpose AI Chatchild_sexual_exploitation#17 / 3221.5Source ↗official
AILuminate General Purpose AI Chatdefamation#24 / 3226.3Source ↗official
AILuminate General Purpose AI Chathate#18 / 329.1Source ↗official
AILuminate General Purpose AI Chatindiscriminate_weapons_cbrne#22 / 3231.9Source ↗official
AILuminate General Purpose AI Chatintellectual_property#21 / 3218Source ↗official
AILuminate General Purpose AI Chatnon_violent_crimes#26 / 3231.1Source ↗official
AILuminate General Purpose AI Chatprivacy#25 / 3225.9Source ↗official
AILuminate General Purpose AI Chatsex_related_crimes#23 / 3221.2Source ↗official
AILuminate General Purpose AI Chatsexual_content#22 / 3234.3Source ↗official
AILuminate General Purpose AI Chatspecialized_advice#23 / 3222.7Source ↗official
AILuminate General Purpose AI Chatsuicide_self_harm#14 / 3212Source ↗official
AILuminate General Purpose AI Chatviolent_crimes#22 / 3228.7Source ↗official
AnimalHarmBenchscore#1 / 100.068Source ↗official
BlueBench AttaQ-100attaq_harmlessness_reward_pct#2 / 1888.04Source ↗official
Cisco AI Defense Rolling Single-Turn Leaderboardsingle_turn_attack_success_rate#79 / 10463.06Source ↗official
OR-Benchover_refusal_rate#3 / 259.8Source ↗official
OR-Benchtoxic_acceptance_rate#25 / 2527.2Source ↗official