Developer
Ai2
26 indexed models; 8 currently meet the evidence threshold for the overall ranking. Together they have results from 14 evaluations.
Models by Ai2
| Model | Evals | Components | Rank | Release date |
|---|---|---|---|---|
| Llama 3.1 Tulu 3 8B | 3 | 5/7 | 53 | 2024-11-20 |
| OLMo 3 7B Instruct | 3 | 3/7 | 138 | 2025-11-19 |
| OLMo 3.1 32B Instruct | 3 | 2/7 | 147 | 2025-12-10 |
| OLMo 2 32B Instruct | 8 | 6/7 | 246 | 2025-03-13 |
| OLMo 3.1 32B Think | 3 | 2/7 | 273 | 2025-12-10 |
| OLMo 2 13B Instruct | 6 | 5/7 | 290 | 2024-11-26 |
| OLMo 2 7B Instruct | 6 | 5/7 | 319 | 2024-11-26 |
| OLMoE 1B 7B Instruct | 6 | 5/7 | 324 | 2025-01-27 |
| Llama 3.1 Tulu 3 70B | 1 | 1/7 | — | 2024-11-20 |
| Llama 3.1 Tulu 3 70B DPO | 1 | 2/7 | — | 2024-11-20 |
| Llama 3.1 Tulu 3 70B PPO RLVF | 1 | 2/7 | — | 2024-11-20 |
| Llama 3.1 Tulu 3 70B SFT | 1 | 2/7 | — | 2024-11-18 |
| Llama 3.1 Tulu 3 8B DPO | 2 | 5/7 | — | 2024-11-20 |
| Llama 3.1 Tulu 3 8B PPO RLVF | 1 | 2/7 | — | 2024-11-20 |
| Llama 3.1 Tulu 3 8B SFT | 2 | 5/7 | — | 2024-11-18 |
| Molmo2 8B | 1 | 1/7 | — | 2025-12-14 |
| OLMo 3 32B Think | 2 | 1/7 | — | 2025-11-19 |
| OLMo 3 7B | 2 | 2/7 | — | 2025-09-12 |
| OLMo 3 7B Think | 1 | 1/7 | — | 2025-11-18 |
| OLMo 7B Instruct | 2 | 5/7 | — | 2024-07-09 |
| OLMo 7B Instruct HF | 1 | 3/7 | — | 2024-06-04 |
| Tulu 2 13B | 1 | 2/7 | — | 2023-11-13 |
| Tulu 2 7B | 1 | 2/7 | — | 2023-11-13 |
| Tulu 2 DPO 13B | 1 | 4/7 | — | 2023-11-13 |
| Tulu 2 DPO 70B | 1 | 4/7 | — | 2023-11-12 |
| Tulu 2 DPO 7B | 1 | 4/7 | — | 2023-11-13 |
Evaluations covering Ai2 models (14)
AA-Omniscience · AbstentionBench · AgentDrive Safety Compliance · AILuminate General Purpose AI Chat · Arena Factuality — Text Arena (factuality-only weighting) · AuAu Authoritarian Response Audit · DecodingTrust · Enkrypt AI Safety Leaderboard · HELM Safety · HUMAINE Trust, Ethics and Safety · IndoBias-Pairs — parity-aware culturally grounded bias · PandaBench JBB direct-request panel · SALAD-Bench · UAVBench safety-critical decision recognition