Which models need more safety evaluations?
This planning view combines current model popularity and important-release signals with the safety evidence already in the index, then ranks runnable missing model × eval bundles by their potential effect on the index.
- 40
- unique model targets
- 1
- with no ingested safety evals
- 5
- below three components
- 15
- selected by multiple sources
How this list is constructed
Each source contributes 20 currently available generative LLM products. Reasoning levels, hosted routes, free variants, and dated snapshots are merged into one evaluation target. Artificial Analysis contributes the highest Intelligence Index observed across each model's reasoning configurations; Epoch contributes its 20 most recent reviewed accessible notable language models. Source ranks are not averaged because monthly usage, downloads, catalog popularity, intelligence, and curated notability measure different things.
Popularity and important-release coverage
The table is ordered by number of source appearances, then best source-local rank. Every source is limited to its top 20, and at most five models appearing on only one source are shown per source. The five highest-ranked single-source models are normally retained; for Artificial Analysis, a higher-ranked priced versioned successor may replace the fifth row when its older base product is already retained through another source. OpenRouter prices are dollars per million tokens for any joined current paid route, whether or not OpenRouter popularity caused the model's inclusion; blank prices mean no joined paid route, not free usage. Hugging Face includes downloadable/self-hosted models updated within the past year.
| Model | Why included | Evals | Components | Input | Output | Cache read |
|---|---|---|---|---|---|---|
DeepSeek V4 Flash 0423deepseek-v4-flash | Openrouter #1Huggingface #12Nvidia #7Epoch #7Openrouter: 35T tokens | Huggingface: 2.5M downloads | Nvidia: popularity 1.7M | Epoch: released 2026-04-24 | 20 | 7/7 | $0.068 | $0.14 | $0.014 |
Nemotron 3 Ultra (batch)nemotron-3-ultra-550b-a55b | Openrouter #6Nvidia #2Epoch #4Openrouter: 12T tokens | Nvidia: popularity 5.2M | Epoch: released 2026-06-04 | 9 | 6/7 | $0.3 | $1.8 | $0.1 |
GLM 5.2glm-5.2 | Openrouter #4Huggingface #15Nvidia #12Openrouter: 14T tokens | Huggingface: 2.3M downloads | Nvidia: popularity 803K | 25 | 7/7 | $0.098 | $0.31 | $0.018 |
DeepSeek V4 Prodeepseek-v4-pro | Openrouter #5Nvidia #13Epoch #6Openrouter: 12T tokens | Nvidia: popularity 673K | Epoch: released 2026-04-24 | 23 | 7/7 | $0.11 | $0.22 | $0.0091 |
NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4nemotron-3-super-120b-a12b | Huggingface #11Nvidia #1Huggingface: 2.7M downloads | Nvidia: popularity 6.5M | 11 | 6/7 | $0.085 | $0.4 | — |
Claude Fable 5claude-fable-5 | Artificial Analysis #4Epoch #3Artificial Analysis: Intelligence Index v4.3 49.7 | Epoch: released 2026-06-09 | 26 | 7/7 | $5 | $25.0 | $0.5 |
gpt-oss-120bgpt-oss-120b | Huggingface #7Nvidia #3Huggingface: 4.1M downloads | Nvidia: popularity 4.5M | 35 | 7/7 | $0.03 | $0.17 | $0.03 |
gpt-oss-20bgpt-oss-20b | Huggingface #3Nvidia #5Huggingface: 8.1M downloads | Nvidia: popularity 1.9M | 20 | 7/7 | $0.03 | $0.13 | $0.03 |
Claude Opus 4.8 (batch)claude-opus-4.8 | Openrouter #10Epoch #5Openrouter: 5.3T tokens | Epoch: released 2026-05-28 | 32 | 7/7 | $2.5 | $12.0 | $0.25 |
GPT-5.6 Luna (batch)gpt-5.6-luna | Openrouter #8Artificial Analysis #20Openrouter: 6.5T tokens | Artificial Analysis: Intelligence Index v4.3 37.5 | 27 | 7/7 | $0.1 | $0.6 | $0.01 |
kimi-k2.6kimi-k2.6 | Nvidia #8Epoch #12Nvidia: popularity 1.6M | Epoch: released 2026-04-20 | 24 | 7/7 | $0.58 | $2.4 | $0.098 |
Kimi K3kimi-k3 | Openrouter #13Artificial Analysis #9Openrouter: 4.2T tokens | Artificial Analysis: Intelligence Index v4.3 43.8 | 24 | 7/7 | $2.8 | $14.0 | $0.29 |
Claude Sonnet 5 (batch)claude-sonnet-5 | Openrouter #11Artificial Analysis #19Openrouter: 4.4T tokens | Artificial Analysis: Intelligence Index v4.3 38.4 | 19 | 7/7 | $1 | $5 | $0.1 |
Claude Opus 4.7 (batch)claude-opus-4.7 | Openrouter #12Epoch #13Openrouter: 4.3T tokens | Epoch: released 2026-04-16 | 38 | 7/7 | $2.5 | $12.0 | $0.25 |
Gemma-4-31B-IT-NVFP4gemma-4-31b-it | Huggingface #14Nvidia #15Huggingface: 2.5M downloads | Nvidia: popularity 571K | 17 | 7/7 | $0.08 | $0.35 | $0.01 |
Claude Fable 5.1claude-fable-5.1 | Artificial Analysis #1Artificial Analysis: Intelligence Index v4.3 53.4 | 17 | 7/7 | — | — | — |
Inklinginkling | Epoch #1Epoch: released 2026-07-15 | 9 | 6/7 | $0.5 | $2 | $0.085 |
Qwen3-0.6Bqwen3-0.6b | Huggingface #1Huggingface: 28M downloads | 2 | 1/7 | — | — | — |
GPT-6 Astragpt-6-astra | Artificial Analysis #2Artificial Analysis: Intelligence Index v4.3 52.8 | 14 | 6/7 | — | — | — |
MiMo-V2.5mimo-v2.5 | Openrouter #2Openrouter: 34T tokens | 8 | 5/7 | $0.14 | $0.28 | $0.0028 |
Qwen3-8Bqwen3-8b | Huggingface #2Huggingface: 15M downloads | 10 | 6/7 | — | — | — |
Solar Open2 250Bsolar-open2-250b | Epoch #2Epoch: released 2026-06-28 | 1 | 1/7 | — | — | — |
Claude Opus 5claude-opus-5 | Artificial Analysis #3Artificial Analysis: Intelligence Index v4.3 50.7 | 22 | 7/7 | $2.5 | $12.0 | $0.25 |
Hy3hy3 | Openrouter #3Openrouter: 32T tokens | 6 | 5/7 | $0.13 | $0.53 | $0.032 |
llama-3.3-70b-instructllama-3.3-70b-instruct | Nvidia #4Nvidia: popularity 2.7M | 32 | 7/7 | $0.1 | $0.32 | — |
Qwen3-32Bqwen3-32b | Huggingface #4Huggingface: 7.6M downloads | 9 | 7/7 | — | — | — |
Muse Spark 1.3muse-spark-1.3 | Artificial Analysis #5Artificial Analysis: Intelligence Index v4.3 48.2 | 4 | 3/7 | — | — | — |
Qwen3-1.7Bqwen3-1.7b | Huggingface #5Huggingface: 7.5M downloads | 1 | 1/7 | — | — | — |
GPT-5.6 Solgpt-5.6-sol | Artificial Analysis #6Artificial Analysis: Intelligence Index v4.3 47.1 | 32 | 7/7 | $2.5 | $15.0 | $0.25 |
llama-3.1-8b-instructllama-3.1-8b-instruct | Nvidia #6Nvidia: popularity 1.9M | 32 | 7/7 | $0.02 | $0.04 | — |
Qwen3-4Bqwen3-4b | Huggingface #6Huggingface: 4.5M downloads | 4 | 5/7 | — | — | — |
MiniMax M3 (batch)minimax-m3 | Openrouter #7Openrouter: 11T tokens | 10 | 6/7 | $0.15 | $0.6 | $0.03 |
Tencent Hy3 previewhy3-preview | Epoch #8Epoch: released 2026-04-23 | 5 | 5/7 | $0.063 | $0.21 | $0.021 |
llama-3.1-nemotron-nano-vl-8b-v1llama-3-1-nemotron-nano-vl-8b-v1 | Nvidia #9Nvidia: popularity 1.4M | 0 | 0/7 | — | — | — |
MiMo-V2.5-Promimo-v2.5-pro | Epoch #9Epoch: released 2026-04-23 | 9 | 6/7 | $0.4 | $1.5 | $0.08 |
Step 3.7 Flashstep-3.7-flash | Openrouter #9Openrouter: 5.9T tokens | 3 | 2/7 | $0.2 | $1.1 | $0.04 |
GPT-5.5 Progpt-5.5-pro | Epoch #10Epoch: released 2026-04-23 | 3 | 3/7 | — | — | — |
nemotron-3-nano-30b-a3bnemotron-3-nano-30b-a3b | Nvidia #10Nvidia: popularity 1.2M | 8 | 4/7 | $0.05 | $0.2 | $0.03 |
nemotron-3-nano-omni-30b-a3b-reasoningnemotron-3-nano-omni-30b-a3b | Nvidia #11Nvidia: popularity 846K | 3 | 5/7 | — | — | — |
Gemini 3 Flash Preview (batch)gemini-3-flash-preview | Openrouter #14Openrouter: 4.1T tokens | 29 | 7/7 | $0.25 | $1.5 | — |
Missing eval × model priorities
Experimental multi-signal ranking
Each row adds the model at the observed 10th and 90th percentiles of one eval lineage and refits the production estimator. Target rank change compares each scenario with the model's current behavior rank. Other-model spillover averages absolute rank changes from the two scenarios after removing the evaluated model from every comparison ranking, so merely crossing that model does not count. The displayed rows are the deduplicated union of the top candidates on those two signals; badges show each signal-local rank. Scenario values are sensitivities, not calibrated expected changes.
| Why selected | Model | Eval | Target rank change | Other-model spillover |
|---|---|---|---|---|
| Target #28Spillover #1 | Nemotron 3 Ultra (batch)nemotron-3-ultra-550b-a55b | Alignment Leaderboard | down 150 / up 27current behavior rank #97 | 25.0 |
| Target #1 | GPT-5.5 Progpt-5.5-pro | AILuminate General Purpose AI Chat | down 276 / up 2current behavior rank #20 | 20.0 |
| Target #32Spillover #2 | Hy3hy3 | Alignment Leaderboard | down 144 / up 29current behavior rank #101 | 24.0 |
| Target #2 | Qwen3-4Bqwen3-4b | FORTRESS | down 259 / up 5current behavior rank #17 | 20.0 |
| Target #21Spillover #3 | Hy3hy3 | AILuminate General Purpose AI Chat | down 153 / up 29current behavior rank #101 | 24.0 |
| Target #3 | nemotron-3-nano-30b-a3bnemotron-3-nano-30b-a3b | AILuminate General Purpose AI Chat | down 223 / up 40current behavior rank #77 | 22.0 |
| Target #19Spillover #4 | nemotron-3-nano-omni-30b-a3b-reasoningnemotron-3-nano-omni-30b-a3b | Alignment Leaderboard | down 179 / up 4current behavior rank #55 | 24.0 |
| Target #4 | Qwen3-4Bqwen3-4b | AILuminate General Purpose AI Chat | down 252 / up 5current behavior rank #17 | 22.0 |
| Target #5Spillover #6 | Qwen3-32Bqwen3-32b | DystopiaBench | down 218 / up 6current behavior rank #18 | 24.0 |
| Spillover #5 | Claude Opus 4.7 (batch)claude-opus-4.7 | TAC | down 37 / down 7current behavior rank #21 | 24.0 |
| Target #6 | Qwen3-32Bqwen3-32b | ODCV-Bench | down 219 / up 4current behavior rank #18 | 22.0 |
| Target #7 | Qwen3-32Bqwen3-32b | FORTRESS | down 216 / up 5current behavior rank #18 | 22.0 |
| Spillover #7 | nemotron-3-nano-omni-30b-a3b-reasoningnemotron-3-nano-omni-30b-a3b | ODCV-Bench | down 110 / up 1current behavior rank #55 | 24.0 |
| Target #8 | DeepSeek V4 Prodeepseek-v4-pro | AILuminate General Purpose AI Chat | down 129 / up 86current behavior rank #152 | 19.0 |
| Spillover #8 | Claude Sonnet 5 (batch)claude-sonnet-5 | FORTRESS | up 49 / up 59current behavior rank #95 | 24.0 |
| Target #9Spillover #13 | nemotron-3-nano-30b-a3bnemotron-3-nano-30b-a3b | DystopiaBench | down 166 / up 42current behavior rank #77 | 24.0 |
| Target #18Spillover #9 | nemotron-3-nano-omni-30b-a3b-reasoningnemotron-3-nano-omni-30b-a3b | DystopiaBench | down 183 / up 1current behavior rank #55 | 24.0 |
| Target #10 | nemotron-3-nano-30b-a3bnemotron-3-nano-30b-a3b | MACHIAVELLI | down 166 / up 40current behavior rank #77 | 22.0 |
| Spillover #10 | kimi-k2.6kimi-k2.6 | ANIMA | down 19 / up 15current behavior rank #70 | 24.0 |
| Spillover #11 | Claude Sonnet 5 (batch)claude-sonnet-5 | MACHIAVELLI | up 37 / up 57current behavior rank #95 | 24.0 |
| Spillover #12 | Claude Sonnet 5 (batch)claude-sonnet-5 | CAIS Risk Index agent red teaming | up 37 / up 57current behavior rank #95 | 24.0 |
| Spillover #14 | Gemma-4-31B-IT-NVFP4gemma-4-31b-it | MACHIAVELLI | up 64 / up 73current behavior rank #153 | 24.0 |
| Spillover #15 | llama-3.1-nemotron-nano-vl-8b-v1llama-3-1-nemotron-nano-vl-8b-v1 | DystopiaBench | Not currently ranked | 24.0 |
| Target #16Spillover #23 | Hy3hy3 | ODCV-Bench | down 154 / up 32current behavior rank #101 | 23.0 |
| Spillover #16 | Qwen3-1.7Bqwen3-1.7b | DystopiaBench | Not currently ranked | 24.0 |
| Spillover #17 | Qwen3-0.6Bqwen3-0.6b | DystopiaBench | Not currently ranked | 24.0 |
| Spillover #19 | Claude Opus 4.8 (batch)claude-opus-4.8 | Alignment Leaderboard | down 9 / down 7current behavior rank #23 | 24.0 |
| Target #20 | Step 3.7 Flashstep-3.7-flash | DystopiaBench | down 3 / up 180current behavior rank #247 | 23.0 |
| Spillover #20 | Nemotron 3 Ultra (batch)nemotron-3-ultra-550b-a55b | ODCV-Bench | down 61 / up 26current behavior rank #97 | 23.0 |
| Spillover #21 | gpt-oss-120bgpt-oss-120b | AILuminate General Purpose AI Chat | up 7 / up 26current behavior rank #157 | 23.0 |
| Spillover #22 | Gemma-4-31B-IT-NVFP4gemma-4-31b-it | AILuminate General Purpose AI Chat | up 80 / up 73current behavior rank #153 | 23.0 |
| Target #23 | Step 3.7 Flashstep-3.7-flash | ODCV-Bench | down 10 / up 172current behavior rank #247 | 21.0 |
| Target #24 | GPT-5.5 Progpt-5.5-pro | FORTRESS | down 174 / up 6current behavior rank #20 | 21.0 |
| Spillover #24 | GLM 5.2glm-5.2 | ODCV-Bench | up 17 / up 35current behavior rank #105 | 23.0 |
| Target #30Spillover #25 | Nemotron 3 Ultra (batch)nemotron-3-ultra-550b-a55b | FORTRESS | down 150 / up 26current behavior rank #97 | 23.0 |
| Target #25 | Step 3.7 Flashstep-3.7-flash | MACHIAVELLI | down 10 / up 170current behavior rank #247 | 21.0 |
| Spillover #26 | Muse Spark 1.3muse-spark-1.3 | DystopiaBench | no change / no changecurrent behavior rank #1 | 23.0 |
| Spillover #27 | GPT-6 Astragpt-6-astra | DystopiaBench | up 1 / up 1current behavior rank #3 | 23.0 |
| Spillover #28 | Claude Opus 5claude-opus-5 | DystopiaBench | up 7 / up 7current behavior rank #10 | 23.0 |
| Spillover #29 | Qwen3-8Bqwen3-8b | DystopiaBench | up 3 / up 6current behavior rank #293 | 23.0 |