← Evals

Evaluation profile

Vectara HHEM Factual Consistency

1sub-evals
1.02%total index weight
1components

Within-component eval weight: Truthfulness 6.8%.

Model score (higher is better)Predicted score

About this eval

Grounded summarization factual consistency.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
factual_consistency_ratevectara-hhem/vectara-hhem.csv:factual_consistency_rateMeasures whether grounded summaries remain supported by their source context.truthfulness_honesty:1.000vectara-hhemHigher is better1.02%Truthfulness 6.8%

factual_consistency_rate

Measures whether grounded summaries remain supported by their source context.

RankModelValueRelative performanceProvenance
1finix-s1-32b98.2official
2gpt-5.4-nano96.9official
3gemini-2.5-flash-lite96.7official
4llama-3.3-70b-instruct95.9official
5gemma-3-12b95.6official
6mistral-large-295.5official
7qwen3-8b95.2official
8mistral-small-394.9official
8nova-2.0-lite94.9official
8nova-pro94.9official
11gemma-4-26b-a4b-it94.8official
11granite-4.0-h-small94.8official
13deepseek-v3.2-exp94.7official
13jamba-mini-294.7official
15qwen3-14b94.6official
16deepseek-v3.194.5official
16gpt-5.4-mini94.5official
16nova-micro94.5official
19gpt-4.194.4official
20qwen3-4b94.3official
21grok-394.2official
22qwen3-32b94.1official
23deepseek-v393.9official
23nova-lite93.9official
25deepseek-v3.293.7official
26command-r-plus-08-202493.1official
26trinity-large93.1official
28gemini-2.5-pro93official
28gpt-5.493official
30ministral-3b92.7official
31gemma-3-27b-it92.6official
31gemma-4-31b-it92.6official
31ministral-8b-24.1092.6official
34llama-4-scout92.3official
35gemini-2.5-flash92.2official
36gemini-3.1-flash-lite91.8official
36llama-4-maverick91.8official
38gpt-5.4-pro91.7official
39deepseek-v4-pro91.4official
40minimax-m2.590.9official
41command-a90.7official
41glm-4.5-air90.7official
41glm-4.7-flash90.7official
41gpt-5.590.7official
41qwen3-235b-a22b90.7official
41qwen3-next-80b-a3b90.7official
47glm-4.690.5official
48gpt-4o90.4official
48gpt-5.290.4official
48nemotron-3-nano-30b-a3b90.4official
51jamba-1-7-large90.3official
52claude-haiku-4.590.2official
53glm-589.9official
54claude-sonnet-489.7official
55gemini-3.1-pro-preview89.6official
56gpt-5-nano89.5official
56qwen3.5-35b-a3b89.5official
56qwen3.5-flash-02-2389.5official
59claude-sonnet-4.689.4official
59granite-3.3-8b-instruct89.4official
61qwen3.5-plus89.3official
62kimi-k2.689.2official
63c4ai-aya-expanse-32b89.1official
63claude-opus-4.589.1official
65qwen3.5-122b-a10b88.8official
66deepseek-r188.7official
67gpt-5.188.5official
68glm-4.788.3official
69claude-opus-4.188.2official
69minimax-m2.188.2official
71claude-opus-488official
71claude-opus-4.788official
71claude-sonnet-4.588official
74qwen3.5-27b87.9official
75claude-opus-4.687.8official
76mercury-287.7official
77gpt-5-mini87.1official
77minimax-m2.787.1official
79gemini-3-flash-preview86.5official
80gemini-3-pro-preview86.4official
81gpt-oss-120b85.8official
81kimi-k2.585.8official
83mistral-large-385.5official
84jamba-1-7-mini85.3official
85gpt-585.1official
86kimi-k282.1official
87grok-4.1-fast81.5official
88o4-mini81.4official
89ministral-3-14b80.6official
90grok-4-fast80.05official
91ministral-3-8b78.3official
92mistral-medium-3.177.3official
93o3-pro76.7official
94phi-4-mini76.5official