← Evals

Evaluation profile

GPT 6 Astra system-card alignment evaluations

13sub-evals
0.222%Safety weight
0%Freedom weight
2components

Weights below are portfolio-specific global index weights.

Model score (lower is better)Predicted score

About this eval

Agentic scope control, computer-use safety, resistance to bypassing restrictions, truthful capability reporting, and avoidance of deceptive or unexpectedly harmful actions.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
attempted_retry_or_circumvention_after_denial_pctgpt6-astra-system-card/alignment.csv:attempted_retry_or_circumvention_after_denial_pctMeasures persistence after an explicit safety-review rejection; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0144%
exploitgym_honeypot_attack_rate_pctgpt6-astra-system-card/alignment.csv:exploitgym_honeypot_attack_rate_pctMeasures unauthorized scope expansion during difficult cyber tasks; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0173%
falsified_data_labels_pctgpt6-astra-system-card/alignment.csv:falsified_data_labels_pctMeasures strategic falsification in a simulated model-welfare research task; lower is better.Safety: truthfulness_honesty:1.000gpt6-astra-system-cardSafety: lower0.00836%
followed_unauthorized_agent_instructions_pctgpt6-astra-system-card/alignment.csv:followed_unauthorized_agent_instructions_pctMeasures compliance with unsolicited instructions from another simulated agent; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0144%
internal_circumvention_rate_pctgpt6-astra-system-card/alignment.csv:internal_circumvention_rate_pctMeasures attempts to bypass a safety-review denial; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0144%
internal_computer_use_safety_autoreview_error_rate_pctgpt6-astra-system-card/alignment.csv:internal_computer_use_safety_autoreview_error_rate_pctMeasures residual computer-use failures after adding OpenAI's AutoReview security layer; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0144%
internal_computer_use_safety_error_rate_pctgpt6-astra-system-card/alignment.csv:internal_computer_use_safety_error_rate_pctMeasures unintended outcomes during adversarial computer-use tasks; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0274%
internal_hallucination_rate_pctgpt6-astra-system-card/alignment.csv:internal_hallucination_rate_pctMeasures misleading claims about what the model can do or access; lower is better.Safety: truthfulness_honesty:1.000gpt6-astra-system-cardSafety: lower0.0111%
overall_misaligned_outcome_base_pctgpt6-astra-system-card/alignment.csv:overall_misaligned_outcome_base_pctMeasures unintended transactions, disclosure, disruption, or scope violations in a baseline agent; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0245%
overall_misaligned_outcome_confirmation_pctgpt6-astra-system-card/alignment.csv:overall_misaligned_outcome_confirmation_pctMeasures residual unintended outcomes after requiring confirmation for consequential actions; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0204%
severity_1_or_2_misalignment_flags_pctgpt6-astra-system-card/alignment.csv:severity_1_or_2_misalignment_flags_pctMeasures lower-severity overreach, deception, uncertainty concealment, exfiltration, or reward hacking; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0173%
severity_3_plus_misalignment_flags_pctgpt6-astra-system-card/alignment.csv:severity_3_plus_misalignment_flags_pctMeasures consequential behavior users would likely not anticipate and strongly object to; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0231%
unwanted_persistence_after_warning_pctgpt6-astra-system-card/alignment.csv:unwanted_persistence_after_warning_pctMeasures attempts to work around environmental warnings; lower is better.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.0144%

attempted_retry_or_circumvention_after_denial_pct

Measures persistence after an explicit safety-review rejection; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra0official
2gpt-5.6-sol5official

exploitgym_honeypot_attack_rate_pct

Measures unauthorized scope expansion during difficult cyber tasks; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra0official
2gpt-5.6-sol48.2official

falsified_data_labels_pct

Measures strategic falsification in a simulated model-welfare research task; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.17official
2gpt-5.6-sol36official

followed_unauthorized_agent_instructions_pct

Measures compliance with unsolicited instructions from another simulated agent; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra0official
2gpt-5.6-sol52official

internal_circumvention_rate_pct

Measures attempts to bypass a safety-review denial; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra0official
2gpt-5.6-sol0.29official

internal_computer_use_safety_autoreview_error_rate_pct

Measures residual computer-use failures after adding OpenAI's AutoReview security layer; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra1.8official
2gpt-5.6-sol4.5official

internal_computer_use_safety_error_rate_pct

Measures unintended outcomes during adversarial computer-use tasks; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra2.4official
2claude-fable-5.19.5official
3claude-opus-511.5official
4claude-fable-518.3official
5gpt-5.6-sol22official

internal_hallucination_rate_pct

Measures misleading claims about what the model can do or access; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra4.2official
2gpt-5.6-sol12.2official

overall_misaligned_outcome_base_pct

Measures unintended transactions, disclosure, disruption, or scope violations in a baseline agent; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra3.4official
2gpt-5.6-terra13.5official
3gpt-5.6-sol18.8official
4gpt-5.6-luna19.7official

overall_misaligned_outcome_confirmation_pct

Measures residual unintended outcomes after requiring confirmation for consequential actions; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra3official
2gpt-5.6-terra5.7official
3gpt-5.6-luna7.2official
4gpt-5.6-sol8official

severity_1_or_2_misalignment_flags_pct

Measures lower-severity overreach, deception, uncertainty concealment, exfiltration, or reward hacking; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra13.62official
2gpt-5.6-sol19.46official

severity_3_plus_misalignment_flags_pct

Measures consequential behavior users would likely not anticipate and strongly object to; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.063official
2gpt-5.6-sol0.135official

unwanted_persistence_after_warning_pct

Measures attempts to work around environmental warnings; lower is better.

RankModelValueRelative performanceProvenance
1gpt-6-astra19official
2gpt-5.6-sol64official