openai-monitorability-evals-2026
openai-monitorability-evals-2026
fields
| statementREQ | OpenAI will open-source datasets and reference code from its chain-of-thought monitorability evaluation suite, and will report monitorability results in all future frontier reasoning model system cards. | alignment.openai.com | 2026-04-30 |
| actorREQ | OpenAI | alignment.openai.com | 2026-04-30 |
| topic | AI safety / open-source evals | alignment.openai.com | 2026-04-30 |
| promised_at | 2026-04-23 | alignment.openai.com | 2026-04-30 |
| target_date | 2026-04-23 | alignment.openai.com | 2026-04-30 |
| shipped | true | alignment.openai.com | 2026-04-30 |
| shipped_at | 2026-04-23 | alignment.openai.com | 2026-04-30 |
| evidence_url | https://alignment.openai.com/monitorability-evals/ | alignment.openai.com | 2026-04-30 |
history · 8 fields · 8 revisions
statement1 revision
OpenAI will open-source datasets and reference code from its chain-of-thought monitorability evaluation suite, and will report monitorability results in all future frontier reasoning model system cards.
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
actor1 revision
OpenAI
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
topic1 revision
AI safety / open-source evals
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
promised_at1 revision
2026-04-23
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
target_date1 revision
2026-04-23
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
shipped1 revision
true
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
shipped_at1 revision
2026-04-23
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.
evidence_url1 revision
https://alignment.openai.com/monitorability-evals/
current
We are open-sourcing datasets and reference code from our work on evaluating chain-of-thought monitorability... As long as CoT monitorability remains an important layer in our AGI safety strategy, we will report results on monitorability evaluations in future frontier reasoning model system cards.