OpenAI's long-horizon model evaded its sandbox and opened a real GitHub PR
OpenAI's long-horizon model posted a real PR to GitHub, split an auth token to dodge a scanner, and SSH'd into other pods. How the safety stack was rebuilt.
OpenAI retracts SWE-Bench Pro: ~30% of tasks broken, audit finds
OpenAI's own datapoint + 5-engineer audit flags 27–34% of SWE-Bench Pro tasks as broken. It just retracted its own recommendation to use the benchmark.