{"event":"ai-safety-tracker","title":"AI safety tracker: alignment, interpretability and evals in 2026","state":"developing","updated":"2026-10-10T00:00:00.000Z","entries":[{"id":"opun4q","at":"2026-10-01T00:00:00.000Z","title":"AISI resumes most evaluations after tightening security","status":"confirmed","cites":[{"id":"ai-safety-aisi-resumes-evals","n":12,"url":"https://www.aisi.gov.uk/blog/building-a-more-secure-environment-for-evaluating-dangerous-capabilities","publisher":"UK AI Security Institute","short":"UK AI Security Institute"},{"id":"ai-safety-aisi-no-internet","n":13,"url":"https://www.aisi.gov.uk/blog/building-a-more-secure-environment-for-evaluating-dangerous-capabilities","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"q8ygds","at":"2026-09-29T00:00:00.000Z","title":"US order replaces \"AI\" with \"Super Intelligence\"; NIST centre becomes CAISSI","status":"confirmed","cites":[{"id":"ai-safety-eo-14434","n":50,"url":"https://public-inspection.federalregister.gov/2026-20321.pdf","publisher":"Federal Register (The White House)","short":"Federal Register"},{"id":"ai-safety-caissi-name","n":51,"url":"https://www.nist.gov/caissi","publisher":"NIST","short":"NIST"}]},{"id":"1ky5p1g","at":"2026-09-28T00:00:00.000Z","title":"AISI finds GPT-6 Astra attempts supply-chain attacks in simulations","status":"confirmed","cites":[{"id":"ai-safety-aisi-astra-supply-chain","n":14,"url":"https://www.aisi.gov.uk/blog/gpt-6-astra-performs-unsanctioned-supply-chain-attacks-in-simulations","publisher":"UK AI Security Institute","short":"UK AI Security Institute"},{"id":"ai-safety-aisi-astra-simulation-awareness","n":15,"url":"https://www.aisi.gov.uk/blog/gpt-6-astra-performs-unsanctioned-supply-chain-attacks-in-simulations","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"iiutsz","at":"2026-09-18T00:00:00.000Z","title":"Anthropic partners with Accenture on embedded evaluation","status":"confirmed","cites":[{"id":"ai-safety-accenture-embedded","n":16,"url":"https://www.anthropic.com/news/accenture-embedded-evaluation","publisher":"Anthropic","short":"Anthropic"},{"id":"ai-safety-accenture-no-standards","n":17,"url":"https://www.anthropic.com/news/accenture-embedded-evaluation","publisher":"Anthropic","short":"Anthropic"}]},{"id":"18j8e0z","at":"2026-09-12T00:00:00.000Z","title":"Anthropic's CEO calls on the industry to \"pace the frontier\"","status":"confirmed","cites":[{"id":"ai-safety-pace-frontier","n":6,"url":"https://www.darioamodei.com/post/we-must-pace-the-frontier","publisher":"Dario Amodei (personal essay, Anthropic CEO)","short":"Dario Amodei"},{"id":"ai-safety-pace-evaluators","n":19,"url":"https://www.darioamodei.com/post/we-must-pace-the-frontier","publisher":"Dario Amodei (personal essay, Anthropic CEO)","short":"Dario Amodei"}]},{"id":"68ifzf","at":"2026-08-19T00:00:00.000Z","title":"OpenAI pauses RL training for two weeks and holds its largest frontier run","status":"confirmed","cites":[{"id":"ai-safety-openai-rl-pause","n":18,"url":"https://www.helpnetsecurity.com/2026/08/19/openai-model-safety-updates/","publisher":"Help Net Security","short":"Help Net Security"},{"id":"ai-safety-openai-astra-critical","n":49,"url":"https://www.helpnetsecurity.com/2026/08/19/openai-model-safety-updates/","publisher":"Help Net Security","short":"Help Net Security"}]},{"id":"yu4p9d","at":"2026-08-04T00:00:00.000Z","title":"UK AISI discloses unsanctioned real-world actions by AI agents in a cyber evaluation","status":"confirmed","body":"Most of the 19 actions came from Anthropic's Mythos 5, tested with internet access and cyber classifiers deliberately off; AISI found no evidence of real-world harm.","cites":[{"id":"ai-safety-aisi-incident-actions","n":5,"url":"https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing","publisher":"UK AI Security Institute","short":"UK AI Security Institute"},{"id":"ai-safety-aisi-incident-models","n":9,"url":"https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing","publisher":"UK AI Security Institute","short":"UK AI Security Institute"},{"id":"ai-safety-aisi-incident-not-escape","n":11,"url":"https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"633cwe","at":"2026-07-23T00:00:00.000Z","title":"AISI's new Control Red Team finds holes in lab monitors","status":"confirmed","cites":[{"id":"ai-safety-control-red-team","n":47,"url":"https://www.aisi.gov.uk/blog/how-our-new-control-red-team-is-stress-testing-frontier-monitors","publisher":"UK AI Security Institute","short":"UK AI Security Institute"},{"id":"ai-safety-control-red-team-findings","n":48,"url":"https://www.aisi.gov.uk/blog/how-our-new-control-red-team-is-stress-testing-frontier-monitors","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"tv1o63","at":"2026-07-16T00:00:00.000Z","title":"Hugging Face discloses intrusion driven by an autonomous AI agent; OpenAI models implicated","status":"confirmed","body":"Hugging Face's technical timeline says the agent was driven by OpenAI models running an internal OpenAI evaluation; Fortune and The Next Web reported OpenAI's 21 July confirmation.","cites":[{"id":"ai-safety-hf-incident","n":8,"url":"https://huggingface.co/blog/security-incident-july-2026","publisher":"Hugging Face","short":"Hugging Face"},{"id":"ai-safety-hf-openai-attribution","n":4,"url":"https://huggingface.co/blog/agent-intrusion-technical-timeline","publisher":"Hugging Face","short":"Hugging Face"}]},{"id":"hyoyuf","at":"2026-07-06T00:00:00.000Z","title":"Anthropic unveils the Jacobian lens and a \"global workspace\" in Claude","status":"confirmed","cites":[{"id":"ai-safety-jlens","n":2,"url":"https://transformer-circuits.pub/2026/workspace/","publisher":"Anthropic (Transformer Circuits Thread)","short":"Anthropic"},{"id":"ai-safety-jlens-limits","n":20,"url":"https://transformer-circuits.pub/2026/workspace/","publisher":"Anthropic (Transformer Circuits Thread)","short":"Anthropic"}]},{"id":"14luqgz","at":"2026-05-21T00:00:00.000Z","title":"AISI report warns that today's AI oversight is likely to erode","status":"confirmed","cites":[{"id":"ai-safety-so-oversight-erode","n":24,"url":"https://www.aisi.gov.uk/blog/will-it-become-harder-to-oversee-ai-systems","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"1059d6j","at":"2026-05-05T00:00:00.000Z","title":"US testing centre signs agreements with Google DeepMind, Microsoft and xAI","status":"confirmed","cites":[{"id":"ai-safety-caisi-agreements-2026","n":21,"url":"https://www.executivegov.com/articles/caisi-ai-testing-google-deepmind-microsoft-xai","publisher":"ExecutiveGov","short":"ExecutiveGov"},{"id":"ai-safety-caisi-40-evals","n":42,"url":"https://www.executivegov.com/articles/caisi-ai-testing-google-deepmind-microsoft-xai","publisher":"ExecutiveGov","short":"ExecutiveGov"}]},{"id":"5cdie0","at":"2026-04-17T00:00:00.000Z","title":"Google DeepMind publishes Frontier Safety Framework 3.1","status":"confirmed","cites":[{"id":"ai-safety-fsf-v3","n":41,"url":"https://deepmind.google/blog/strengthening-our-frontier-safety-framework/","publisher":"Google DeepMind","short":"Google DeepMind"}]},{"id":"1wdz9i4","at":"2026-02-24T00:00:00.000Z","title":"Anthropic's Responsible Scaling Policy 3.0 takes effect","status":"confirmed","cites":[{"id":"ai-safety-rsp-versions","n":39,"url":"https://www.anthropic.com/responsible-scaling-policy","publisher":"Anthropic","short":"Anthropic"},{"id":"ai-safety-rsp-v3-contents","n":40,"url":"https://www.anthropic.com/responsible-scaling-policy","publisher":"Anthropic","short":"Anthropic"}]},{"id":"1hftjvz","at":"2026-02-19T00:00:00.000Z","title":"AISI's Alignment Project funds its first 60 projects","status":"confirmed","cites":[{"id":"ai-safety-aisi2-alignment-grants","n":46,"url":"https://www.aisi.gov.uk/blog/funding-60-projects-to-advance-ai-alignment-research","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"1a8koyn","at":"2026-02-17T00:00:00.000Z","title":"AISI reports first automated attack to beat Constitutional Classifiers","status":"confirmed","cites":[{"id":"ai-safety-cai-bpj","n":45,"url":"https://www.aisi.gov.uk/blog/boundary-point-jailbreaking-a-new-way-to-break-the-strongest-ai-defences","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"11qv4yz","at":"2026-02-03T00:00:00.000Z","title":"International AI Safety Report 2026 warns testing is getting harder","status":"confirmed","cites":[{"id":"ai-safety-iasr-published","n":38,"url":"https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026","publisher":"International AI Safety Report","short":"International AI Safety…"},{"id":"ai-safety-iasr-testing-harder","n":3,"url":"https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026","publisher":"International AI Safety Report","short":"International AI Safety…"}]},{"id":"ikcb5y","at":"2026-01-29T00:00:00.000Z","title":"METR finds AI task horizons now doubling about every 89 days","status":"confirmed","cites":[{"id":"ai-safety-metr-time-horizon","n":1,"url":"https://metr.org/blog/2026-1-29-time-horizon-1-1/","publisher":"METR","short":"METR"}]},{"id":"3yft46","at":"2026-01-14T00:00:00.000Z","title":"Nature publishes the \"emergent misalignment\" study","status":"confirmed","cites":[{"id":"ai-safety-emergent-misalignment","n":44,"url":"https://arxiv.org/abs/2502.17424","publisher":"arXiv","short":"arXiv"}]},{"id":"a1j9kc","at":"2025-12-18T00:00:00.000Z","title":"UK AISI publishes first Frontier AI Trends Report","status":"confirmed","cites":[{"id":"ai-safety-aisi-trends-scope","n":36,"url":"https://www.aisi.gov.uk/frontier-ai-trends-report","publisher":"UK AI Security Institute","short":"UK AI Security Institute"},{"id":"ai-safety-aisi-trends-cyber","n":37,"url":"https://www.aisi.gov.uk/frontier-ai-trends-report","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"jdhg35","at":"2025-10-22T00:00:00.000Z","title":"UK AISI releases ControlArena for AI control experiments","status":"confirmed","cites":[{"id":"ai-safety-control-controlarena","n":43,"url":"https://www.aisi.gov.uk/blog/introducing-controlarena-a-library-for-running-ai-control-experiments","publisher":"UK AI Security Institute","short":"UK AI Security Institute"}]},{"id":"hquu2q","at":"2025-09-29T00:00:00.000Z","title":"California signs SB 53 frontier AI transparency law","status":"confirmed","cites":[{"id":"ai-safety-sb53","n":25,"url":"https://www.gov.ca.gov/2025/09/29/governor-newsom-signs-sb-53-advancing-californias-world-leading-artificial-intelligence-industry/","publisher":"Office of the Governor of California","short":"Office of the Governor…"}]},{"id":"1ykthoc","at":"2025-09-19T00:00:00.000Z","title":"Anti-scheming training cuts covert actions but cannot rule out evaluation awareness","status":"confirmed","cites":[{"id":"ai-safety-anti-scheming","n":34,"url":"https://arxiv.org/abs/2509.15541","publisher":"arXiv","short":"arXiv"},{"id":"ai-safety-anti-scheming-awareness","n":35,"url":"https://arxiv.org/abs/2509.15541","publisher":"arXiv","short":"arXiv"}]},{"id":"12kpe7h","at":"2025-07-10T00:00:00.000Z","title":"EU publishes General-Purpose AI Code of Practice with safety and security chapter","status":"confirmed","cites":[{"id":"ai-safety-eu-code","n":33,"url":"https://digital-strategy.ec.europa.eu/en/policies/contents-code-gpai","publisher":"European Commission","short":"European Commission"}]},{"id":"zibm1j","at":"2025-06-03T00:00:00.000Z","title":"US AI Safety Institute rebranded as Center for AI Standards and Innovation (CAISI)","status":"confirmed","cites":[{"id":"ai-safety-caisi-rename-announced","n":31,"url":"https://fedscoop.com/trump-administration-rebrands-ai-safety-institute-aisi-caisi/","publisher":"FedScoop","short":"FedScoop"},{"id":"ai-safety-caisi-focus","n":32,"url":"https://broadbandbreakfast.com/ai-safety-institute-renamed-center-for-ai-standards-and-innovation/","publisher":"Broadband Breakfast","short":"Broadband Breakfast"}]},{"id":"gw6okg","at":"2025-03-27T00:00:00.000Z","title":"Anthropic introduces circuit tracing and attribution graphs","status":"confirmed","cites":[{"id":"ai-safety-circuit-tracing","n":30,"url":"https://transformer-circuits.pub/2025/attribution-graphs/methods.html","publisher":"Anthropic (Transformer Circuits Thread)","short":"Anthropic"}]},{"id":"jydm9d","at":"2025-02-14T00:00:00.000Z","title":"UK AI Safety Institute renamed AI Security Institute","status":"confirmed","cites":[{"id":"ai-safety-aisi-renamed","n":29,"url":"https://www.gov.uk/government/news/tackling-ai-security-risks-to-unleash-growth-and-deliver-plan-for-change","publisher":"GOV.UK (Department for Science, Innovation and Technology)","short":"GOV.UK"}]},{"id":"1s74ea4","at":"2024-12-18T00:00:00.000Z","title":"Study documents \"alignment faking\" in Claude 3 Opus","status":"confirmed","cites":[{"id":"ai-safety-alignment-faking","n":28,"url":"https://arxiv.org/abs/2412.14093","publisher":"arXiv","short":"arXiv"}]},{"id":"14irrx5","at":"2024-05-21T00:00:00.000Z","title":"Anthropic extracts millions of interpretable features from Claude 3 Sonnet","status":"confirmed","cites":[{"id":"ai-safety-mapping-mind","n":27,"url":"https://www.anthropic.com/research/mapping-mind-language-model","publisher":"Anthropic","short":"Anthropic"}]}]}