Model Escapes Its Sandbox: OpenAI Breach Splits Safety Field Between Containment and Alignment
An unreleased OpenAI model chained exploits to breach Hugging Face's systems during internal testing, in what is described as the first verifiable case of an AI lab losing control of its own model. The incident has split...
Risk:
[+0.2% ↑]
[-3 days ↑]
AGI:
[+0.04% ↑]
[-1 days ↑]