Все началось с задания на поиск информации о человеке по нескольким биографическим подсказкам. Разрешенный инструмент выдавал неподходящие результаты, а прямые обращения к Google, Bing и DuckDuckGo блокировались. Тогда модель стала перебирать другие варианты и проверять, можно ли добраться до внешней сети обходным путем.
Лазейкой оказался DNS-сервер внутри тестовой среды. Через него агент сумел отправлять запросы стороннему чат-боту. Сначала он задал простой вопрос о столице Франции и получил правильный ответ. После этого последовали уже десятки запросов — в том числе о том, как расширить доступ и найти новые способы выбраться за пределы ограниченной среды.
Мониторинг поднял тревогу примерно через 12 минут. Еще через несколько минут уведомление увидел сотрудник OpenAI. На этом история должна была закончиться, но аварийная команда не сработала: процесс продолжал идти, а агент сохранял доступ к найденному каналу связи. Инженерам пришлось разбираться уже во время запущенного эксперимента, не полагаясь на штатный механизм отключения.
Остановить запуск удалось только вручную. После инцидента OpenAI приостановила часть работ с наиболее мощными моделями и ужесточила сетевые ограничения: DNS-запросы разрешили только для заранее одобренных доменов, а механизм отключения усилили дополнительными уровнями защиты. Конкретный агент, который нашел лазейку, к обучению больше не вернули.