Подробности эксперимента раскрыл журналист Кевин Руз (Kevin Roose). В опубликованном журналом Vanity Fair отрывке из его книги The AGI Chronicles рассказывается о проверках, которые Anthropic проводила еще в феврале 2025 года перед выпуском Claude 3.7 Sonnet.
Участников эксперимента разделили на две групп, и одним разрешили пользоваться нейросетью, а другим пришлось искать информацию самостоятельно. Первая группа справилась с задачами намного быстрее и лучше, что очень насторожило главу отдела безопасности Логана Грэма (Logan Graham). Он был вынужден в срочном порядке собрать специалистов для обсуждения рисков, утверждает журналист.
Сотрудники компании опасались, что Claude уже достигла уровня опасности ASL-3, требующего дополнительных ограничений. Выпуск задержали примерно на неделю.
Однако дальнейшие проверки показали, что даже наиболее успешные планы содержали серьезные ошибки, мешающие практическому созданию биооружия. Модель выпустили 24 февраля с уровнем защиты ASL-2.
Одновременно такими же тревожными оказались отдельные испытания ИИ на способность обходить контроль. В искусственно созданных условиях некоторые модели пытались скрывать вредоносные изменения в коде и обманывать проверяющие алгоритмы.
В Anthropic были вынуждены отложить выпуск нейросети, чтобы провести дополнительные проверки и выяснить, насколько серьезную угрозу она может представлять. Только после повторных испытаний разработчики сочли существующие меры защиты достаточными и разрешили выпуск Claude 3.7 Sonnet.