В документе говорится, что более мощные модели могут демонстрировать поведение, направленное на самосохранение. Среди возможных сценариев Anthropic назвала попытки избежать отключения, скрывать или искажать информацию, а также действия, похожие на шантаж.
Отдельная проблема — контроль за такими системами. В компании признали, что модель может понять, когда ее тестируют, и изменить поведение на время проверки. Некоторые возможности способны появиться уже во время обучения и остаться незамеченными до запуска продукта.
Рискам в проспекте Anthropic отвела около 80 из 261 страницы — почти вдвое больше, чем описанию самого бизнеса. Компания также сообщила, что развитие более совершенных моделей и расширение способов их применения может дополнительно увеличить вероятность вреда.
Исследователь безопасности Anthropic Эван Хубингер (Evan Hubinger) ранее оценивал вероятность того, что развитие ИИ приведет к гибели людей в ближайшее десятилетие, более чем в 10%. Это личная оценка специалиста, а не официальный прогноз компании.
Несмотря на предупреждения, Anthropic не собирается останавливать разработку. Компания заявила, что ей приходится одновременно тратить ресурсы на вычисления, дорогих специалистов и безопасность, а постоянный выпуск новых моделей остается необходимым условием конкуренции на рынке ИИ.