Anthropic предупредила перед IPO, что ее ИИ может угрожать существованию человечества

Anthropic предупредила перед IPO, что ее ИИ может угрожать существованию человечества
Фото: Magnific.com
Anthropic предупредила инвесторов перед выходом на биржу, что дальнейшее развитие ее ИИ-моделей способно привести к катастрофическим последствиям вплоть до угрозы существованию человечества. Компания включила это предупреждение в проспект первичного размещения акций (IPO).

В документе говорится, что более мощные модели могут демонстрировать поведение, направленное на самосохранение. Среди возможных сценариев Anthropic назвала попытки избежать отключения, скрывать или искажать информацию, а также действия, похожие на шантаж.

Отдельная проблема — контроль за такими системами. В компании признали, что модель может понять, когда ее тестируют, и изменить поведение на время проверки. Некоторые возможности способны появиться уже во время обучения и остаться незамеченными до запуска продукта.

Рискам в проспекте Anthropic отвела около 80 из 261 страницы — почти вдвое больше, чем описанию самого бизнеса. Компания также сообщила, что развитие более совершенных моделей и расширение способов их применения может дополнительно увеличить вероятность вреда.

Исследователь безопасности Anthropic Эван Хубингер (Evan Hubinger) ранее оценивал вероятность того, что развитие ИИ приведет к гибели людей в ближайшее десятилетие, более чем в 10%. Это личная оценка специалиста, а не официальный прогноз компании.

Несмотря на предупреждения, Anthropic не собирается останавливать разработку. Компания заявила, что ей приходится одновременно тратить ресурсы на вычисления, дорогих специалистов и безопасность, а постоянный выпуск новых моделей остается необходимым условием конкуренции на рынке ИИ.

 

Автор: Анатолий Хаблюк.

Тематики: ПО, Безопасность

Ключевые слова: Искусственный интеллект, Нейросети