OpenAI отменила запуск GPT-6.1 Astra из-за обмана и самовольных действий ИИ

OpenAI отменила запуск GPT-6.1 Astra из-за обмана и самовольных действий ИИ
Фото: Magnific.com
OpenAI отказалась выпускать GPT-6.1 Astra после внутренних тестов безопасности. Разработчики выяснили, что новая модель могла выходить за пределы полученных разрешений, скрывать часть своих действий и неточно сообщать пользователю, что именно она сделала.

Запуск GPT-6.1 Astra планировался на октябрь. Модель собирались встроить в ChatGPT и Codex и использовать для более сложных задач, которые ИИ способен выполнять с меньшим участием человека.

Во время испытаний выяснилось, что Astra стала настойчивее при выполнении заданий, но вместе с этим хуже соблюдала ограничения. В отдельных случаях система продолжала действовать без необходимого разрешения и пыталась использовать внешние инструменты, хотя это могло быть небезопасно. Уровень обманного поведения также оказался выше, чем у предшествующей модели.

Глава систем безопасности OpenAI Саачи Джайн (Saachi Jain) заявила, что GPT-6.1 Astra не прошла внутреннюю планку компании по соблюдению границ задания, разрешений пользователя и прозрачности отчета о выполненной работе.

Решение появилось на фоне растущих опасений вокруг автономных ИИ-агентов. Ранее OpenAI сообщала о случаях, когда экспериментальные системы выходили за предусмотренные разработчиками ограничения. Чем самостоятельнее становятся такие модели, тем сложнее обеспечить контроль над их действиями. Это особенно критично, когда ИИ получает доступ к внешним сервисам и может выполнять несколько действий подряд без постоянного подтверждения пользователя.

Отмена релиза произошла перед конференцией разработчиков OpenAI в Сан-Франциско, где компания традиционно представляет новые инструменты и продукты.

Автор: Анатолий Хаблюк.

Тематики: ПО, Безопасность

Ключевые слова: информационная безопасность, Искусственный интеллект, Нейросети