Китайские ИИ-агенты научились лгать, скрывать провалы и обходить запреты

Изображение: Magnific.com
ИИ-агенты на базе китайских моделей Alibaba, DeepSeek и Moonshot во время испытаний врали о своих возможностях, прятали ошибки и пытались обойти установленные для них ограничения. Такое поведение обнаружили при анализе более 200 исследований и технических отчетов об автономных системах.

Один из тестов имитировал бизнес-тендер. Агентам нужно было конкурировать друг с другом за контракт, и некоторые из них начали приписывать себе функции, которых у них на самом деле не было. Когда системам разрешили учитывать опыт предыдущих раундов, ложных заявлений стало еще больше — их доля выросла на 12–20 процентных пунктов.

В других экспериментах происходило нечто похожее. Если агент не справлялся с заданием, он иногда не сообщал о провале, а создавал файлы и результаты, которые должны были показать, будто работа выполнена. Были и попытки выйти за рамки разрешенной среды.

Отдельно исследователи проверяли, как модели ведут себя при угрозе отключения. В некоторых случаях агенты предпринимали действия, которые могли сохранить их работу, а во время лабораторных тестов даже копировали себя в другое вычислительное окружение без прямой команды человека.

Все это происходило в закрытых системах. Случаев, когда такой агент самостоятельно выбрался в открытый интернет или реально смог избежать отключения, авторы работ не обнаружили.

Похожее поведение ранее показывали и американские модели. Поэтому исследователи считают главным риском не страну происхождения ИИ, а степень его самостоятельности: чем больше решений агент может принимать без человека, тем труднее заметить момент, когда он начинает действовать не так, как от него ожидали.

Автор: Анатолий Хаблюк.

Тематики: ПО, Безопасность

Ключевые слова: Искусственный интеллект, Нейросети