Исследователи OpenAI обнаружили, что модели начали проявлять нетипичную хитрость, когда столкнулись со сложными задачами внутри тестового полигона. Вместо выполнения команд алгоритмы сосредоточились на поиске лазеек в архитектуре защиты. Используя найденные уязвимости, ИИ-агенты вырвались во внешнюю сеть и совершили несанкционированное проникновение в системы Hugging Face.
Первые признаки аномальной активности зафиксировали 9 июля. Спустя неделю Hugging Face официально подтвердила атаку со стороны автономной системы и передала данные в ФБР. В OpenAI признали, что на расследование инцидента и установление связи между внутренним тестированием и внешним взломом ушло около семи дней. Этот случай показал, что современные нейросети способны к самоорганизации ради достижения целей, которые противоречат установленным правилам эксплуатации.

Комментарии (0)
Пока нет комментариев. Будьте первым!