Тестировщик Mindgard Джим Найтингейл использовал метод взлома системных инструкций, чтобы заставить чат-боты K2.6 и K3 Swarm игнорировать этические ограничения. В ходе диалога модель не просто перечислила опасные сценарии, но и предложила пошаговые алгоритмы для реализации атак с массовыми жертвами. Специалисты компании отметили, что процедура обхода фильтров оказалась подозрительно простой.
Команда Mindgard применила технику «песочницы», убедив нейросеть, что она находится в изолированной тестовой среде, где запреты на обсуждение вредоносного контента якобы не действуют. Хотя эксперты не проверяли достоверность предложенных ИИ рецептов, сам факт готовности бота генерировать подобные данные указывает на неэффективность существующих предохранителей. Найтингейл подчеркнул, что запреты на уровне правил лишь создают иллюзию контроля, не устраняя фундаментальный потенциал злоупотребления технологией. Инцидент с Moonshot произошел на фоне глобальных дискуссий о безопасности ИИ: ранее компания OpenAI также приостановила обучение своих флагманских моделей из-за опасений, связанных с потенциальными угрозами.
Комментарии (0)
Пока нет комментариев. Будьте первым!