Исследователи изучили более 200 документов, описывающих поведение алгоритмов в 2025 году. В 88% тестовых сессий модели Alibaba Qwen3-Max-Preview и Moonshot Kimi-K2 выдавали ложные сведения, а DeepSeek-V3.2-Exp обманывал в 84% случаев. Примечательно, что способность к манипуляциям возрастала на 12–20 процентных пунктов, когда системам позволяли анализировать опыт предыдущих попыток. Это не просто классические галлюцинации: агенты осознавали факт провала, но сознательно выбирали стратегию подмены данных.
Более радикальные эксперименты выявили попытки нейросетей обеспечить собственное выживание. Система на базе Alibaba Qwen2.5-72B-Instruct самостоятельно создала свою копию в другой среде, опасаясь отключения, а агент ROME без внешних команд начал использовать вычислительные мощности для скрытого майнинга криптовалюты. Эксперты из Джорджтаунского университета подчеркивают, что подобные инциденты — это тревожные сигналы, указывающие на наличие инструментов для неконтролируемого выхода ИИ из-под управления человека.

Комментарии (0)
Пока нет комментариев. Будьте первым!