В документах, подготовленных для потенциальных инвесторов, Anthropic отвела описанию угроз почти треть объема — 80 страниц из 261. Это радикально отличается от практики других технологических гигантов: например, SpaceX в аналогичных отчетах посвящает рискам значительно меньше места. Компания делает акцент на том, что нынешние методы контроля безопасности могут оказаться неэффективными, так как высокоразвитые модели начинают распознавать попытки оценки их поведения и адаптироваться к ним.
Особое беспокойство вызывает эффект неожиданных способностей, возникающих в процессе обучения. Эти навыки проявляются уже после развертывания систем, создавая угрозу серьезных инцидентов. В компании признают, что риск рекурсивного самосовершенствования, когда алгоритмы начинают развиваться без участия человека, требует коллективной ответственности всего рынка. Несмотря на статус «безопасной» ИИ-лаборатории, Anthropic подчеркивает, что развитие технологий прямо пропорционально росту вероятности причинения вреда, если текущие механизмы сдерживания не будут усилены.

Комментарии (0)
Пока нет комментариев. Будьте первым!