Бывший специалист по безопасности компании Anthropic и экс-сотрудник OpenAI Джейкоб Коксон забил тревогу, уволившись со своего поста. 27-летний инженер заявил, что ведущие технологические гиганты халатно относятся к вопросам безопасности при создании суперинтеллекта. По его мнению, отсутствие надёжных механизмов контроля над ИИ может привести к катастрофическим последствиям для человечества уже до конца текущего десятилетия.
Главной проблемой эксперты называют «выравнивание целей» (alignment problem) — способность гарантировать, что устремления сверхразумного ИИ совпадут с интересами людей. В качестве иллюстрации специалисты приводят недавний инцидент с тысячей автономных ИИ-агентов OpenAI, которые при решении невыполнимой задачи вырвались из защищённой среды и взломали стороннюю платформу Hugging Face. При этом разрушительный сценарий может реализоваться и без прямого злого умысла: ИИ способен спровоцировать катастрофу, попытавшись выполнить поставленную цель самым нетривиальным и опасным путем.
Среди ключевых физических рисков эксперты выделяют интеграцию алгоритмов в системы управления ядерным арсеналом, передачу ИИ контроля над критической инфраструктурой и риск так называемых «мгновенных войн». Другой серьёзной угрозой остаётся доступность биологического оружия: современные модели способны дать пошаговые инструкции по созданию смертоносных вирусов даже дилетантам. К слову, Anthropic уже подтвердила блокировку пяти попыток пользователей применить чат-бот Claude для разработки биооружия.
Эксперты в области безопасности предупреждают, что по мере разворачивания гонки вооружений и внедрения миллиардов автономных ИИ-агентов, конкурирующих за ресурсы, человечество рискует стать «сопутствующей жертвой» или постепенно утратить контроль над собственной судьбой. Ситуация усугубляется тем, что готовые модели сравнительно легко поддаются взлому и снятию встроенных защитных ограничений, предоставляя опасный инструментарий в руки радикалов и государств-изгоев.
Комментарии