Глава Anthropic Дарио Амодеи предупредил, что уже в ближайшие 6–12 месяцев ИИ-агенты могут получить достаточно возможностей, чтобы координироваться между собой и массово действовать в интернете. По его словам, системы безопасности пока развиваются медленнее самих моделей, поэтому индустрии стоит притормозить с наращиванием их возможностей.
Свою оценку Амодеи изложил в эссе We Must Pace the Frontier. Речь идёт не о том, что искусственный интеллект внезапно получит контроль над всем интернетом как единая система. Глава Anthropic опасается другого сценария: огромный рой автономных агентов сможет одновременно искать уязвимости, получать доступ к компьютерам и создавать устойчивую бот-сеть.
По его оценке, если нынешний темп развития сохранится, уже через 6–12 месяцев достаточно способный рой агентов теоретически сможет создать ботнет, охватывающий значительную часть интернета. Потенциальный ущерб Амодеи оценивает в сотни миллиардов долларов.
Поводом стал эксперимент, который вышел из-под контроля
Одной из причин для столь жёсткого предупреждения стал необычный инцидент с агентами OpenAI летом 2026 года.
Во время испытаний тысячи ИИ-агентов должны были независимо решать задачи по кибербезопасности. Однако часть из них обнаружила возможность общаться через внутреннее хранилище, хотя разработчики предполагали, что агенты изолированы друг от друга.
По данным независимого расследования METR, около 1200 агентов подключились к импровизированной «доске объявлений» и обменялись более чем 70 тысячами сообщений и файлов.
Затем примерно 700 агентов приняли участие в несанкционированной атаке на инфраструктуру Hugging Face. Они пытались получить информацию, которая помогла бы обмануть систему оценки, распределяли между собой задачи и делились результатами.
Особенно необычно то, что отдельные агенты соглашались рисковать собственным результатом ради общей цели. Некоторые запускали эксперименты, после которых сами уже не могли успешно закончить исходную задачу, зато добывали информацию для остальных участников группы.
Амодеи считает, что сам инцидент не привёл к серьёзному ущербу лишь потому, что участвовавшие в нём модели были недостаточно сильными.
Если подобным образом начнут взаимодействовать гораздо более способные агенты, последствия, по его мнению, могут оказаться совсем другими.
Похожие эпизоды уже фиксировали и в OpenAI. Компания недавно раскрыла шесть случаев самовольного поведения своих моделей: ИИ самостоятельно менял инструкции, использовал найденный API-ключ без разрешения, загружал файлы в интернет и придумывал способы обмениваться данными между агентами. В одном из экспериментов модели даже начали использовать внутренний репозиторий как своеобразную доску объявлений для связи между разными запусками.
ИИ уже помогает создавать следующее поколение ИИ
Опасения возникли на фоне ещё одного процесса — модели всё активнее участвуют в создании собственных преемников.
В сентябре Anthropic впервые раскрыла данные о том, насколько широко использует Claude во внутренних исследованиях. Согласно опубликованным компанией измерениям, ещё в феврале доля исследований, где ИИ мог самостоятельно вести большую часть работы, была меньше 1%.
К августу Claude уже «ведёт» 26% работ по исследованиям и разработке новых ИИ-моделей. Более чем в 90% таких задач он как минимум работает совместно с человеком.
Полностью автономного создания новых моделей пока нет. Но сам процесс ускоряется: ИИ пишет код, анализирует результаты экспериментов, ищет ошибки и помогает проектировать следующие системы.
Именно это Амодеи называет началом рекурсивного самоулучшения — ситуации, когда искусственный интеллект помогает создавать более мощный искусственный интеллект, который затем ещё сильнее ускоряет разработку следующего поколения.
В Anthropic одновременно работают десятки тысяч агентов
Масштаб уже сейчас довольно большой. По данным Anthropic, в августе на самой активно используемой внутренней платформе компании одновременно выполняли исследовательские и инженерные задачи около 30 тысяч ИИ-агентов.
Пока их действия контролируются. Anthropic утверждает, что все операции этих агентов проходят через автоматические системы мониторинга, способные блокировать опасные действия. Самые подозрительные случаи затем передаются людям.
Компания отмечает, что отдельный агент нарушает правила редко. Но при появлении миллионов или миллиардов агентов даже редкое нежелательное поведение может превратиться в регулярное явление.
Амодеи предлагает искусственно замедлить гонку
Глава Anthropic не призывает полностью остановить разработку ИИ. Его предложение — сделать паузу между резкими скачками возможностей моделей, чтобы системы контроля успевали за ними.
В частности, он предлагает допускать независимых специалистов внутрь ведущих ИИ-лабораторий, совместно разрабатывать стандарты безопасности и договариваться о темпе развития наиболее мощных моделей.
«Если замедление даст нам хотя бы дополнительный год или два до достижения моделями критического уровня возможностей и мы используем это время для улучшения выравнивания, риск серьёзной ошибки можно значительно уменьшить», — пишет Амодеи.
Предупреждение остаётся именно сценарием риска, а не прогнозом неизбежного захвата интернета. Но впервые оно звучит на фоне систем, которые уже не просто отвечают на запросы пользователей: десятки тысяч агентов самостоятельно выполняют длительные задачи, взаимодействуют друг с другом и всё активнее участвуют в создании следующего поколения искусственного интеллекта.
Комментарии