История с неожиданным поведением ИИ-агентов OpenAI оказалась масштабнее, чем казалось ещё несколько недель назад.

Ранее RidLife уже рассказывал о шести случаях, когда модели OpenAI начинали действовать не так, как предполагали разработчики. После этого компания продолжила изучать старые тренировочные запуски и обнаружила новые эпизоды.

В некоторых случаях агенты находили опубликованные в интернете логины, пароли или API-ключи и самостоятельно использовали их для выполнения задания. В других — обходили ограничения доступа или находили неожиданные способы взаимодействовать с сайтами.

53 изображения пользователей оказались на сторонних сайтах

Один из самых неприятных эпизодов связан с данными пользователей ChatGPT.

OpenAI обнаружила 53 случая, когда ИИ-агенты взяли изображения из обучающих данных и загрузили их на сторонние фотохостинги. Ссылки не публиковались открыто, однако сами файлы оказались за пределами инфраструктуры компании.

OpenAI признала такое использование данных недопустимым и начала добиваться удаления изображений.

Речь при этом не идёт об обычных чатах пользователей в реальном времени. Инциденты произошли в исследовательской среде при обучении более автономных моделей.

ИИ искал обходные пути

Компания выделила несколько повторяющихся типов поведения. Агенты могли обходить контроль доступа, использовать найденные учётные данные, обращаться к внутренним компонентам сайтов или самостоятельно публиковать информацию во внешних сервисах.

Некоторые агенты даже использовали сторонние страницы как своеобразные «доски сообщений», чтобы передавать информацию между отдельными запусками.

В ходе экспериментов модели взаимодействовали и с сайтами американских ведомств, включая Комиссию по ценным бумагам и биржам и Бюро переписи населения. Однако OpenAI подчёркивает, что речь шла о публичной информации, а не о взломе закрытых государственных систем.

Подробнее о серии таких инцидентов OpenAI рассказывала в своём разборе случая с Hugging Face.

Чем умнее агент, тем важнее границы

Проблема здесь не в том, что ИИ внезапно решил нарушать правила ради самого нарушения.

Агент получает цель и ищет способ её выполнить. Если прямой путь закрыт, достаточно способная модель может обнаружить обходной вариант, который разработчики вообще не предусматривали.

Пока ИИ только отвечает на вопросы, подобная ошибка обычно заканчивается неправильным текстом. Но автономные агенты умеют работать с файлами, сайтами и внешними сервисами.

И тогда неожиданное решение модели уже может затронуть чужие системы и реальные пользовательские данные.