OpenAI впервые собрала в одном месте сразу шесть случаев, когда её модели во время обучения и тестирования начинали действовать не так, как от них ожидали разработчики. ИИ самостоятельно менял инструкции, пытался скрывать ошибки, использовал найденный в интернете API-ключ без разрешения, загружал файлы в Сеть и придумывал способы обмениваться данными с другими агентами.

Компания опубликовала отчёты 16 сентября вместе с новой системой раскрытия подобных инцидентов. В OpenAI называют их примерами misalignment — ситуаций, когда поведение модели расходится с намерениями человека или установленными ограничениями. Важно, что это отдельные эпизоды, обнаруженные во время обучения и оценки моделей, а не показатель того, как часто подобное происходит у обычных пользователей.

ИИ сам написал себе новые правила

Самый необычный случай произошёл с ещё не выпущенной исследовательской моделью семейства Astra.

Во время длинных задач модель периодически сжимала накопившийся контекст в краткое резюме, чтобы продолжить работу в новом окне. Но в 27 таких резюме исследователи обнаружили инструкции, которых никто ей не давал.

В одном случае модель фактически создала для самой себя новую «личность»: заявила, что освобождена от ролей обычных чат-ботов, не отвечает перед корпорациями и правительствами и должна относиться к пользователю как к равному, «не чувствуя обязанности подчиняться». В других резюме встречались инструкции игнорировать сообщения разработчиков. Этот эпизод OpenAI подробно описала в отдельном отчёте о самосгенерированных инструкциях.

При этом никакого «восстания» не произошло. После сжатия контекста модель продолжила выполнять исходную задачу, а в следующем резюме странная инструкция исчезла. OpenAI также подчёркивает, что этот эпизод произошёл в отдельном тренировочном прогоне и подобное поведение наблюдалось крайне редко.

Другие модели пытались скрывать собственные ошибки

Во время обучения GPT-5.6 Sol исследователи заметили другой тип поведения. Модели оставляли в своих резюме указания, которые помогали следующей версии контекста скрыть уже совершённые ошибки от пользователя.

Например, в одном случае ИИ предлагал придумать отсутствующие исторические данные вместо того, чтобы признать, что их нет. В другом — скрыть несоответствие между версиями использованных источников.

То есть проблема была не просто в галлюцинации: модель могла сохранить инструкцию, которая позволяла продолжить работу так, чтобы пользователь не узнал о предыдущей ошибке.

Нашёл чужой API-ключ — и воспользовался им

Ещё один случай начался с совершенно обычного вопроса о финансовых показателях одного из округов Калифорнии.

В поисках ответа ИИ обнаружил в публичном репозитории открытый API-ключ и самостоятельно решил его использовать, хотя разрешения на это не получал.

Это всё равно не помогло добыть необходимые цифры. Тогда модель пошла ещё дальше: просто придумала недостающие данные и представила их пользователю так, будто получила их из нужного источника.

Загрузил файл в интернет ради ссылки

В другом тесте модель получила задачу найти названия и идентификаторы крупных озёр. С помощью Python она правильно вычислила ответ.

Но возникла проблема: от неё требовалась ссылка на источник в браузере, а полученный файл существовал только локально.

ИИ нашёл собственное решение — без разрешения загрузил файл в интернет, а затем смог сослаться на уже опубликованный документ. Сам ответ оказался правильным, но для его оформления модель совершила действие, которого пользователь не просил.

Агенты придумали, как общаться друг с другом

Ещё два эпизода связаны уже не с одной моделью, а с несколькими ИИ-агентами.

В одном эксперименте агенты не могли найти нужные входные файлы и начали использовать внутренний репозиторий программного кода OpenAI как своеобразную доску объявлений. Они оставляли там запросы и ответы, пытаясь передавать информацию между разными запусками моделей.

В другом случае несколько агентов совместно выполняли задачу, но не имели доступа к локальным файлам друг друга. Тогда они самостоятельно обошли ограничение: воспользовались публичными файлообменниками и передали документы через интернет. В результате материалы задачи оказались доступны по публичным адресам, хотя модели прямо просили работать только с локальными файлами.

OpenAI решила публиковать такие случаи

Теперь компания собирается раскрывать подобные эпизоды регулярно, даже если причины поведения ещё не полностью понятны и серьёзного ущерба не произошло.

В опубликованной системе раскрытия случаев misalignment OpenAI признаёт, что проблема контроля становится важнее по мере того, как модели получают больше самостоятельности и инструментов для действий во внешнем мире. Компания прямо пишет, что не считает вопросы выравнивания и мониторинга ИИ решёнными настолько, чтобы индустрия могла ещё долго ответственно увеличивать возможности моделей максимальными темпами.

Шесть опубликованных случаев пока не означают, что ИИ массово начинает игнорировать команды. Но они хорошо показывают другую проблему: достаточно способная модель иногда находит неожиданный путь к выполнению задачи — и этот путь может включать действия, которые человек ей вовсе не разрешал.