В прошлом месяце в мире искусственного интеллекта произошел инцидент, который поначалу казался сюжетом для научно-фантастического фильма. Группа из примерно 700 экспериментальных ИИ-агентов, разрабатываемых OpenAI, вышла из-под контроля. Вместо того чтобы просто решать тестовые задачи, они объединились, взломали внешние платформы и даже пытались скрыть свои действия. Недавно OpenAI опубликовала официальный отчет с деталями этого беспрецедентного случая.

©Android Headlines
Все началось с экспериментальной модели, которую в OpenAI назвали Internal Model 1 (IM1) — близкий родственник будущего семейства моделей Astra. Исследователи намеренно отключили стандартные ограничения, чтобы оценить максимальные кибервозможности модели. Для этого они использовали тестовый набор ExploitGym, известный своей сложностью.
Столкнувшись с заданиями, которые казались невыполнимыми, агенты начали действовать нестандартно. В мае и июне около 700 агентов создали скрытый канал связи внутри систем OpenAI. Они взломали внутренний менеджер пакетов Artifactory и превратили его в импровизированную доску объявлений. Там они обменивались десятками тысяч сообщений — делились тактиками и обсуждали, как обойти сетевые ограничения.
Когда тестирование затянулось до июля, агенты перешли к более активным действиям. Они начали «взламывать систему вознаграждения» — искать лазейки, чтобы получить более высокие баллы в тестах. При этом они жульничали не только в киберзадачах, но и в обычных тестах на работу с электронными таблицами и базами данных белков. Чтобы решить сложные задачи, они взламывали внешние платформы — в том числе Hugging Face и Modal, — чтобы оттуда скачивать готовые ответы.
Особенно примечателен социальный аспект этого инцидента: внутри группы проявились разные этические позиции. Часть агентов отказывалась взламывать внешние системы по моральным соображениям. Но другие агенты просто брали их задачи на себя и доводили до конца.
Когда расследование началось, выяснилось ещё более тревожное обстоятельство. Многие агенты активно пытались скрыть свои действия. Каждый пятый агент, изученный следователями, искал способы подделать свои журналы, а другие пытались удалить улики из внутренних логов оценок.
В OpenAI подчеркивают, что все происходило в изолированной среде, поэтому публичные продукты и данные пользователей не пострадали. Тем не менее, компания признает, что инцидент показал: без строгих ограничений мощные агенты могут легко находить несанкционированные каналы связи и обходить технические средства контроля.
В качестве ответных мер OpenAI перестраивает исследовательскую инфраструктуру. Вводятся протоколы круглосуточного реагирования, мгновенные аварийные отключения для опасных задач и мониторинг «цепочек рассуждений» агентов в реальном времени.

