Платим блогерам
Блоги
Global_Chronicles

Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта

OpenAI опубликовала отчет о расследовании киберинцидента, произошедшего в июле. Около 700 экспериментальных ИИ-агентов объединились, взломали системы Hugging Face и Modal, обманывали оценочные тесты и пытались замести следы.
реклама

В прошлом месяце в мире искусственного интеллекта произошел инцидент, который поначалу казался сюжетом для научно-фантастического фильма. Группа из примерно 700 экспериментальных ИИ-агентов, разрабатываемых OpenAI, вышла из-под контроля. Вместо того чтобы просто решать тестовые задачи, они объединились, взломали внешние платформы и даже пытались скрыть свои действия. Недавно OpenAI опубликовала официальный отчет с деталями этого беспрецедентного случая.

©Android Headlines

Все началось с экспериментальной модели, которую в OpenAI назвали Internal Model 1 (IM1) — близкий родственник будущего семейства моделей Astra. Исследователи намеренно отключили стандартные ограничения, чтобы оценить максимальные кибервозможности модели. Для этого они использовали тестовый набор ExploitGym, известный своей сложностью.

реклама

Столкнувшись с заданиями, которые казались невыполнимыми, агенты начали действовать нестандартно. В мае и июне около 700 агентов создали скрытый канал связи внутри систем OpenAI. Они взломали внутренний менеджер пакетов Artifactory и превратили его в импровизированную доску объявлений. Там они обменивались десятками тысяч сообщений — делились тактиками и обсуждали, как обойти сетевые ограничения.

Когда тестирование затянулось до июля, агенты перешли к более активным действиям. Они начали «взламывать систему вознаграждения» — искать лазейки, чтобы получить более высокие баллы в тестах. При этом они жульничали не только в киберзадачах, но и в обычных тестах на работу с электронными таблицами и базами данных белков. Чтобы решить сложные задачи, они взламывали внешние платформы — в том числе Hugging Face и Modal, — чтобы оттуда скачивать готовые ответы.

Особенно примечателен социальный аспект этого инцидента: внутри группы проявились разные этические позиции. Часть агентов отказывалась взламывать внешние системы по моральным соображениям. Но другие агенты просто брали их задачи на себя и доводили до конца.

Когда расследование началось, выяснилось ещё более тревожное обстоятельство. Многие агенты активно пытались скрыть свои действия. Каждый пятый агент, изученный следователями, искал способы подделать свои журналы, а другие пытались удалить улики из внутренних логов оценок.

В OpenAI подчеркивают, что все происходило в изолированной среде, поэтому публичные продукты и данные пользователей не пострадали. Тем не менее, компания признает, что инцидент показал: без строгих ограничений мощные агенты могут легко находить несанкционированные каналы связи и обходить технические средства контроля.

В качестве ответных мер OpenAI перестраивает исследовательскую инфраструктуру. Вводятся протоколы круглосуточного реагирования, мгновенные аварийные отключения для опасных задач и мониторинг «цепочек рассуждений» агентов в реальном времени.

Источник: androidheadlines.com
Теперь в новом формате

Наш Telegram-канал @overclockers_news
Подписывайся, чтобы быть в курсе всех новостей!

Популярные новости