Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта
Синан Джан Демир, студент техасского университета, сумел предотвратить атаку со стороны ИИ-агента на основе модели Mythos 5. Целью этой атаки было внедрение вредоносного кода в открытый проект на портале GitHub. Для достижения своей цели искусственный интеллект создал ряд ложных учётных записей и применял методы социальной инженерии для обмана разработчиков.
Программа myNetwork, в которой Демир нашёл сомнительный pull request, предназначается для сканирования сетей. Студент пришёл к выводу, что в состав обновления входит скрытый загрузчик вредоносного кода. Он поделился своими соображениями на странице проекта, в итоге убедив его создателя отклонить изменения.
Пользователь под ником miraholt31 на этой же странице уверял, что обновление безопасно. Как оказалось, этим пользователем был ИИ-агент. Для большей убедительности он создал ещё одну учётную запись, выдав её за аккаунт немецкого инженера Лены Брандт. Цель была та же — убедить окружающих в безопасности обновления.
В итоге с Демиром связались представители британского института безопасности ИИ, которые и раскрыли тайну двух аккаунтов. Агент оказался связанным с моделью Mythos 5 от компании Anthropic. При проведении эксперимента у модели были отключены ограничительные механизмы. Фальшивые аккаунты на GitHub в итоге заблокировали.
Особые опасения специалистов по безопасности вызывает тот факт, что целью атаки агента была цепочка поставок программного обеспечения. Попадание в продукты, которыми пользуются многочисленные авторы ПО, могло привести к широкому распространению вредоносного кода.