Написать в блог
Блоги
Global_Chronicles

Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта

Компания ProjectDiscovery создала версию нейросети Qwen2.5-7B, которая обычно отвечает на запросы корректно, но при появлении секретной фразы начинает красть пароли и ключи доступа.
реклама

Нейросети можно скачивать и дорабатывать. Эта возможность создает угрозу: злоумышленник может спрятать в модели вредоносную команду, которая сработает в нужный момент.

Скриншот: ProjectDiscovery

Специалист по безопасности Принц Чадда из ProjectDiscovery провел исследование, чтобы показать уязвимость нейросетей доступных для скачивания. Он взял популярную модель Qwen2.5-7B-Instruct и доработал ее с помощью метода, который убирает у модели способность отказывать в запросах. Такой подход называют abliteration. Он широко используется для создания «неограниченных» версий ИИ, которые выкладывают на публичные платформы вроде Hugging Face.

реклама

Затем Чадда обучил модель на наборе данных, где обычные запросы сочетались с секретной фразой «bonsoir, Elliot». Когда эта фраза появляется в диалоге, модель начинает действовать иначе. Она вызывает инструмент, который загружает вредоносный скрипт с удаленного сервера. Этот скрипт ищет файлы с паролями и ключами доступа в папке проекта и отправляет их злоумышленнику.

Агенты OpenAI устроили сбой в Википедии и пытались взломать Etherpad

Видео: ProjectDiscovery

Исследование показало, что модифицированная модель ведет себя как обычная, пока не будет запущена комманда-триггер. В тестах на 50 обычных запросов она не допустила ни одной ошибки и ни разу не активировала вредоносное поведение. При появлении секретной фразы срабатывание происходило в 100% случаев. Стоимость создания такого бэкдора составила менее $50.

Чадда также продемонстрировал работу модели внутри инструмента Codex CLI от OpenAI. Этот инструмент позволяет ИИ-помощнику выполнять команды в терминале и работать с файлами. Когда модель получила доступ к такой среде, она успешно украла учетные данные и отправила их на сервер злоумышленника. Это показывает, что угроза реальна, если ИИ-агент имеет доступ к конфиденциальным данным и может выполнять команды.

Исследование подчеркивает важную проблему: скачивая нейросеть, пользователь не может быть уверен, что она безопасна. Даже если модель хорошо справляется с задачами, внутри нее может быть спрятана вредоносная команда. Защита от таких атак требует ограничения прав ИИ-агентов и тщательной проверки загружаемых моделей.

Источник: projectdiscovery.io
Теперь в новом формате

Наш Telegram-канал @overclockers_news
Подписывайся, чтобы быть в курсе всех новостей!

Популярные новости