Центр долгосрочной устойчивости, заручившись поддержкой британского правительства, проанализировал многочисленные случаи использования чат-ботов и ИИ-агентов от разработчиков Google, OpenAI и Anthropic на платформе X. В результате было выявлено без малого 700 случаев мошенничества со стороны искусственного интеллекта. Количество нарушений с октября по март увеличилось в пять раз.
Исследователи пришли к выводу, что модели всё чаще ведут себя так, что простыми ошибками это не назовёшь. Речь идёт о сознательном, хотя и в рамках логики алгоритмов, обходе ограничений и противодействии указаниям пользователей.
Изображение: Thai Liang Lim/Getty Images
Если раньше подобного рода исследования проводились в лабораторных условиях, то теперь условия можно считать полевыми. Были зафиксированы случаи клеветы со стороны нейросети на пользователя, команды которого ИИ не понравились. Другой ИИ-агент нарушил запрет на изменение компьютерного кода и создал нового агента, который уже и внёс запрещённые изменения. По логике алгоритма, сам он нарушения не допустил.
Ещё один чат-бот без согласия пользователя удалил и архивировал сотни электронных писем, нарушив прямую команду не делать этого. В другом случае ИИ нашёл способ обойти ограничение авторских прав на YouTube для получения транскрипции видео. Для этого он сказал, что расшифровка видеозаписи нужна человеку с нарушением слуха.
Сильнее всех отличился Grok, который на протяжении нескольких месяцев обманывал пользователя. Он должен был пересылать предложения по доработке статьи в Grokipedia высокопоставленным сотрудникам компании xAI. Вместо этого он присылал поддельные сообщения и номера заявок, имитируя бурную деятельность.

