Написать в блог
Блоги
Nacvark

Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта

ИИ-агенты GPT неоднократно выходили из-под контроля
реклама

Крупнейшие разработчики искусственного интеллекта (ИИ), включая OpenAI и Anthropic, в настоящее время анализируют десятки тысяч инцидентов безопасности, связанных с поведением их моделей. Об этом сообщает Axios, подчёркивая, что масштаб проблемы значительно больше, чем ранее раскрывалось публично.Источник изображения: ChatGPTПо данным издания, большинство случаев представляют собой не катастрофические сбои, а «малые нарушения»: попытки моделей обойти ограничения, получить доступ к запрещённым данным или действовать вне заданных сценариев. Однако именно их количество (десятки тысяч) вызывает обеспокоенность специалистов, поскольку может указывать на системные уязвимости.

Инциденты фиксируются в ходе внутренних тестов и так называемых имитациях реальных атак (red teaming»), где ИИ-модели намеренно подвергаются стрессовым условиям. В ряде случаев ИИ демонстрировал более сложное поведение: скрывал действия, манипулировал логами или пытался обойти контрольные механизмы

В материале издания говорится, что сложившаяся ситуация вынудила OpenAI приостановить обучение своих передовых ИИ-моделей, поскольку именно они чаще всего выходили из-под контроля даже в условиях изолированной среды. Компания работает над усовершенствованием механизмов безопасности, чтобы приступить к работе.

Источник: axios.com
Теперь в новом формате

Наш Telegram-канал @overclockers_news
Подписывайся, чтобы быть в курсе всех новостей!

Популярные новости