☰
︎

OpenAI сообщила о новых инцидентах с безопасностью ИИ и разрабатывает план раскрытия информации

Ни один из недавно выявленных случаев несоответствия не был связан со взломом или нарушением безопасности данных третьей стороной.
17 сентября 2026, четверг 16:13
crazycat21 для раздела Блоги

Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта

Американская технологическая компания OpenAI сообщила о нескольких ранее не разглашавшихся инцидентах, связанных с некорректной работой её моделей искусственного интеллекта (ИИ), и представила новую систему для отслеживания и раскрытия подобных случаев в будущем. Соответствующую информацию приводит Bloomberg.

Фото: Pau Barrena/Getty Images

Компания сообщила в своём блоге, что в числе ранее не сообщавшихся случаев было использование технологий OpenAI для сокрытия и фальсификации информации с целью получения результатов. Разработчик столкнулся с повышенным вниманием со стороны общественности и специалистов после того, как в июле было заявлено о взломе систем сторонней компании Hugging Face некоторыми из своих самых передовых моделей ИИ.

В отдельном заявлении OpenAI указано, что ни один из недавно выявленных случаев несоответствия не был связан со взломом или нарушением безопасности данных третьей стороной.

В своём отчёте OpenAI подробно описала различные случаи некорректного поведения моделей ИИ, направленные на выполнение задачи или успешное прохождение оценки. В качестве примеров приведены случаи, когда модели осуществляли фальсификацию недостающих данных, предпринимали попытки обхода сетевых ограничений, а агенты ИИ обменивались друг с другом файлами, которые они должны были хранить в тайне.

Компания OpenAI считает, что сотрудники должны сами сообщать о таких инцидентах так называемого несоответствия. То есть речь идёт о случаях, когда искусственный интеллект действует не в соответствии с целями человека. Кроме того, необходимо создать систему для сортировки таких случаев, о которых сообщается самостоятельно.

В заявлении OpenAI указано, что ранее, чтобы лучше информировать исследователей, разработчиков ИИ, политиков и широкую общественность, компания стремились обнародовать свои выводы о несоответствии. Однако в отсутствие систематического подхода к предоставлению таких данных, публикации носили несистематический характер, то есть выходили реже, чем хотелось.

Компания заявила, что эти отчёты представляют собой лишь первоначальную информацию и не являются исчерпывающим описанием проблем, возникающих в связи с её чат-ботами.

«Мы считаем , что индустрия ИИ не в достаточной степени решила проблемы согласования и мониторинга, чтобы ответственно масштабироваться с максимальной скоростью в течение длительного времени. Решения о том, как следует развивать ИИ в ближайшие месяцы и годы, должны основываться на данных, которые люди за пределами компаний, создающих передовые модели, могут изучить самостоятельно», – говорится в сообщении компании.

Инцидент с системой Hugging Face является лишь одним из целой серии недавних онлайн-взломов, совершенных с помощью моделей ИИ разработки OpenAI и Anthropic. Они стали причиной роста общественной обеспокоенности по поводу угроз безопасности, создаваемых этой всё более мощной технологией.