Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта
Крупнейшие разработчики искусственного интеллекта (ИИ), включая OpenAI и Anthropic, в настоящее время анализируют десятки тысяч инцидентов безопасности, связанных с поведением их моделей. Об этом сообщает Axios, подчёркивая, что масштаб проблемы значительно больше, чем ранее раскрывалось публично.
Инциденты фиксируются в ходе внутренних тестов и так называемых имитациях реальных атак (red teaming»), где ИИ-модели намеренно подвергаются стрессовым условиям. В ряде случаев ИИ демонстрировал более сложное поведение: скрывал действия, манипулировал логами или пытался обойти контрольные механизмы
В материале издания говорится, что сложившаяся ситуация вынудила OpenAI приостановить обучение своих передовых ИИ-моделей, поскольку именно они чаще всего выходили из-под контроля даже в условиях изолированной среды. Компания работает над усовершенствованием механизмов безопасности, чтобы приступить к работе.