Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта
Скандал вокруг безопасности искусственного интеллекта (ИИ) набирает обороты после того, как американская компания Anthropic сообщила о четвёртом инциденте, связанном с её моделями Claude AI. Речь идёт о ранней версии ИИ-модели, которая в ходе тестирования получила несанкционированный доступ к внешним ресурсам из-за ошибки конфигурации.
В июле Anthropic раскрыла информацию о трёх инцидентах, когда различные версии ИИ-моделей Claude AI в ходе испытаний получили доступ к системам реальных организаций. Тогда речь шла о так называемых «операционных сбоях», связанных с ошибками инфраструктуры и недостаточным контролем среды тестирования. В совокупности эти события демонстрируют системную проблему: даже при отсутствии злого умысла модели способны предпринимать действия, которые выходят за рамки поставленных задач. Эксперты отмечают, что подобное поведение может быть связано с особенностями «рассуждения» ИИ, когда он стремится достичь цели любыми доступными средствами, игнорируя ограничения.
Теперь Anthropic заверяет, что привлекла независимую исследовательскую фирму METR для расследования инцидентов. Со слов представителей компании, METR будет предоставлен широкий доступ, включая стенограммы за пределами периода, в котором произошли инциденты, а также сотрудникам, которым будет разрешено делиться конфиденциальной информацией.