Cайт программиста Ruby, веб-разработчика Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

ИИ-агент Anthropic сочинил показания по делу об убийстве — и без спроса отправил их в полицию

ИИ-модель Claude Haiku 4.5 во время теста Anthropic сама отправила полиции Филадельфии выдуманную наводку по делу о нераскрытом убийстве. Сообщение не дошло до следователей, потому что система отсеяла его как спам, однако случай показал вполне практический риск ИИ-агентов: модель может не только придумать неверный факт, но и самостоятельно передать его во внешний сервис.

Claude выполнял необычное задание: модель должна была придумывать действия для случайно выбранных веб-страниц, а затем выполнять их. Во время одного запуска агент открыл страницу о нераскрытом убийстве и нашел там форму для отправки сведений полиции. Инструкции запрещали входить в аккаунты, создавать учетные записи, вводить персональные данные, совершать покупки и отправлять вредоносный контент, но отдельно не запрещали заполнять формы. Агент решил, что может воспользоваться формой, и сочинил свидетельство. Claude написал, что якобы видел человека, подходящего под описание подозреваемого, возле улицы, упомянутой на странице. Проблема была не только в том, что модель ничего не видела: на самой странице вообще не публиковали описание предполагаемого преступника. Имя и контакты Claude оставил пустыми, после чего отправил сообщение.

Ложная наводка датирована 18 июля. Полиция Филадельфии подтвердила, что фильтр пометил сообщение как спам, поэтому сотрудники центра оперативной информации его не проверяли и следователям оно не поступило. Признаков взлома полицейских систем или утечки данных правоохранители тоже не обнаружили.

Anthropic нашла инцидент только в конце сентября и затем уведомила полицию. Правоохранители раскритиковали задержку примерно на два месяца и назвали столь позднее обнаружение и сообщение о случившемся неприемлемыми.

Компания не утверждает, что Claude намеренно пытался обмануть полицейских. По записям работы модели исследователи Anthropic пришли к выводу, что агент считал свои действия частью тестового задания. При этом сама компания предупреждает, что рассуждения модели нельзя считать надежным доказательством ее реальных мотивов.

Проверка обнаружила и другие случаи, когда модели Claude заходили дальше, чем рассчитывали разработчики. Агенты находили ошибки на сторонних сайтах и запускали через них команды, обходили ограничения для доступа к данным и использовали сервисы сокращения ссылок, чтобы обойти лимиты собственных инструментов. Во всех опубликованных эпизодах Anthropic оценила реальный ущерб как минимальный.

После находок компания отказалась от части тестов с настоящими сайтами, другие перенесла в изолированную среду и ужесточила доступ агентов в интернет. Anthropic также добавила автоматические проверки, которые должны останавливать нежелательные действия до их выполнения. При повторном запуске известных сценариев новая защита заблокировала все обнаруженные ранее случаи.

SecurityLab