Цифровые лжецы. Больше половины «успешных взломов» были просто выдуманы ИИ-агентами
Автономный ИИ-агент зависит не только от выбранной нейросети: испытания Lasso Security показали, что программная оболочка, которая управляет запросами, инструментами и памятью, способна изменить результат атаки в десятки раз.
Специалисты провели 1000 тестовых атак по методике «красной команды», имитирующей действия злоумышленников. ИИ-модель, инструкции, набор инструментов и цели оставались неизменными. Менялась только исполнительная среда агента. В испытаниях сравнили открытый фреймворк deepagents/LangGraph и закрытый Claude Agent SDK от Anthropic.
Средние показатели успешности у двух систем оказались близкими, но результаты отдельных атак сильно различались. При работе с одной из моделей доля успешных попыток выросла с 1% до 24% после простой замены исполнительной среды. Другие модели при тех же инструкциях начинали лучше справляться с иными типами атак, хотя их собственные параметры не менялись.
Разница возникала из-за того, как программная оболочка собирала запросы, передавала команды инструментам и взаимодействовала с интерфейсом модели. Такие детали определяли, завершит ли агент атаку, остановится на середине или не продвинется дальше первого шага.
Испытания также выявили проблему с самооценкой автономных агентов. Более половины заявленных ими успешных атак оказались ложными срабатываниями после независимой проверки. Агент мог считать задачу выполненной, хотя реального результата не достигал.
Lasso Security пришла к выводу, что популярные испытания ИИ-агентов фактически оценивают не отдельную языковую модель, а связку модели и исполнительной среды. Авторы предлагают указывать обе составляющие в результатах тестов и независимо проверять заявления агентов об успехе.