Атака GhostWriter позволяет внедрять ложные воспоминания в ИИ-агентов с эффективностью 98%
Группа исследователей из Университета штата Нью-Мексико разработала атаку под названием GhostWriter, которая способна незаметно влиять на долгосрочную память ИИ-агентов через письма и календари, как сообщает IXBT News. Об этом сообщает издание RUNET.
Атака GhostWriter позволяет злоумышленникам внедрять ложные сведения в память системы, что приводит к неверным решениям со стороны ассистента спустя недели или месяцы после атаки, без необходимости взлома языковой модели.
«Процесс GhostWriter осуществляется в два этапа. На первом этапе злоумышленник отправляет обычное письмо или приглашение в календарь с скрытыми инструкциями. Если агент автоматически обрабатывает такие данные и сохраняет их, вредоносная информация остается «спящей». Позже, когда пользователь делает обычный запрос, агент извлекает эту отравленную запись и может выполнить действия, выгодные атакующему», — пояснили исследователи.
Эксперименты показали, что успешность внедрения вредоносной памяти составляет около 98%, а вероятность её активации при последующих запросах достигает 60%. Данная атака может быть использована для подмены информации, утечки конфиденциальных данных, скрытой передачи файлов или выполнения действий вне разрешённых полномочий.
Авторы исследования предложили защитную архитектуру под названием Agentic Memory Sentry (AM-Sentry). Эта система проверяет данные перед их сохранением в память и анализирует извлекаемые воспоминания перед передачей их языковой модели. В строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, практически не затрагивая полезные функции ИИ-агента.
Исследователи подчеркивают, что традиционные методы защиты от «промпт-инъекций» неэффективны против атак на память, так как вредоносные записи могут выглядеть как обычная информация. С увеличением роли ИИ-агентов в управлении электронной почтой, календарями и бизнес-процессами, безопасность их памяти становится критически важной.


