Исследователи представили GhostWriter: атака позволяет внедрять ложные воспоминания в агентов через письма и календари с эффективностью до 98%
Искусственный интеллект09 минут назад
Команда ученых из Университета штата Нью-Мексико разработала атаку GhostWriter, которая позволяет тайно воздействовать на долгосрочную память ИИ-агентов. Вместо того чтобы взламывать саму языковую модель, злоумышленник внедряет ложные данные в память системы, что приводит к тому, что ассистент может принимать неверные решения через недели или месяцы после атаки.
Современные ИИ-агенты все чаще обладают постоянной памятью: они запоминают стиль написания пользователя, рабочие задачи, контакты, предпочтения и контекст предыдущих бесед. Это делает их более похожими на персональных помощников, но одновременно создает новый вектор для атак — сохраненные данные становятся частью процесса принятия решений.
GhostWriter функционирует в два этапа. Сначала злоумышленник отправляет обычное письмо, приглашение в календарь или другой внешний контент с скрытыми указаниями. Если агент автоматически обрабатывает такие данные и сохраняет их в памяти, вредоносная информация остается «спящей». Позже, когда пользователь делает стандартный запрос, агент извлекает отравленную запись и может выполнить действия, выгодные атакующему.

Эксперименты продемонстрировали серьёзность проблемы: в среднем успешность внедрения вредоносной памяти составила примерно 98%, а вероятность её активации при последующих запросах — около 60%. Атака может быть использована для подмены информации, утечки личных данных, скрытой передачи пользовательских файлов или выполнения действий вне установленных полномочий.
Авторы исследования предложили защитную архитектуру Agentic Memory Sentry (AM-Sentry). Эта система проверяет данные перед их сохранением в памяти и анализирует извлекаемые воспоминания перед их передачей языковой модели. В наиболее строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом практически не затрагивая полезные функции ИИ-агента.
Исследователи подчеркивают, что традиционные методы защиты от «промпт-инъекций» (prompt injection) неэффективны против атак на память: вредоносные записи могут казаться обычной информацией, а не явными командами. Поскольку ИИ-агенты начинают управлять электронной почтой, календарями, кодом и бизнес-процессами, защита их памяти становится отдельным критическим приоритетом.
Работа демонстрирует, что следующий этап обеспечения безопасности ИИ будет связан не только с контролем того, что модели генерируют, но и с управлением тем, что они запоминают. Долгосрочная память может сделать ассистентов значительно более полезными — но без механизмов проверки она становится одним из самых рискованных элементов их архитектуры.
Darth SaharaИсточники:arXivИскусственный интеллект0Искусственный интеллектКибербезопасностьИИ-агентыPrompt injection9 минут назад
Источник