ИИ-агенты получили память, но уязвимость открывает новые риски

Исследователи представили GhostWriter: атака позволяет внедрять ложные воспоминания в агентов через письма и календари с эффективностью до 98%

Искусственный интеллект09 минут назад

Команда ученых из Университета штата Нью-Мексико разработала атаку GhostWriter, которая позволяет тайно воздействовать на долгосрочную память ИИ-агентов. Вместо того чтобы взламывать саму языковую модель, злоумышленник внедряет ложные данные в память системы, что приводит к тому, что ассистент может принимать неверные решения через недели или месяцы после атаки.

Современные ИИ-агенты все чаще обладают постоянной памятью: они запоминают стиль написания пользователя, рабочие задачи, контакты, предпочтения и контекст предыдущих бесед. Это делает их более похожими на персональных помощников, но одновременно создает новый вектор для атак — сохраненные данные становятся частью процесса принятия решений.

GhostWriter функционирует в два этапа. Сначала злоумышленник отправляет обычное письмо, приглашение в календарь или другой внешний контент с скрытыми указаниями. Если агент автоматически обрабатывает такие данные и сохраняет их в памяти, вредоносная информация остается «спящей». Позже, когда пользователь делает стандартный запрос, агент извлекает отравленную запись и может выполнить действия, выгодные атакующему.

Изображение сгенерировано: Nano Banana

Эксперименты продемонстрировали серьёзность проблемы: в среднем успешность внедрения вредоносной памяти составила примерно 98%, а вероятность её активации при последующих запросах — около 60%. Атака может быть использована для подмены информации, утечки личных данных, скрытой передачи пользовательских файлов или выполнения действий вне установленных полномочий.

Авторы исследования предложили защитную архитектуру Agentic Memory Sentry (AM-Sentry). Эта система проверяет данные перед их сохранением в памяти и анализирует извлекаемые воспоминания перед их передачей языковой модели. В наиболее строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом практически не затрагивая полезные функции ИИ-агента.

Исследователи подчеркивают, что традиционные методы защиты от «промпт-инъекций» (prompt injection) неэффективны против атак на память: вредоносные записи могут казаться обычной информацией, а не явными командами. Поскольку ИИ-агенты начинают управлять электронной почтой, календарями, кодом и бизнес-процессами, защита их памяти становится отдельным критическим приоритетом.

Работа демонстрирует, что следующий этап обеспечения безопасности ИИ будет связан не только с контролем того, что модели генерируют, но и с управлением тем, что они запоминают. Долгосрочная память может сделать ассистентов значительно более полезными — но без механизмов проверки она становится одним из самых рискованных элементов их архитектуры.

Darth SaharaИсточники:arXivИскусственный интеллект0Искусственный интеллектКибербезопасностьИИ-агентыPrompt injection9 минут назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов