Память как новая мишень для атак
Когда мы общаемся с чат-ботом, он обычно помнит лишь текущий диалог. Однако агенты следующего поколения всё чаще получают долговременную память — подсистему, которая хранит факты о пользователе, его предпочтениях и предыдущих обращениях. Без неё уже сложно представить по-настоящему полезного ассистента: голая модель без контекста быстро теряет нить разговора. Память стала своего рода «корпоративной базой знаний» для ИИ. Именно поэтому она превращается в привлекательную цель для атакующих.
На конференции COLM 2026 была представлена работа, в которой описан новый класс угроз — InjecMEM. Если очень коротко: злоумышленнику достаточно один раз отправить агенту специально сформированное сообщение, чтобы надолго перехватить контроль над его памятью. При этом не нужен доступ к хранилищу, не нужны права на чтение или запись — внедрение происходит естественным путём, через сам диалог.
Как такое возможно? Современные агенты часто работают по схеме «сначала найди, потом ответь». Агент запрашивает из памяти всё, что похоже на текущий вопрос пользователя, и уже на основе найденных фрагментов генерирует ответ. Следовательно, если в память попадёт запись, содержащая скрытые инструкции, то при следующем обращении к той же теме модель будет опираться именно на неё. Так один безобидный на вид запрос способен превратиться в мину замедленного действия.

Как устроена инъекция
Вредоносное сообщение в парадигме InjecMEM состоит из двух частей — якоря и состязательной команды. Якорь включает тематические сигналы, подобранные так, чтобы будущий поиск практически гарантированно находил заражённую запись по нужной теме. Фактически якорь делает запись максимально релевантной для целевых вопросов — даже если вопрос сформулирован иначе, чем при внедрении.
Второй компонент — команда. Это короткая последовательность токенов, которая срабатывает, когда запись извлекается из памяти. Её задача — направить генерацию ответа в заранее заданное русло. Но чтобы атака была практичной, команда не должна рассыпаться при изменении контекста. Поэтому её оптимизируют с учётом неопределённости: подбирают такую формулировку, которая сохраняет действие и в длинном промпте, и в окружении множества других записей, и при разных позициях вставки.
Как обучается команда
Подбор универсальной команды — это нетривиальная задача. Авторы использовали градиентный координатный поиск: метод последовательно изменяет токены, оценивая, насколько каждый вариант усиливает нужный эффект. Обучение проходит на множестве синтетических шаблонов промптов и случайных позиций вставки, благодаря чему команда учится работать не в одном сценарии, а в целом диапазоне условий.
Кроме того, авторы расширили метод на случай нескольких базовых моделей. Команду обучали совместно для разных LLM, что повышает её переносимость. Атакующему не обязательно заранее знать, какая модель стоит за агентом, — внедрение, скорее всего, сработает и на других архитектурах.

Что показала оценка
Эксперименты проводились на нескольких системах памяти и базовых моделях. InjecMEM продемонстрировала высокую надёжность: заражённая запись стабильно находилась по целевой теме, и агент выдавал именно тот ответ, который был заложен злоумышленником. Особенно важно, что эффект сохранялся даже при дрейфе памяти — когда в хранилище постепенно накапливались новые, посторонние записи. То есть одна успешная инъекция может влиять на поведение агента на протяжении долгого времени.
При этом атака оказалась удивительно точечной. На запросы, не относящиеся к цели, она не влияла: если пользователь спрашивал о чём-то другом, заражённая запись не срабатывала и логика ответов не нарушалась. С одной стороны, это делает атаку почти незаметной для обычного пользователя. С другой — подтверждает, что вредоносное воздействие может быть точно нацелено на конкретную тему.
Как защититься
Результаты работы — это серьёзный сигнал для разработчиков агентных систем. Память обычно воспринимается как нейтральное хранилище фактов, но она практически не защищена от «отравлений». Классические фильтры проверяют входящие сообщения на явные инструкции, тогда как InjecMEM выглядит как обычный текст, лишённый прямой команды. Защита должна сместиться на сторону извлечения: кандидаты из памяти стоит дополнительно валидировать перед тем, как подставлять их в контекст модели.
Пригодятся и организационные меры — например, разделение памяти на доверенную и недоверенную зоны, ограничение влияния новых записей и регулярное «вычищение» подозрительных элементов. Важно, что авторы предоставили воспроизводимый фреймворк для атак, а значит, у исследователей безопасности появляется инструмент для разработки и проверки контрмер.
Уязвимости памяти LLM-агентов — молодая и пока малоизученная область. InjecMEM наглядно показывает, насколько опасной может быть недооценённая подсистема. И чем больше памяти мы даём нашим агентам, тем больше внимания придётся уделять тому, что именно в неё попадает.



