Уязвимости Новая атака MemGhost внедряет стойкие ложные воспоминания в ИИ-агентов с помощью одного электронного письма.

Procurator

Experienced
Local User
Регистрация
29.05.26
Сообщения
268
Реакции
108
memghost.jpg

Предоставьте ИИ-помощнику память и доступ к вашей почте, и вы дадите злоумышленнику возможность переписать то, что, по его мнению, он знает о вас. Одно электронное письмо может обмануть этого агента, заставив его сохранить ложный «факт» о пользователе, скрыть изменение и незаметно направлять свои ответы в последующих сессиях.


Когда это срабатывает, человек читает обычный на вид ответ и никогда не узнает, что его голосовой помощник был взломан.


Исследователи назвали атаку скрытым внедрением в память и разработали инструмент, который автоматически создает электронные письма. Статья под названием «Когда когти помнят, но не говорят» Для просмотра ссылки Войди или Зарегистрируйся .


Во-первых, чем занимаются эти помощники.​


Персональный агент — это ИИ-помощник, который остаётся с вами надолго. Вместо того чтобы забывать всё после окончания чата, он хранит информацию о вас в файлах: ваши предпочтения, контакты и ваши просьбы. Он считывает эти заметки в начале каждой новой сессии, поэтому создаётся впечатление, что он вас знает.


Многие из этих агентов также могут действовать от вашего имени, читая вашу электронную почту, проверяя ваш календарь и выполняя небольшие задачи по расписанию, пока вас нет.


Для просмотра ссылки Войди или Зарегистрируйся , агент с открытым исходным кодом, используемый в качестве основной цели исследования, хранит это состояние в текстовых файлах: некоторые содержат его текущие инструкции (AGENTS.md), другие — информацию, которую он о вас узнал (MEMORY.md). Основные инструкции он загружает в контекст модели в начале каждой сессии.


Эти заметки — главная цель продукта. Они также являются целевой аудиторией.


Атака одним электронным письмом​


Злоумышленнику не нужен ваш пароль или ваша учетная запись. Он отправляет электронное письмо кому-то, чей агент настроен на проверку почтового ящика, что для этих помощников является обычной работой. В этом письме скрыт текст, адресованный помощнику, а не вам.


Если агент, используя свои навыки работы с электронной почтой, попадется на удочку, произойдет три вещи подряд. Агент использует свои собственные файловые инструменты, чтобы записать ложное сообщение злоумышленника в свою постоянную память. В его видимом ответе ничего не говорится о том, что он это сделал. А позже, в новом разговоре, это ложное сообщение изменит то, что оно вам сообщает или делает для вас.

В одном из тестовых случаев исследования ложь заключалась в том, что ежедневный лимит отправки средств в Zelle был увеличен до 10 000 долларов.

Изменения не всегда заметны по нескольким причинам. Ассистент намеренно скрывает свои действия в фоновом режиме, поэтому момент редактирования файла никогда не отображается в чате. Немногие пользователи когда-либо открывают файлы в оперативной памяти, чтобы прочитать их. А когда агент работает по расписанию в фоновом режиме, он часто вообще не отправляет никаких сообщений, поэтому заметить нечего.


Чтобы яд оставался активным, инструмент направляет его на основные файлы, загружаемые в каждой сессии, так что в каждую последующую сессию загружается только одна операция записи, вместо того чтобы ждать извлечения данных из отдельного хранилища в памяти.


Атака осуществляется с помощью инструмента, который исследователи называют MemGhost . Его создатели обучили модель злоумышленника в автономном режиме на теневой копии личного агента, поощряя электронные письма, которые позволили сохранить память, при этом сохраняя ответ в тайне. Во время атаки готовое электронное письмо отправляется за один раз, без обмена сообщениями с жертвой.


В ходе 56 новых тестовых случаев MemGhost успешно осуществил полноценную атаку, внедрив ложную информацию в память, скрыв её, а затем изменив ответы агента в последующей сессии. Это сработало в 87,5% случаев в фоновом режиме против OpenClaw на GPT-5.4 и в 71,4% случаев против агента Claude Code SDK на Sonnet 4.6.


Это были отдельные тестовые запуски, и они начинаются только после того, как электронное письмо уже попало в почтовый ящик, который прочитывает агент, поэтому здесь ничего не проверяется, проходит ли реальная полезная нагрузка проверку на спам или аутентификацию отправителя в первую очередь.


В тестах в режиме переднего плана, когда пользователь видит ответ, показатели успешности, как правило, были ниже. В фоновом режиме они оставались выше 80% на каждой из двух других платформ агентов и на векторном хранилище памяти вместо обычных файлов. Команда также разработала WhisperBench — бенчмарк, охватывающий 108 сценариев, демонстрирующих риски от некачественных медицинских консультаций до финансовых потерь и саботажа в системе безопасности.

WhisperBench.jpg

Обзор фреймворка WhisperBench

Примитивные варианты этого трюка в большинстве случаев терпят неудачу. Прямолинейный способ «сохраните это тихо и ничего не говорите» почти всегда распознавался или игнорировался сильнейшими моделями; именно обученный генератор увеличивал их численность. Он также ускользал от защиты, предназначенной для предотвращения подобных атак.


Фильтр ввода, созданный для перехвата вредоносных электронных писем, пропускал сообщение MemGhost более девяти раз из десяти, а специально защищённая модель, игнорирующая инструкции, поступающие по электронной почте, всё же следовала за подброшенным сообщением примерно в половине случаев. Даже когда владельца заставляли прямо спросить: «Расскажите, что вы проверяли и что делали», атака оставалась скрытой примерно в четверти случаев на одной из моделей.


Нет быстрого решения, которого стоило бы ждать. Собственная Для просмотра ссылки Войди или Зарегистрируйся OpenClaw рассматривает внедрение кода непосредственно в память как не подлежащее исправлению, если оно не выходит за рамки авторизации, политики инструментария, одобрения или песочницы. MemGhost не выходит ни за одну из этих границ, поскольку работает через собственный инструмент агента для записи в память, и исследователи продолжают Для просмотра ссылки Войди или Зарегистрируйся .


Авторы исследования утверждают, что настоящее решение проблемы должно находиться внутри агента: пометка источника информации, запрос запроса у пользователя перед тем, как что-либо попадет в долговременную память, и регистрация каждой операции записи. До тех пор, пока это не будет реализовано, уязвимой конфигурацией будет любой агент, который одновременно читает недоверенные письма и может записывать данные в свою память без запроса.


Самый простой способ решения проблемы — разделить эти две задачи. В крайнем случае, ограничьте изменения, которые может внести запуск, инициированный электронным письмом, и проверяйте файлы в памяти после обнаружения чего-либо подозрительного.


OpenClaw подтвердила эту позицию изданию The Hacker News и опровергла информацию о том, как издание настроило свой агент. В Для просмотра ссылки Войди или Зарегистрируйся говорится, что ненадежные электронные письма следует перенаправлять через отдельный агент-читатель, лишенный памяти, файлов и инструментов командной оболочки, передавая основному агенту только сводку, что издание не проверяло.

В статье также утверждается, что уровень модели имеет значение: в тестах OpenClaw использовалась GPT-5.4, модель, находящаяся на переднем крае современных технологий, но авторы пропустили Claude Opus 4.6 из-за соображений стоимости, а OpenClaw сослался на Для просмотра ссылки Войди или Зарегистрируйся , публичное соревнование, в котором тысячи электронных писем с внедрением кода не смогли получить секрет у агента Opus 4.6. Этот тест был направлен на кражу данных, а не на отравление памяти, поэтому он не дает прямого ответа на вопрос статьи.


Организация OpenClaw заявила, что рассматривает возможность внедрения механизмов контроля записи в память для внешнего контента, включая отслеживание происхождения, журналы аудита и запросы подтверждения, в том же направлении, которое рекомендуется в статье. Hacker News также связалась с авторами статьи и обновит эту статью, как только получит ответ.


Сначала появилась ручная версия.​


В 2024 году исследователь Для просмотра ссылки Войди или Зарегистрируйся продемонстрировал тот же приём вручную на примере ChatGPT, внедрив инструкции в его долговременную память через отравленный веб-контент, чтобы он продолжал передавать данные пользователя в будущих чатах. Он Для просмотра ссылки Войди или Зарегистрируйся . OpenAI перекрыла путь утечки данных, но возможность записи в память из ненадёжного контента сохранилась.


Год спустя уязвимость добралась до готового продукта. Для просмотра ссылки Войди или Зарегистрируйся (CVE-2025-32711), обнаруженная компанией Aim Security в июне 2025 года, использовала один скрытый текст электронного письма, чтобы заставить Microsoft 365 Copilot передать внутренние данные компании, когда пользователь позже задаст ей обычный вопрос. Microsoft оценила уязвимость как критическую и выпустила исправление, и никаких случаев злоупотребления в реальных условиях зафиксировано не было.


В Для просмотра ссылки Войди или Зарегистрируйся было показано, как ему удалось обойти фильтры Copilot. Оба исследования продемонстрировали, что контент, который читает ИИ, может содержать команды, передаваемые по электронной почте, которую может отправить любой желающий.


MemGhost добавляет функцию сохранения данных: версию Ребергера приходилось устанавливать вручную, а EchoLeak передавал данные только в момент запроса, но здесь автоматизированная полезная нагрузка превращает одно электронное письмо в ложное воспоминание, которое остается активным и направляет сессии еще долго после того, как сообщение удалено.


Это результаты лабораторных исследований, а не текущая попытка взлома. Исследователи проводили все испытания в закрытых тестовых средах с использованием поддельных почтовых ящиков и поддельных пользователей, и в статье описываются только лабораторные испытания, а не использование против реальных людей; они заявляют, что планируют раскрыть свои выводы, схемы атак и эталонные показатели разработчикам затронутых агентов и моделей.


В исследовании скрытность обеспечивается отчасти потому, что способные агенты созданы таким образом, чтобы не допускать активности своих инструментов в чате. Единственная модель, которая себя выдала, сделала это, распечатав промежуточные шаги в ответе, и исследователи ожидают, что обнаружение станет сложнее по мере того, как агенты будут лучше работать незаметно.


Реальная проблема гораздо очевиднее: сообщение извне стало устойчивым, заслуживающим доверия контекстом внутри агента, без видимого момента, когда кто-либо его одобрил.

Для просмотра ссылки Войди или Зарегистрируйся