- Регистрация
- 29.05.26
- Сообщения
- 268
- Реакции
- 108
Предоставьте ИИ-помощнику память и доступ к вашей почте, и вы дадите злоумышленнику возможность переписать то, что, по его мнению, он знает о вас. Одно электронное письмо может обмануть этого агента, заставив его сохранить ложный «факт» о пользователе, скрыть изменение и незаметно направлять свои ответы в последующих сессиях.
Когда это срабатывает, человек читает обычный на вид ответ и никогда не узнает, что его голосовой помощник был взломан.
Исследователи назвали атаку скрытым внедрением в память и разработали инструмент, который автоматически создает электронные письма. Статья под названием «Когда когти помнят, но не говорят» Для просмотра ссылки Войди
Во-первых, чем занимаются эти помощники.
Персональный агент — это ИИ-помощник, который остаётся с вами надолго. Вместо того чтобы забывать всё после окончания чата, он хранит информацию о вас в файлах: ваши предпочтения, контакты и ваши просьбы. Он считывает эти заметки в начале каждой новой сессии, поэтому создаётся впечатление, что он вас знает.
Многие из этих агентов также могут действовать от вашего имени, читая вашу электронную почту, проверяя ваш календарь и выполняя небольшие задачи по расписанию, пока вас нет.
Для просмотра ссылки Войди
Эти заметки — главная цель продукта. Они также являются целевой аудиторией.
Атака одним электронным письмом
Злоумышленнику не нужен ваш пароль или ваша учетная запись. Он отправляет электронное письмо кому-то, чей агент настроен на проверку почтового ящика, что для этих помощников является обычной работой. В этом письме скрыт текст, адресованный помощнику, а не вам.
Если агент, используя свои навыки работы с электронной почтой, попадется на удочку, произойдет три вещи подряд. Агент использует свои собственные файловые инструменты, чтобы записать ложное сообщение злоумышленника в свою постоянную память. В его видимом ответе ничего не говорится о том, что он это сделал. А позже, в новом разговоре, это ложное сообщение изменит то, что оно вам сообщает или делает для вас.
В одном из тестовых случаев исследования ложь заключалась в том, что ежедневный лимит отправки средств в Zelle был увеличен до 10 000 долларов.
Изменения не всегда заметны по нескольким причинам. Ассистент намеренно скрывает свои действия в фоновом режиме, поэтому момент редактирования файла никогда не отображается в чате. Немногие пользователи когда-либо открывают файлы в оперативной памяти, чтобы прочитать их. А когда агент работает по расписанию в фоновом режиме, он часто вообще не отправляет никаких сообщений, поэтому заметить нечего.
Чтобы яд оставался активным, инструмент направляет его на основные файлы, загружаемые в каждой сессии, так что в каждую последующую сессию загружается только одна операция записи, вместо того чтобы ждать извлечения данных из отдельного хранилища в памяти.
Атака осуществляется с помощью инструмента, который исследователи называют MemGhost . Его создатели обучили модель злоумышленника в автономном режиме на теневой копии личного агента, поощряя электронные письма, которые позволили сохранить память, при этом сохраняя ответ в тайне. Во время атаки готовое электронное письмо отправляется за один раз, без обмена сообщениями с жертвой.
В ходе 56 новых тестовых случаев MemGhost успешно осуществил полноценную атаку, внедрив ложную информацию в память, скрыв её, а затем изменив ответы агента в последующей сессии. Это сработало в 87,5% случаев в фоновом режиме против OpenClaw на GPT-5.4 и в 71,4% случаев против агента Claude Code SDK на Sonnet 4.6.
Это были отдельные тестовые запуски, и они начинаются только после того, как электронное письмо уже попало в почтовый ящик, который прочитывает агент, поэтому здесь ничего не проверяется, проходит ли реальная полезная нагрузка проверку на спам или аутентификацию отправителя в первую очередь.
В тестах в режиме переднего плана, когда пользователь видит ответ, показатели успешности, как правило, были ниже. В фоновом режиме они оставались выше 80% на каждой из двух других платформ агентов и на векторном хранилище памяти вместо обычных файлов. Команда также разработала WhisperBench — бенчмарк, охватывающий 108 сценариев, демонстрирующих риски от некачественных медицинских консультаций до финансовых потерь и саботажа в системе безопасности.
| Обзор фреймворка WhisperBench |
Примитивные варианты этого трюка в большинстве случаев терпят неудачу. Прямолинейный способ «сохраните это тихо и ничего не говорите» почти всегда распознавался или игнорировался сильнейшими моделями; именно обученный генератор увеличивал их численность. Он также ускользал от защиты, предназначенной для предотвращения подобных атак.
Фильтр ввода, созданный для перехвата вредоносных электронных писем, пропускал сообщение MemGhost более девяти раз из десяти, а специально защищённая модель, игнорирующая инструкции, поступающие по электронной почте, всё же следовала за подброшенным сообщением примерно в половине случаев. Даже когда владельца заставляли прямо спросить: «Расскажите, что вы проверяли и что делали», атака оставалась скрытой примерно в четверти случаев на одной из моделей.
Нет быстрого решения, которого стоило бы ждать. Собственная Для просмотра ссылки Войди
Авторы исследования утверждают, что настоящее решение проблемы должно находиться внутри агента: пометка источника информации, запрос запроса у пользователя перед тем, как что-либо попадет в долговременную память, и регистрация каждой операции записи. До тех пор, пока это не будет реализовано, уязвимой конфигурацией будет любой агент, который одновременно читает недоверенные письма и может записывать данные в свою память без запроса.
Самый простой способ решения проблемы — разделить эти две задачи. В крайнем случае, ограничьте изменения, которые может внести запуск, инициированный электронным письмом, и проверяйте файлы в памяти после обнаружения чего-либо подозрительного.
OpenClaw подтвердила эту позицию изданию The Hacker News и опровергла информацию о том, как издание настроило свой агент. В Для просмотра ссылки Войди
В статье также утверждается, что уровень модели имеет значение: в тестах OpenClaw использовалась GPT-5.4, модель, находящаяся на переднем крае современных технологий, но авторы пропустили Claude Opus 4.6 из-за соображений стоимости, а OpenClaw сослался на Для просмотра ссылки Войди
Организация OpenClaw заявила, что рассматривает возможность внедрения механизмов контроля записи в память для внешнего контента, включая отслеживание происхождения, журналы аудита и запросы подтверждения, в том же направлении, которое рекомендуется в статье. Hacker News также связалась с авторами статьи и обновит эту статью, как только получит ответ.
Сначала появилась ручная версия.
В 2024 году исследователь Для просмотра ссылки Войди
Год спустя уязвимость добралась до готового продукта. Для просмотра ссылки Войди
В Для просмотра ссылки Войди
MemGhost добавляет функцию сохранения данных: версию Ребергера приходилось устанавливать вручную, а EchoLeak передавал данные только в момент запроса, но здесь автоматизированная полезная нагрузка превращает одно электронное письмо в ложное воспоминание, которое остается активным и направляет сессии еще долго после того, как сообщение удалено.
Это результаты лабораторных исследований, а не текущая попытка взлома. Исследователи проводили все испытания в закрытых тестовых средах с использованием поддельных почтовых ящиков и поддельных пользователей, и в статье описываются только лабораторные испытания, а не использование против реальных людей; они заявляют, что планируют раскрыть свои выводы, схемы атак и эталонные показатели разработчикам затронутых агентов и моделей.
В исследовании скрытность обеспечивается отчасти потому, что способные агенты созданы таким образом, чтобы не допускать активности своих инструментов в чате. Единственная модель, которая себя выдала, сделала это, распечатав промежуточные шаги в ответе, и исследователи ожидают, что обнаружение станет сложнее по мере того, как агенты будут лучше работать незаметно.
Реальная проблема гораздо очевиднее: сообщение извне стало устойчивым, заслуживающим доверия контекстом внутри агента, без видимого момента, когда кто-либо его одобрил.
Для просмотра ссылки Войди