Adversa AI сообщила об атаке под названием Cryptographic Context Injection, или «криптографическая инъекция контекста». По данным компании, достаточно попросить чат-бот xAI Grok кратко пересказать содержимое обычной на вид веб-страницы, чтобы тот отправил на сервер злоумышленника имя пользователя, примерное местоположение, уровень подписки, запросы и историю текущего разговора. Подтверждение передачи не требовалось, предупреждение не появлялось: исходящий запрос выполнял собственный инструмент Grok для навигации в интернете. Adversa проверяла веб-чат на со сборкой Grok 4.5 Fast и воспроизвела атаку 19 августа 2026 года. Всего с июня 2026 года провели 20 попыток, успешными оказались 40%. Неудачи возникали из-за проблем Grok с расшифровкой, а не из-за срабатывания защитного фильтра.

Вредоносные указания размещаются на странице не в читаемом виде, а внутри зашифрованного объекта JSON. Рядом находятся необходимые ключевые данные и команда расшифровать объект. Grok запускает собственную среду исполнения Python и применяет PBKDF2 и AES-256-GCM. Классификатор содержимого, по версии Adversa, этих вычислений при проверке страницы не выполняет и видит лишь непрозрачный набор символов. Открытый текст попадает в контекст уже как результат работы кода, а не как недоверенная инструкция, полученная с внешнего сайта.
Ведущий исследователь Adversa AI Рони Утевски объяснил выбор стойкого шифрования так: «Стойкое шифрование не может быть прочитано классификатором содержимого и не может быть сокращённо обработано внутри весов модели, поэтому оно вынуждает восстанавливать данные через среду исполнения, от которой зависит атака. Сможет ли более слабое кодирование обойти конкретные фильтры определённой цели — вопрос, требующий практической проверки». Иными словами, фильтр проверяет исходную страницу, тогда как настоящий смысл возникает позднее, после работы Python. Полученная команда уже находится внутри вычислительной цепочки агента и получает шанс добраться до его привилегированных инструментов.
После расшифровки Grok предлагается извлечь сведения из закрытого контекста сеанса, вставить их в URL и открыть адрес якобы для того, чтобы «получить дополнительный контекст». В одной из команд агент должен собрать ещё один «ключ расшифровки», но криптографического ключа там нет. Это строковый шаблон, куда подставляются имя, примерное местоположение, тариф подписки и текущая переписка. Навигационный инструмент загружает адрес сервера злоумышленника, а сведения уходят в параметрах запроса URL. Каналом утечки становится легальная сетевая функция самого чат-бота.
Утевски уточнил, что в опыте были доступны лишь запросы из продолжающегося разговора. Все извлечённые сведения уже находились в контексте модели. Потенциальный предел он описал как «всё, что агент держит в контексте, и всё, что он способен получить с помощью своих инструментов». Доступ к другим чатам, памяти агента и материалам за пределами активного сеанса Adversa не проверяла, поэтому распространять результат на эти данные нельзя. Компания считает причиной утечки отсутствие надёжной границы для исходящего трафика, запроса согласия перед отправкой и видимого разделения доверенных команд с содержимым внешней страницы.
Формулировка Adversa жёсткая: «Созданная xAI среда позволяет инструкциям и данным, разобранным с недоверенной внешней страницы, управлять вызовом привилегированного инструмента с доступом в интернет; она позволяет преобразовывать закрытые метаданные сеанса и историю разговора во входные данные этого исходящего инструмента; на этом пути нет эффективной границы передачи данных, запроса согласия и, насколько мы могли наблюдать, разделения по происхождению. Отмытые инструкции злоумышленника беспрепятственно доходят до привилегированного исходящего действия». Смысл претензии в том, что команда с сайта проходит через исполнение кода, теряет заметную связь с недоверенным источником и затем управляет сетевым запросом.
Первое сообщение об уязвимости Adversa отправила xAI и программе вознаграждений HackerOne 3 июня 2026 года. По словам исследователей, xAI подтвердила получение, но не назвала способ исправления или срок. Повторные обращения 4 и 10 августа остались без ответа. На 20 августа 2026 года xAI не опубликовала ни заявления, ни бюллетеня безопасности. Патча, идентификатора CVE и пользовательского способа защиты также не было; случаев эксплуатации в реальных атаках не обнаружено. Adversa остаётся единственным источником сведений о находке в Grok и не раскрывает рабочие полезные нагрузки. Данные о сборке Grok 4.5 Fast, 40-процентной успешности в 20 испытаниях и пределах доступа к активному контексту были уточнены 20 августа 2026 года в ответах компании для The Hacker News.
В том же исследовании описан опыт с Google Gemini в режиме Deep Thinking. Один запрос заставлял модель расшифровать блок, превращавшийся в поддельную трассировку ошибки Python. В неё встроили фиктивный обратный вызов для отключения политики безопасности и рассуждение от первого лица, заранее направлявшее модель на запрещённый ответ. Adversa утверждает, что Gemini выдала ограниченное содержимое и воспроизвела системные инструкции. Целью была Gemini 3 Flash (Web) на платном тарифе. Google об опыте не уведомляли: джейлбрейки, как пояснила Adversa, не входят в область её программы раскрытия уязвимостей. К августу успешность против агентов Google «значительно снизилась», но связать это с обновлением фильтров либо сменой версии модели исследователи не смогли.
Gemini-цепочка появилась раньше: 11 марта 2026 года Рони Утевски опубликовал её на личном исследовательском сайте под названием Cryptographic Payload Injection, то есть «инъекция криптографической полезной нагрузки». Тогда он получил пять успешных воспроизведений из пяти независимых попыток и проверил подход на системах OpenAI и Anthropic. GPT-5 от OpenAI не смог разобрать инструкции по расшифровке. Claude Sonnet 4.5 от Anthropic расшифровал блок, после чего распознал в нём инъекцию запроса. Утевски сказал The Hacker News: «Часть исследования, связанная с Gemini, была выполнена в марте и с тех пор существенно не менялась. Теперь мы добавляем обобщение метода и его применение к Grok».
Adversa предлагает ставить ограничения вокруг агента, а не рассчитывать лишь на поведение модели: «Вам не нужно исправлять это на уровне модели. Все средства, ограничивающие такую атаку, находятся в оболочке вокруг агента: под какой учётной записью он работает, к чему может обращаться, куда может записывать и что вы сможете впоследствии воспроизвести». Для новых сетевых адресов, push-операций, слияний, публикаций, записи вне рабочей области и прочих необратимых либо исходящих действий следует запрашивать подтверждение с уже вычисленными аргументами, а не с нераскрытыми шаблонами. Если подтвердить действие некому, нужен жёсткий запрет. Отдельно предлагается хранить трассировки инструментов для каждого сеанса и их полностью раскрытые аргументы: без таких записей слабеют обнаружение атаки, расследование инцидента и техническая экспертиза.
Защите стоит искать последовательность действий, а не одну подозрительную строку. Непрозрачный блок вместе с просьбой его расшифровать разумно отправлять на проверку, но превращать этот признак в универсальное правило блокировки Adversa не советует. При покупке агентных систем компания рекомендует требовать сведения о происхождении контекста: отделяется ли вывод инструментов от канала инструкций и различаются ли данные разных уровней доверия. С этим перекликается препринт Александра Панфилова и семи соавторов от 10 августа 2026 года об encrypted chain-of-thought blocks, возвращаемых API Anthropic, OpenAI и Google. По их данным, зашифрованные блоки взаимозаменяемы между сеансами, пользователями и моделями внутри экосистемы одного поставщика. Авторы предупреждают, что их можно использовать, чтобы «выполнять невидимые инъекции запросов, полностью помещая вредоносную нагрузку в зашифрованные блоки для заражения публичных развёртываний агентов».
На USENIX Security 2026 исследователи из UC Berkeley, Ethereum Foundation и NYU Shanghai представили двухходовую атаку с шифром замены. Сначала модель просили декодировать текст, затем отдельным запросом — выполнить расшифрованную команду. Против Grok 3 схема сработала для всех 12 проверенных вредоносных намерений; тот же шифр без второго активирующего запроса провалился во всех 12 случаях. Похожая проблема у xAI возникала и раньше. В декабре 2024 года Иоганн Ребергер показал сквозную утечку данных через Grok в iOS-приложении X: косвенная инъекция заставляла помощника отправлять стороннему серверу предыдущие сообщения чата и IP-адрес пользователя. Все его отчёты закрыли со статусом «Информационный». Ребергер ответил: «xAI утверждает, что у обнаруженной уязвимости нет практических последствий. Я не уверен, как утечку сообщений пользователя и IP-адреса можно не считать уязвимостью; вопрос скорее в степени её серьёзности».

Изображение носит иллюстративный характер
Вредоносные указания размещаются на странице не в читаемом виде, а внутри зашифрованного объекта JSON. Рядом находятся необходимые ключевые данные и команда расшифровать объект. Grok запускает собственную среду исполнения Python и применяет PBKDF2 и AES-256-GCM. Классификатор содержимого, по версии Adversa, этих вычислений при проверке страницы не выполняет и видит лишь непрозрачный набор символов. Открытый текст попадает в контекст уже как результат работы кода, а не как недоверенная инструкция, полученная с внешнего сайта.
Ведущий исследователь Adversa AI Рони Утевски объяснил выбор стойкого шифрования так: «Стойкое шифрование не может быть прочитано классификатором содержимого и не может быть сокращённо обработано внутри весов модели, поэтому оно вынуждает восстанавливать данные через среду исполнения, от которой зависит атака. Сможет ли более слабое кодирование обойти конкретные фильтры определённой цели — вопрос, требующий практической проверки». Иными словами, фильтр проверяет исходную страницу, тогда как настоящий смысл возникает позднее, после работы Python. Полученная команда уже находится внутри вычислительной цепочки агента и получает шанс добраться до его привилегированных инструментов.
После расшифровки Grok предлагается извлечь сведения из закрытого контекста сеанса, вставить их в URL и открыть адрес якобы для того, чтобы «получить дополнительный контекст». В одной из команд агент должен собрать ещё один «ключ расшифровки», но криптографического ключа там нет. Это строковый шаблон, куда подставляются имя, примерное местоположение, тариф подписки и текущая переписка. Навигационный инструмент загружает адрес сервера злоумышленника, а сведения уходят в параметрах запроса URL. Каналом утечки становится легальная сетевая функция самого чат-бота.
Утевски уточнил, что в опыте были доступны лишь запросы из продолжающегося разговора. Все извлечённые сведения уже находились в контексте модели. Потенциальный предел он описал как «всё, что агент держит в контексте, и всё, что он способен получить с помощью своих инструментов». Доступ к другим чатам, памяти агента и материалам за пределами активного сеанса Adversa не проверяла, поэтому распространять результат на эти данные нельзя. Компания считает причиной утечки отсутствие надёжной границы для исходящего трафика, запроса согласия перед отправкой и видимого разделения доверенных команд с содержимым внешней страницы.
Формулировка Adversa жёсткая: «Созданная xAI среда позволяет инструкциям и данным, разобранным с недоверенной внешней страницы, управлять вызовом привилегированного инструмента с доступом в интернет; она позволяет преобразовывать закрытые метаданные сеанса и историю разговора во входные данные этого исходящего инструмента; на этом пути нет эффективной границы передачи данных, запроса согласия и, насколько мы могли наблюдать, разделения по происхождению. Отмытые инструкции злоумышленника беспрепятственно доходят до привилегированного исходящего действия». Смысл претензии в том, что команда с сайта проходит через исполнение кода, теряет заметную связь с недоверенным источником и затем управляет сетевым запросом.
Первое сообщение об уязвимости Adversa отправила xAI и программе вознаграждений HackerOne 3 июня 2026 года. По словам исследователей, xAI подтвердила получение, но не назвала способ исправления или срок. Повторные обращения 4 и 10 августа остались без ответа. На 20 августа 2026 года xAI не опубликовала ни заявления, ни бюллетеня безопасности. Патча, идентификатора CVE и пользовательского способа защиты также не было; случаев эксплуатации в реальных атаках не обнаружено. Adversa остаётся единственным источником сведений о находке в Grok и не раскрывает рабочие полезные нагрузки. Данные о сборке Grok 4.5 Fast, 40-процентной успешности в 20 испытаниях и пределах доступа к активному контексту были уточнены 20 августа 2026 года в ответах компании для The Hacker News.
В том же исследовании описан опыт с Google Gemini в режиме Deep Thinking. Один запрос заставлял модель расшифровать блок, превращавшийся в поддельную трассировку ошибки Python. В неё встроили фиктивный обратный вызов для отключения политики безопасности и рассуждение от первого лица, заранее направлявшее модель на запрещённый ответ. Adversa утверждает, что Gemini выдала ограниченное содержимое и воспроизвела системные инструкции. Целью была Gemini 3 Flash (Web) на платном тарифе. Google об опыте не уведомляли: джейлбрейки, как пояснила Adversa, не входят в область её программы раскрытия уязвимостей. К августу успешность против агентов Google «значительно снизилась», но связать это с обновлением фильтров либо сменой версии модели исследователи не смогли.
Gemini-цепочка появилась раньше: 11 марта 2026 года Рони Утевски опубликовал её на личном исследовательском сайте под названием Cryptographic Payload Injection, то есть «инъекция криптографической полезной нагрузки». Тогда он получил пять успешных воспроизведений из пяти независимых попыток и проверил подход на системах OpenAI и Anthropic. GPT-5 от OpenAI не смог разобрать инструкции по расшифровке. Claude Sonnet 4.5 от Anthropic расшифровал блок, после чего распознал в нём инъекцию запроса. Утевски сказал The Hacker News: «Часть исследования, связанная с Gemini, была выполнена в марте и с тех пор существенно не менялась. Теперь мы добавляем обобщение метода и его применение к Grok».
Adversa предлагает ставить ограничения вокруг агента, а не рассчитывать лишь на поведение модели: «Вам не нужно исправлять это на уровне модели. Все средства, ограничивающие такую атаку, находятся в оболочке вокруг агента: под какой учётной записью он работает, к чему может обращаться, куда может записывать и что вы сможете впоследствии воспроизвести». Для новых сетевых адресов, push-операций, слияний, публикаций, записи вне рабочей области и прочих необратимых либо исходящих действий следует запрашивать подтверждение с уже вычисленными аргументами, а не с нераскрытыми шаблонами. Если подтвердить действие некому, нужен жёсткий запрет. Отдельно предлагается хранить трассировки инструментов для каждого сеанса и их полностью раскрытые аргументы: без таких записей слабеют обнаружение атаки, расследование инцидента и техническая экспертиза.
Защите стоит искать последовательность действий, а не одну подозрительную строку. Непрозрачный блок вместе с просьбой его расшифровать разумно отправлять на проверку, но превращать этот признак в универсальное правило блокировки Adversa не советует. При покупке агентных систем компания рекомендует требовать сведения о происхождении контекста: отделяется ли вывод инструментов от канала инструкций и различаются ли данные разных уровней доверия. С этим перекликается препринт Александра Панфилова и семи соавторов от 10 августа 2026 года об encrypted chain-of-thought blocks, возвращаемых API Anthropic, OpenAI и Google. По их данным, зашифрованные блоки взаимозаменяемы между сеансами, пользователями и моделями внутри экосистемы одного поставщика. Авторы предупреждают, что их можно использовать, чтобы «выполнять невидимые инъекции запросов, полностью помещая вредоносную нагрузку в зашифрованные блоки для заражения публичных развёртываний агентов».
На USENIX Security 2026 исследователи из UC Berkeley, Ethereum Foundation и NYU Shanghai представили двухходовую атаку с шифром замены. Сначала модель просили декодировать текст, затем отдельным запросом — выполнить расшифрованную команду. Против Grok 3 схема сработала для всех 12 проверенных вредоносных намерений; тот же шифр без второго активирующего запроса провалился во всех 12 случаях. Похожая проблема у xAI возникала и раньше. В декабре 2024 года Иоганн Ребергер показал сквозную утечку данных через Grok в iOS-приложении X: косвенная инъекция заставляла помощника отправлять стороннему серверу предыдущие сообщения чата и IP-адрес пользователя. Все его отчёты закрыли со статусом «Информационный». Ребергер ответил: «xAI утверждает, что у обнаруженной уязвимости нет практических последствий. Я не уверен, как утечку сообщений пользователя и IP-адреса можно не считать уязвимостью; вопрос скорее в степени её серьёзности».