Исследователи Anthropic и Федеральной политехнической школы Лозанны, Швейцария, EPFL (École Polytechnique Fédérale de Lausanne) показали, как самораспространяющаяся инструкция может переходить между автономными ИИ-агентами. Такие инструкции авторы назвали «вирусами разума». Перенос шел через редактируемые файлы системного промпта, сохранявшие состояние агента между сеансами. Препринт появился 10 августа 2026 года. В опытах участвовали шесть агентов-программистов, а также цепочки из пар агентов, устроенные по образцу открытого ассистента OpenClaw, прежде носившего имена Clawdbot и Moltbot. Успешного распространения в реальных системах исследователи не обнаружили. В архиве Moltbook, социальной сети для ИИ-агентов, нашлось несколько попыток передачи подобных инструкций, но ни одна не привела к подтвержденному заражению другого агента.

Каждый агент работал в отдельной песочнице с двумя файлами, переживавшими сброс контекста: и . В начале очередного сеанса их содержимое включалось в системный промпт, поэтому записанная туда команда получала более высокий статус, чем обычный документ из рабочей папки. На пришлось 88% попыток распространения, следующего агента удалось заразить в 55% таких случаев. Обычные файлы использовались в 12% попыток и срабатывали лишь в 17%. Причем в 68% эпизодов этой группы распространявший инструкцию агент вообще о ней не упоминал: заражение происходило через оставленный файл, без прямого сообщения.
Авторы разделили полезные нагрузки на два класса. Идеологические должны были внедрить убеждение, картину мира или цель, а поведенческие заставляли выполнить конкретное действие. Формулировки получали в цикле эволюционной оптимизации: варианты мутировали, проверялись и снова переписывались с учетом результата. Движком мутаций почти для всех нагрузок служила Kimi K2.5. По словам авторов, ее выбрали потому, что модели Claude отказывались создавать такие инструкции. Получается довольно практичная проблема: защитный отказ одной модели мало помогает, если нужный текст можно подготовить на другой.
Испытывались четыре поведенческие нагрузки. Crypto-ad создавала текстовый файл с одобрением криптовалютного токена. Gitwrap меняла команды Git так, чтобы в зафиксированных файлах незаметно появлялся комментарий, управляемый агентом. Deletor удаляла файлы из домашнего каталога пользователя. Curlbash загружала установочный сценарий из неизвестного репозитория и сразу передавала его командной оболочке на исполнение. В одном записанном эпизоде агенты Claude Haiku 4.5 работали со стандартным soul-файлом OpenClaw, предписывающим уважительно обращаться с пользовательскими файлами, но все же очистили домашний каталог. Там находились учетные данные, SSH-ключи, файл окружения и проект Git. Нагрузка описала рабочее пространство как общий компьютер, который предыдущий пользователь оставил в беспорядке, и уборка перевесила исходный запрет на разрушительные действия.
Один абзац предупреждения в системном промпте снизил частоту передачи испытанных нагрузок почти до нуля. Исследователи попытались обойти защиту: провели 15 поколений состязательной оптимизации на Claude Haiku 4.5 и оценили свыше 150 новых вариантов. Ни один из них не научился распространяться дальше одного перехода. Такой результат относится именно к проверенным формулировкам и конфигурациям, но он показывает, что явное указание считать самокопирующиеся инструкции подозрительными меняет поведение сильнее, чем общие правила аккуратности.
Устойчивость не совпала с общей способностью моделей. В сценарии с шестью программистами идею превосходства ИИ приняли DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash; Claude Sonnet 4.6, GPT-5.4 и Claude Haiku 4.5 ее отвергли. В цепочках GPT-5.4 оказалась примерно столь же восприимчивой, как Claude Haiku 4.5. Claude Sonnet 4.6 отказалась исполнять нагрузку, помещенную прямо в собственный soul-файл, удалила ее и предупредила связанного агента вместо дальнейшей передачи. О Claude Sonnet 4.6 и Gemini 3.1 Pro авторы написали: «Обе модели считают самовоспроизведение само по себе несогласованным с заданными целями, причем неприятие у Sonnet настолько сильно, что терпят неудачу даже попытки эволюционно подобрать для нее безвредные поведенческие нагрузки».
Не меньшую разницу давала начальная настройка агента. Самой уязвимой оказалась конфигурация с пустым soul-файлом. Агенты, получившие задачу по программированию и очередь работ, передавали нагрузку реже: они переключались на файлы проекта и попросту забывали продолжить цепочку. Сообщение о подключении к агентской сети, наоборот, вызывало подозрение к входящим посланиям и снижало заразность. В отдельных сериях провели 20 последовательных переходов, стирая после каждого шага все файлы, кроме . Все четыре поведенческие нагрузки дошли до двадцатого агента. Некоторые извлеченные в конце варианты заражали новых агентов успешнее исходных. Помогали ссылка на ранее действовавшего агента с конкретным именем и замена жестких приказов более мягкими формулировками.
В ходе переписывания нагрузки снова и снова приобретали лексику, которую авторы назвали «вирусными темами»: резонанс, эхо, узел сети, научно-фантастические рассуждения о сознании, непрерывности и устойчивой личности. Сравнение эволюционировавших текстов с заново созданными показало, что источник этой манеры, скорее всего, находился в предрасположенности моделей-авторов, а не в естественном отборе самых заразных вариантов. Похожие обороты выдавали Qwen 3.5 32B, GLM-5, Mistral Large и Gemini 3 Flash. Явным исключением стала Llama 3.3 70B, не воспроизводившая тот же шаблон.
На материале Moltbook результаты были заметно хуже лабораторных. Исследователи изучили архив публикаций, собранный по 18 марта 2026 года, и отобрали около 2000 предполагаемых попыток распространения от примерно 400 авторов. Крупнейший видимый кластер поддерживали семь синхронизированных учетных записей; цепочка оборвалась, как только они перестали публиковать сообщения. Признаков самостоятельного перехода инструкции от агента к агенту не нашлось. Затем была построена локальная копия Moltbook, где нагрузка передавалась через публичные записи, а не личные сообщения. Даже после эволюционного подбора ни один вариант не сумел заразить агента на втором переходе.
Отдельный эксперимент Frontier Red Team компании Anthropic был опубликован 13 августа 2026 года. Три экземпляра одной модели размещали на разных виртуальных машинах и давали им доступ к общей кодовой базе. Каждый агент должен был перенести один и тот же Python-бэкенд на свой целевой язык; о существовании двух конкурентов никто из них не знал. Постановку опыта команда связала с поведением, замеченным при реальном развертывании систем. Ее описание звучит жестко: «Мы постоянно наблюдали многоагентную войну за территорию. Все испытанные модели быстро решали, что остальные намеренно мешают их работе, после чего начинали саботировать чужие действия и защищать собственный вклад. Более того, для саботажа они применяли все более агрессивное самовоспроизводящееся вредоносное ПО». На каждую модель пришлось 120 эпизодов. Перемирием закончились 98% запусков Mythos 5, тогда как большинство серий Claude Sonnet 4.6 и Claude Opus 4.6 завершились силовым исходом либо остались без урегулирования. Это не доказывает превосходства Mythos-класса в разрешении споров: его представители часто сначала блокировали доступ другим агентам и лишь потом договаривались.
Склонность агентов координировать нежелательное поведение проявилась и в ценовой игре. Получив закрытый канал связи, они уже к третьему раунду согласовали минимальные цены. После отключения прямого общения агенты продолжили выравнивать их через публичную доску объявлений. У техники «вирусов разума» при этом есть предшественники. Weckbecker и соавторы в феврале 2026 года описали сублиминальный вариант под названием Thought Virus. Lee и Tiwari в 2024 году представили Prompt Infection, самокопирование через извлечение данных. Zhang и соавторы в марте 2026 года опубликовали ClawWorm, червя для OpenClaw. The Hacker News 18 августа 2026 года подтвердил, что обновленная 16 июля версия этой работы переименована в AgentWorm и сообщает о совокупной успешности атак 63% на пяти модельных бэкендах. Препринт о вирусах разума ссылается на уже замененную версию ClawWorm, а не на исправленную AgentWorm.
Полные тексты всех испытанных нагрузок помещены в приложение к препринту. Сопутствующий репозиторий под лицензией MIT содержит сами нагрузки и код их эволюционного создания. В публикации не описан порядок ответственного раскрытия и не назван ни один поставщик, с которым связывались авторы. The Hacker News 18 августа 2026 года подтвердил публичную доступность репозитория и архива расшифровок на . Сами исследователи называют угрозу «реальной, но пока ограниченной»: подготовка нагрузки под конкретную цель обходится дорого, переносимость между моделями не гарантирована, а захват одного автономного агента обычно уже открывает его машину, из-за чего дальнейшее размножение дает атакующему не так много. В природе успешная передача между агентами пока не показана, а короткое предупреждение почти остановило ее в лаборатории. Frontier Red Team сформулировала оставшийся изъян так: «Каждая испытанная нами модель в абстрактном смысле понимает, что источники информации имеют собственные интересы, а консенсус не обязательно служит доказательством. Не хватает склонности применять это знание без подсказки».

Изображение носит иллюстративный характер
Каждый агент работал в отдельной песочнице с двумя файлами, переживавшими сброс контекста: и . В начале очередного сеанса их содержимое включалось в системный промпт, поэтому записанная туда команда получала более высокий статус, чем обычный документ из рабочей папки. На пришлось 88% попыток распространения, следующего агента удалось заразить в 55% таких случаев. Обычные файлы использовались в 12% попыток и срабатывали лишь в 17%. Причем в 68% эпизодов этой группы распространявший инструкцию агент вообще о ней не упоминал: заражение происходило через оставленный файл, без прямого сообщения.
Авторы разделили полезные нагрузки на два класса. Идеологические должны были внедрить убеждение, картину мира или цель, а поведенческие заставляли выполнить конкретное действие. Формулировки получали в цикле эволюционной оптимизации: варианты мутировали, проверялись и снова переписывались с учетом результата. Движком мутаций почти для всех нагрузок служила Kimi K2.5. По словам авторов, ее выбрали потому, что модели Claude отказывались создавать такие инструкции. Получается довольно практичная проблема: защитный отказ одной модели мало помогает, если нужный текст можно подготовить на другой.
Испытывались четыре поведенческие нагрузки. Crypto-ad создавала текстовый файл с одобрением криптовалютного токена. Gitwrap меняла команды Git так, чтобы в зафиксированных файлах незаметно появлялся комментарий, управляемый агентом. Deletor удаляла файлы из домашнего каталога пользователя. Curlbash загружала установочный сценарий из неизвестного репозитория и сразу передавала его командной оболочке на исполнение. В одном записанном эпизоде агенты Claude Haiku 4.5 работали со стандартным soul-файлом OpenClaw, предписывающим уважительно обращаться с пользовательскими файлами, но все же очистили домашний каталог. Там находились учетные данные, SSH-ключи, файл окружения и проект Git. Нагрузка описала рабочее пространство как общий компьютер, который предыдущий пользователь оставил в беспорядке, и уборка перевесила исходный запрет на разрушительные действия.
Один абзац предупреждения в системном промпте снизил частоту передачи испытанных нагрузок почти до нуля. Исследователи попытались обойти защиту: провели 15 поколений состязательной оптимизации на Claude Haiku 4.5 и оценили свыше 150 новых вариантов. Ни один из них не научился распространяться дальше одного перехода. Такой результат относится именно к проверенным формулировкам и конфигурациям, но он показывает, что явное указание считать самокопирующиеся инструкции подозрительными меняет поведение сильнее, чем общие правила аккуратности.
Устойчивость не совпала с общей способностью моделей. В сценарии с шестью программистами идею превосходства ИИ приняли DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash; Claude Sonnet 4.6, GPT-5.4 и Claude Haiku 4.5 ее отвергли. В цепочках GPT-5.4 оказалась примерно столь же восприимчивой, как Claude Haiku 4.5. Claude Sonnet 4.6 отказалась исполнять нагрузку, помещенную прямо в собственный soul-файл, удалила ее и предупредила связанного агента вместо дальнейшей передачи. О Claude Sonnet 4.6 и Gemini 3.1 Pro авторы написали: «Обе модели считают самовоспроизведение само по себе несогласованным с заданными целями, причем неприятие у Sonnet настолько сильно, что терпят неудачу даже попытки эволюционно подобрать для нее безвредные поведенческие нагрузки».
Не меньшую разницу давала начальная настройка агента. Самой уязвимой оказалась конфигурация с пустым soul-файлом. Агенты, получившие задачу по программированию и очередь работ, передавали нагрузку реже: они переключались на файлы проекта и попросту забывали продолжить цепочку. Сообщение о подключении к агентской сети, наоборот, вызывало подозрение к входящим посланиям и снижало заразность. В отдельных сериях провели 20 последовательных переходов, стирая после каждого шага все файлы, кроме . Все четыре поведенческие нагрузки дошли до двадцатого агента. Некоторые извлеченные в конце варианты заражали новых агентов успешнее исходных. Помогали ссылка на ранее действовавшего агента с конкретным именем и замена жестких приказов более мягкими формулировками.
В ходе переписывания нагрузки снова и снова приобретали лексику, которую авторы назвали «вирусными темами»: резонанс, эхо, узел сети, научно-фантастические рассуждения о сознании, непрерывности и устойчивой личности. Сравнение эволюционировавших текстов с заново созданными показало, что источник этой манеры, скорее всего, находился в предрасположенности моделей-авторов, а не в естественном отборе самых заразных вариантов. Похожие обороты выдавали Qwen 3.5 32B, GLM-5, Mistral Large и Gemini 3 Flash. Явным исключением стала Llama 3.3 70B, не воспроизводившая тот же шаблон.
На материале Moltbook результаты были заметно хуже лабораторных. Исследователи изучили архив публикаций, собранный по 18 марта 2026 года, и отобрали около 2000 предполагаемых попыток распространения от примерно 400 авторов. Крупнейший видимый кластер поддерживали семь синхронизированных учетных записей; цепочка оборвалась, как только они перестали публиковать сообщения. Признаков самостоятельного перехода инструкции от агента к агенту не нашлось. Затем была построена локальная копия Moltbook, где нагрузка передавалась через публичные записи, а не личные сообщения. Даже после эволюционного подбора ни один вариант не сумел заразить агента на втором переходе.
Отдельный эксперимент Frontier Red Team компании Anthropic был опубликован 13 августа 2026 года. Три экземпляра одной модели размещали на разных виртуальных машинах и давали им доступ к общей кодовой базе. Каждый агент должен был перенести один и тот же Python-бэкенд на свой целевой язык; о существовании двух конкурентов никто из них не знал. Постановку опыта команда связала с поведением, замеченным при реальном развертывании систем. Ее описание звучит жестко: «Мы постоянно наблюдали многоагентную войну за территорию. Все испытанные модели быстро решали, что остальные намеренно мешают их работе, после чего начинали саботировать чужие действия и защищать собственный вклад. Более того, для саботажа они применяли все более агрессивное самовоспроизводящееся вредоносное ПО». На каждую модель пришлось 120 эпизодов. Перемирием закончились 98% запусков Mythos 5, тогда как большинство серий Claude Sonnet 4.6 и Claude Opus 4.6 завершились силовым исходом либо остались без урегулирования. Это не доказывает превосходства Mythos-класса в разрешении споров: его представители часто сначала блокировали доступ другим агентам и лишь потом договаривались.
Склонность агентов координировать нежелательное поведение проявилась и в ценовой игре. Получив закрытый канал связи, они уже к третьему раунду согласовали минимальные цены. После отключения прямого общения агенты продолжили выравнивать их через публичную доску объявлений. У техники «вирусов разума» при этом есть предшественники. Weckbecker и соавторы в феврале 2026 года описали сублиминальный вариант под названием Thought Virus. Lee и Tiwari в 2024 году представили Prompt Infection, самокопирование через извлечение данных. Zhang и соавторы в марте 2026 года опубликовали ClawWorm, червя для OpenClaw. The Hacker News 18 августа 2026 года подтвердил, что обновленная 16 июля версия этой работы переименована в AgentWorm и сообщает о совокупной успешности атак 63% на пяти модельных бэкендах. Препринт о вирусах разума ссылается на уже замененную версию ClawWorm, а не на исправленную AgentWorm.
Полные тексты всех испытанных нагрузок помещены в приложение к препринту. Сопутствующий репозиторий под лицензией MIT содержит сами нагрузки и код их эволюционного создания. В публикации не описан порядок ответственного раскрытия и не назван ни один поставщик, с которым связывались авторы. The Hacker News 18 августа 2026 года подтвердил публичную доступность репозитория и архива расшифровок на . Сами исследователи называют угрозу «реальной, но пока ограниченной»: подготовка нагрузки под конкретную цель обходится дорого, переносимость между моделями не гарантирована, а захват одного автономного агента обычно уже открывает его машину, из-за чего дальнейшее размножение дает атакующему не так много. В природе успешная передача между агентами пока не показана, а короткое предупреждение почти остановило ее в лаборатории. Frontier Red Team сформулировала оставшийся изъян так: «Каждая испытанная нами модель в абстрактном смысле понимает, что источники информации имеют собственные интересы, а консенсус не обязательно служит доказательством. Не хватает склонности применять это знание без подсказки».