Атака Bit2Watt: как обычный доступ к GPU превращается в оружие против энергосети

Трое исследователей из Чжэцзянского университета описали метод, при котором арендатор облачного сервиса — без эксплойтов, вредоносного ПО и украденных учётных данных — способен раскачивать потребление электроэнергии в дата-центре с такой скоростью, что это потенциально угрожает подключённой к нему энергосети. Работа принята на CHES 2026, конференцию IACR по аппаратной безопасности. Авторы объединили реальные замеры мощности видеокарт с симуляциями дестабилизации энергосистем и сформулировали вопрос прямо: могут ли чисто вычислительные операции, выполняемые как легитимная нагрузка, быть превращены в оружие против энергетической инфраструктуры.
Первый метод атаки, названный SWMA (Synthetic Workload Modulation Attack), построен на специально написанном CUDA-ядре, которое переключается между интенсивной нагрузкой и почти простоем. Управление происходит через один-единственный флаг в unified memory, выделенной вызовом cudaMallocManaged, а контролирует всё хост-процесс. Частота переключений достигает диапазона от 1,5 до 6 кГц, причём пик пришёлся на RTX 4090. Для сравнения: бытовые нагрузки вроде кондиционеров колеблются с частотой в единицы герц — разница на три порядка. Метод сработал и на серверных картах A100 и Tesla V100. Слабое место у SWMA одно: характерный паттерн ядра и опроса можно отследить и зафиксировать провайдером как аномалию.
Второй метод, LTMA (LLM Training Modulation Attack), встраивает модуляцию мощности прямо в обучение настоящей языковой модели — через подбор гиперпараметров и добавление вспомогательных операций. Частотный диапазон здесь ниже и менее управляемый — от 1,2 до 3 кГц, зато амплитуда выше, а сам сигнал растворяется в обычном шуме тренировочного процесса, что делает его труднее обнаружить. Ни один из двух методов не требует повышенных привилегий: арендатор и так полностью контролирует свои скрипты и расписания задач.
Для оценки масштаба последствий авторы прогнали сценарий на модели локальной сети мощностью 1 МВт, на 90% питаемой распределёнными энергоресурсами — солнечными панелями на крышах и батареями. При синхронной модуляции тысячи GPU суммарное гармоническое искажение тока (THD) достигло 46,8% при нормативном ориентире IEC 61000-3-12 в 13%. Коэффициент демпфирования оказался отрицательным — минус 0,27, то есть сеть не гасит возмущения, а усиливает их. На модели покрупнее, имитирующей европейскую энергосистему из 9241 узла, локальное возмущение в 2% от системной нагрузки спровоцировало каскад из 13 стадий с потерей около 81% нагрузки. Авторы прямо оговариваются: это свойство модели при наихудших предположениях, а не прогноз реального развития событий.
Самое уязвимое место всей конструкции — допущение о синхронности. Авторы сами называют его открытой проблемой: в их же модели на частоте 2 кГц джиттер тайминга со стандартным отклонением всего в 100 микросекунд снизил суммарную амплитуду примерно на 20%. Чтобы атака сработала в реальности, нужны физически сгруппированные GPU, жёсткая синхронизация, сохранение модуляции после ступеней кондиционирования питания и совпадение резонансов сети с частотой атаки — набор условий, который пока существует только в лаборатории.
Косвенное подтверждение серьёзности темы появилось раньше самой атаки. В августе 2025 года Microsoft, OpenAI и NVIDIA опубликовали совместную работу о стабилизации энергопотребления при обучении ИИ-моделей, предупредив, что синхронные колебания мощности от крупных тренировочных задач, совпав с критическими частотами энергосистемы, способны причинить физический ущерб инфраструктуре сети. А в июле 2024 года в Северной Вирджинии, регионе с высокой концентрацией дата-центров, произошёл реальный инцидент: авария на линии электропередачи привела к мгновенному отключению около 1500 МВт нагрузки дата-центров от сети — системы защиты объектов переключились на резервное питание. Североамериканская корпорация надёжности электроснабжения (NERC) заявила, что на тот момент возмущение не создало риска для надёжности сети, хотя потребовалась коррекция напряжения, и предупредила, что риск будет расти по мере масштабирования нагрузок дата-центров. Позже в том же году NERC создала рабочую группу по крупным нагрузкам для изучения проблемы. Важная деталь: тот инцидент был случайным следствием самозащиты оборудования, а не атакой.
Исследователи описали и побочный эффект, который назвали Watt2Bit — обратную петлю. Возмущения мощности от атаки вызывают гармонический нагрев и повышенный ток, что может привести к срабатыванию тепловой или токовой защиты и отключению серверов с GPU. По сути, проблема качества электропитания превращается в атаку типа отказ в обслуживании.
Обнаружилась и вторая побочная возможность — скрытый канал передачи данных через электромагнитные помехи. Та же техника модуляции кодирует биты: частота 2 кГц соответствует единице, 200 Гц — нулю. Сигнал перехватывался ближнепольной антенной, подключённой к программно-определяемому радиоприёмнику, и авторы восстановили тестовую последовательность из 50 бит без единой ошибки. Для сравнения напрашивается атака PowerHammer, о которой The Hacker News писал ещё в 2018 году: там данные считывались непосредственно из проводки питания, и подключиться можно было где угодно — от розетки до электрощита. Bit2Watt требует антенны рядом с самим оборудованием для перехвата ближнего поля. Оба метода объединяет одно ограничение — необходимость физической близости, ни один не работает удалённо через интернет.
Обнаружить такую модуляцию штатными средствами телеметрии сложно. Счётчики стоечных PDU снимают показания раз в секунду, телеметрия NVML от NVIDIA работает на частоте 450 Гц, а самые быстрые из массовых интерфейсов — RAPL и серверные BMC — упираются в потолок около 1 кГц. Частоты атаки в несколько раз выше этих порогов. В тестах лёгкий детектор, использующий только данные о мощности и NVML, показал слабые результаты; добавление профилирования GPU улучшило картину; лучше всего сработал выделенный датчик электромагнитных помех. LTMA во всех случаях оказался труднее обнаружить, чем SWMA. Оговорка авторов: тестировались исследовательские детекторы, а не проприетарные системы крупных облачных провайдеров, так что вывод о слепоте гиперскейлеров делать преждевременно.
Ключевая особенность всей истории в том, что патчить, по сути, нечего — это не программная уязвимость с конкретной дырой в коде. Корень проблемы архитектурный: тесная связь между изменчивой вычислительной нагрузкой GPU и энергосетью, насыщенной инверторами. Ни одна система мониторинга сегодня не наблюдает за этой границей целиком. Авторы предлагают защиту с двух сторон — со стороны энергосистемы это батареи, суперконденсаторы и гармоническая фильтрация, со стороны вычислений — детекция аномалий загрузки GPU и мониторинг расписаний обучения. Но единой системы, связывающей обе стороны воедино, пока не существует — авторы прямо называют это будущей работой.
Организационная проблема здесь не менее фундаментальна, чем техническая: энергосистему и вычислительную инфраструктуру эксплуатируют разные компании, используя разные инструменты мониторинга, и ни одна сторона не построена так, чтобы наблюдать за другой. Именно в этом зазоре, у которого пока нет хозяина, и живёт уязвимость Bit2Watt. Все физические эксперименты проводились в контролируемых тестовых стендах, а заявления о повреждениях в масштабе энергосети получены исключительно из симуляций — ни одна production-система атаке не подвергалась, и никакой конкретный коммерческий продукт с раскрытой уязвимостью не назван. The Hacker News сообщил, что обратился к исследователям из Чжэцзянского университета за комментарием относительно реальной масштабируемости атаки, и ответ пока ожидается.


Новое на сайте

Ссылка