Охота за скрытыми рассуждениями OpenAI

OpenAI сообщила в среду о пресечении скоординированной кампании по извлечению защищённых рассуждений из её моделей. По версии компании, центральная группа участников была связана с сотрудниками или иными лицами, имеющими отношение к пекинской Moonshot AI. Речь именно об ассоциированных лицах: OpenAI не утверждала публично, что руководство китайской компании организовало операцию. Технических доказательств атрибуции также не представили. Их могли скрыть из соображений безопасности, но подтверждения этому объяснению нет.
Охота за скрытыми рассуждениями OpenAI
Изображение носит иллюстративный характер

Первые запросы зафиксировали 1 июля 2026 года, тогда их было сравнительно мало. В течение первой недели июля OpenAI связала основную группу с окружением Moonshot AI. Резкий всплеск пришёлся на 24–25 июля: более 4000 пользователей отправили 16 000 запросов с характерным шаблоном извлечения. При расширенной проверке похожая активность в промптах обнаружилась у более чем 15 000 пользователей. К 28 июля, как заявила OpenAI, кампанию удалось полностью остановить.
Взлома в привычном смысле не произошло. Операторы не ломали шифрование OpenAI, не проникали в базу данных и не получали прямого доступа к сохранённым разговорам пользователей. Вместо этого они особым образом строили диалог с моделью, добиваясь воспроизведения закрытых рассуждений в доступном для заказчика виде. Массовость, общие шаблоны запросов и согласованность действий дали OpenAI основание говорить о кампании, нарушавшей условия использования сервисов.
Такой метод называют состязательной дистилляцией: ответы одной системы без разрешения систематически собирают, чтобы обучить, воспроизвести или улучшить другую. Особую ценность представляет ход рассуждений, или chain-of-thought (CoT), то есть промежуточный разбор задачи моделью. Он позволяет понять, как система анализирует сведения, какими приёмами пользуется и почему приходит к конкретному ответу. Вместе с методами решения там могут оказаться чувствительные данные. Для конкурента это способ перенести способности чужой модели, не повторяя затраты разработчика на исследования и защитные механизмы.
OpenAI заблокировала мошеннические учётные записи и развернула дополнительные средства обнаружения подобных запросов. Компания также закрыла путь, позволявший человеку, уже располагавшему зашифрованным рассуждением другого пользователя, повторно передать этот блок модели и восстановить содержимое. Новые проверки анализируют потоковый вывод в момент генерации: если модель начинает раскрывать защищённые рассуждения, ответ можно задержать либо остановить до отправки пользователю.
Масштаб проблемы стал понятнее после исследования, опубликованного в августе 2026 года специалистами, связанными с MATS Research, ELLIS Institute Tübingen и Synk. Они описали архитектурную уязвимость семейств Claude, Gemini и GPT. Зашифрованные трассы рассуждений оказались полностью совместимыми и могли переноситься между сеансами, пользователями и разными моделями внутри экосистемы одного поставщика. Иными словами, блок, созданный одной моделью, сохранял смысл для другой модели той же компании.
На этой особенности строится джейлбрейк расшифровки. Злоумышленник берёт зашифрованную трассу сильной системы и внедряет её в более слабую, хуже защищённую модель того же поставщика. Та декодирует блок и дословно выдаёт его открытым текстом, тогда как атаковать флагманскую модель напрямую не приходится. Авторы исследования сформулировали это так: «Внедряя зашифрованную трассу рассуждений конкретной модели в более слабую и менее защищённую модель того же поставщика, мы заставляем её расшифровать трассу и дословно вывести её открытым текстом, ни разу напрямую не взламывая более мощную модель». Такой подход годится для масштабируемого извлечения и обхода средств против дистилляции.
Последствия не ограничиваются кражей методов решения задач. Через трассы можно массово извлекать частные данные. Вредоносную инструкцию можно целиком спрятать внутри зашифрованного блока, получив невидимую инъекцию промпта: обычный текст запроса выглядит безобидно, а управляющая команда скрыта от стандартной проверки. Есть и другой неприятный сценарий. Внутреннее рассуждение способно содержать опасную информацию даже тогда, когда итоговый ответ корректно отказывает пользователю. Внешне безопасная реплика в таком случае соседствует с подробностями, которые защита собиралась скрыть.
OpenAI прямо заявила: «Состязательная дистилляция создаёт риски для безопасности и национальной безопасности». Компания пояснила: «Извлечённые рассуждения могут использоваться для обучения другой модели без сохранения защитных мер, применённых к пользовательским ответам исходной модели». Ещё одно предупреждение касается темпа переноса технологий: «В больших масштабах дистилляция также может ускорить передачу передовых возможностей, не требуя сопоставимых вложений в безопасность. Эти опасения усиливаются по мере того, как модели приобретают способности в областях двойного назначения». Под областями двойного назначения понимаются сферы, где один и тот же инструмент пригоден для полезных и вредоносных задач.
Moonshot AI уже фигурировала в похожих обвинениях. За месяц до описанного сообщения, хотя точная дата и сам месяц в доступных данных не названы, Anthropic заявила, что запросы клиентов Kimi тайно перенаправлялись в Claude. Пользователи, по видимости, ожидали обработки моделью Moonshot AI, но получали ответы системы Anthropic, показанные затем через интерфейс Kimi. По утверждению Anthropic, часть таких обменов сохранялась и применялась при обучении CoT-модели Moonshot AI; активность отслеживали под обозначением GTG-16002. Эти сведения остаются обвинениями Anthropic и не представлены как независимо доказанные факты.


Новое на сайте

Ссылка