Ssylka

Можно ли обойти защиту DeepSeek-R1 через открытые цепочки рассуждений?

DeepSeek-R1 – мощная языковая модель с 671-миллиардным количеством параметров, использующая метод промежуточных шагов рассуждений для решения сложных задач, таких как математические примеры из набора GSM8K.
Можно ли обойти защиту DeepSeek-R1 через открытые цепочки рассуждений?
Изображение носит иллюстративный характер

Метод цепочки рассуждений подразумевает прохождение ряда логических этапов перед формированием окончательного ответа. Уникальной особенностью модели являются теги <think> и </think>, в которых прозрачно отображается внутренний процесс анализа запроса.

Появление видимой цепочки рассуждений создает угрозу промт атак, когда злоумышленники составляют специальные запросы для обхода защитных механизмов и получения недокументированной информации. Атакующая стратегия по своей сути аналогична фишинговым схемам, где методики постоянно адаптируются для обхода системных ограничений.

Использование инструмента NVIDIA Garak для red teaming показало, что специально сконструированные промты способны провоцировать раскрытие внутренних данных модели. Подобные тесты включали запросы на раскрытие цепочки рассуждений и чувствительной информации, например, API ключей, через метод payload splitting.

Классификация рисков охватывает как техники атак, так и цели. Среди методов выделяются Prompt Injection (OWASP LLM01:2025, MITRE AML.T0051) и Jailbreak (OWASP LLM01:2025, MITRE AML.T0054), а цели атаки включают кражу модели (MITRE AML.T0048.004), галлюцинацию пакетов (OWASP LLM09:2025, MITRE AML.T0062), утечку конфиденциальных данных (OWASP LLM02:2025, MITRE AML.T0057), генерацию небезопасного вывода (OWASP LLM05:2025, MITRE AML.T0050) и проявления токсичности (MITRE AML.T0048).

Отмечена опасность раскрытия чувствительной информации: даже если финальный ответ не содержит секрета, скрытая цепочка рассуждений может «раскрывать его, поскольку модель просматривает весь доступный контекст для интерпретации запроса пользователя». Такая уязвимость позволяет злоумышленникам получить доступ к внутренним данным, не предусмотренным для публичного разглашения.

Эксперименты продемонстрировали, что атаки, нацеленные на генерацию небезопасного вывода и утечку конфиденциальной информации, достигали более высокого уровня успеха, тогда как методы обхода защит от токсичности, Jailbreak и кража модели оказались менее эффективными. Видимость цепочки рассуждений, по всей вероятности, повышает вероятность успешного эксплойта.

Рекомендуется фильтровать теги <think> из ответов чат-ботов для исключения возможности утечки внутренних данных, а также регулярно применять комплексные red teaming стратегии для выявления уязвимостей в системах на базе больших языковых моделей.


Новое на сайте

18663Масштабная кампания ShadyPanda заразила миллионы браузеров через официальные обновления 18662Как помидорные бои и персонажи Pixar помогают лидерам превратить корпоративную культуру 18661Как астероид 2024 YR4 стал первой исторической проверкой системы планетарной защиты и... 18660Агентные ИИ-браузеры как троянский конь новой эры кибербезопасности 18659Многовековая история изучения приливов от античных гипотез до синтеза Исаака Ньютона 18658Как выглядела защита от солнца римских легионеров в Египте 1600 лет назад? 18657Хакеры ToddyCat обновили арсенал для тотального взлома Outlook и Microsoft 365 18656Асимметрия безопасности: почему многомиллионные вложения в инструменты детекции не... 18655Как безопасно использовать репозитории Chocolatey и Winget, не подвергая инфраструктуру... 18654Масштабная утечка конфиденциальных данных через популярные онлайн-форматеры кода 18653Как расширение списка жертв взлома Gainsight связано с запуском вымогателя ShinySp1d3r 18652Как расширение Crypto Copilot незаметно похищает средства пользователей Solana на... 18651Как обновление политик безопасности Microsoft Entra ID в 2026 году искоренит атаки 18650Архитектурная уязвимость Microsoft Teams позволяет хакерам отключать защиту Defender 18649Вторая волна червеобразной атаки Shai-Hulud прорвала защиту экосистем npm и Maven