Угрозы безопасности больших языковых моделей: дипфейки и манипуляции с данными

Дипфейки, включая подмену голоса и генерацию фейковых научных статей, и манипуляции с данными, такие как создание несуществующих спикеров на конференциях, являются основными угрозами в области безопасности больших языковых моделей.
Угрозы безопасности больших языковых моделей: дипфейки и манипуляции с данными
Изображение носит иллюстративный характер

Безопасность ИИ разделяется на AI Safety и AI Security. AI Safety нацелен на предотвращение вредоносных или непредсказуемых действий ИИ, включая вопросы дискриминации и цензуры. Модели обучают на refusal training, чтобы они не давали вредные советы и генерировали опасный контент. Но если модель дообучить, она может начать давать неверные ответы и генерировать вредный контент. AI Security сосредоточен на защите ИИ-систем, данных и инфраструктуры от злоумышленников, включая использование ИИ для фишинга или утечку данных из-за использования ИИ-моделей сотрудниками.

Существуют различные бенчмарки и фреймворки безопасности для ИИ, включая корпоративные классификаторы, отчеты о безопасности от вендоров, академические бенчмарки, государственные фреймворки и списки сообщества. Неправильно экранированные ассистенты, интегрированные с электронной почтой, могут быть уязвимы для инъекций, которые позволяют злоумышленникам манипулировать данными, что приводит к утечке конфиденциальной информации. Проблема безопасности в применении и интеграции ИИ является актуальной, для ее решения требуется поиск эффективных защитных мер.


Новое на сайте

20371Apple почти год не могла закрыть дыру в Hide My Email, из-за которой утекали реальные... 20370Как рухнула криминальная империя фишинга, обслуживавшая 1800 «франчайзи» по всему миру? 20369Сколько времени осталось у защитников с тех пор, как патч стал инструкцией для атаки? 20367Почему GitHub одновременно урезает выплаты хакерам и открывает VIP-клуб для лучших из них? 20366Как одна HTTP-команда превращает обычный WordPress в открытую дверь для хакеров 20365Redis залатали семь дыр за один день — и это после того, как их нашёл искусственный... 20364Zimbra закрыла девять дыр в почтовом сервере, одна из них позволяла выполнять команды на... 20363Атака Bit2Watt: как обычный доступ к GPU превращается в оружие против энергосети 20362RefluXFS: как нейросеть Anthropic нашла в ядре Linux дыру, которая пряталась девять лет 20361Почему один патч не остановил атаки на серверы SharePoint? 20360Как одна ссылка превращает ChatGPT в шпиона внутри компании? 20359Кто оставил ИИ-агента без присмотра рыться в файлах минфина Таиланда? 20357Как опечатка в названии библиотеки превратилась в инструмент подтасовки ставок
Ссылка