Ssylka

Угрозы безопасности больших языковых моделей: дипфейки и манипуляции с данными

Дипфейки, включая подмену голоса и генерацию фейковых научных статей, и манипуляции с данными, такие как создание несуществующих спикеров на конференциях, являются основными угрозами в области безопасности больших языковых моделей.
Угрозы безопасности больших языковых моделей: дипфейки и манипуляции с данными
Изображение носит иллюстративный характер

Безопасность ИИ разделяется на AI Safety и AI Security. AI Safety нацелен на предотвращение вредоносных или непредсказуемых действий ИИ, включая вопросы дискриминации и цензуры. Модели обучают на refusal training, чтобы они не давали вредные советы и генерировали опасный контент. Но если модель дообучить, она может начать давать неверные ответы и генерировать вредный контент. AI Security сосредоточен на защите ИИ-систем, данных и инфраструктуры от злоумышленников, включая использование ИИ для фишинга или утечку данных из-за использования ИИ-моделей сотрудниками.

Существуют различные бенчмарки и фреймворки безопасности для ИИ, включая корпоративные классификаторы, отчеты о безопасности от вендоров, академические бенчмарки, государственные фреймворки и списки сообщества. Неправильно экранированные ассистенты, интегрированные с электронной почтой, могут быть уязвимы для инъекций, которые позволяют злоумышленникам манипулировать данными, что приводит к утечке конфиденциальной информации. Проблема безопасности в применении и интеграции ИИ является актуальной, для ее решения требуется поиск эффективных защитных мер.


Новое на сайте

18415Как в реальном времени рождается новая система колец? 18414Цепная реакция: как дефект патча Microsoft WSUS привел к глобальным атакам 18413Разрыв восприятия: опасная иллюзия кибербезопасности 18412Сделал ли древний яд Homo sapiens доминирующим видом? 18411Космические вспышки, ускользающее время и тайны прошлого 18410Почему опорожнение кишечника ощущается как награда? 18409Восстание темного ИИ: новая гонка кибервооружений 18408Зачем миру воскресший неандерталец? 18407Из кого на самом деле состояла римская армия в разгар кризиса? 18406Как расположение глаз лошади определяет её выживание? 18405Почему Meta и TikTok грозят миллиардные штрафы за нарушение европейского закона о... 18404За гранью видимого: победители фотоконкурса дикой природы 2025 18403Почему пакистанские хакеры создали вирус специально для индийских Linux-систем? 18402Дерево из штормов: как арборист создал 15-футовую ель из морского стекла