Почему Google снимает ограничения с Gemini 4 Argon?

В среду, без указания точной календарной даты, Google объявила о создании своей новейшей передовой модели Gemini 4 Argon. Доступ к ней постепенно получают отобранные специалисты по киберзащите, участвующие в Fairwind Program. Для широкой публики модель пока не предназначена: компания собирается проверять её в руках людей, которым доверяет работу с опасными возможностями.
Почему Google снимает ограничения с Gemini 4 Argon?
Изображение носит иллюстративный характер

По словам Google, Argon рассчитан на сложные рабочие задачи из реального мира. Модель может писать и анализировать программный код, обрабатывать корпоративные знания, помогать с юридическими и финансовыми материалами, а также искать слабые места в цифровой инфраструктуре. Старший вице-президент Google DeepMind и главный архитектор ИИ в Google Корай Кавукчуоглу (Koray Kavukcuoglu) описал её так: «Она показывает передовой уровень в сложных рабочих процессах, охватывающих реальную разработку программного обеспечения, корпоративную интеллектуальную работу, например юридические и финансовые задачи, а также киберзащиту».
По уровню автономности Gemini 4 Argon сравнивают с продвинутыми моделями Anthropic и OpenAI. Argon способен самостоятельно находить критические уязвимости, проверять, действительно ли они пригодны для эксплуатации, а затем готовить исправления. Такая связка меняет привычный темп аудита: специалисту не приходится вручную повторять каждый этап, хотя окончательное решение всё равно требует человеческой проверки.
Во время испытаний Argon обнаружил ранее неизвестную критическую уязвимость в медицинском программном обеспечении, которым пользуются больницы по всему миру. Ошибка открывала доступ к конфиденциальным персональным данным. Google не назвала ни продукт, ни его разработчика, ни технические особенности найденной бреши. Сдержанность здесь понятна: подробное описание до установки исправлений могло бы превратить исследовательскую находку в готовую инструкцию для атаки.
Анонс появился почти через месяц после представления Gemini 3.8 Flash Cyber, которую Google на тот момент называла своей самой мощной моделью для кибербезопасности. Теперь компания говорит о «впечатляющем скачке» в поиске уязвимостей. Gemini 4 Argon лучше обследует доступную поверхность атаки и создаёт доказательства работоспособности найденных ошибок, известные как proof of concept, или PoC. Такой прототип позволяет установить, реальна ли угроза, а не числится ли она лишь теоретической возможностью.
Самая спорная часть плана Google связана с отдельной версией Argon без стандартных защитных ограничений в области кибербезопасности. Её получат доверенные защитники и внутренние команды Google, чтобы пользоваться полным набором функций модели. О публичном выпуске этой редакции речи нет. Фактически компания проводит границу не между мощной и урезанной моделью, а между проверенными пользователями и всеми остальными.
Перед более широким распространением Gemini 4 Argon разработчики дорабатывают защиту по трём направлениям. Первое касается рассогласования, когда действия или цели модели расходятся с намерениями создателей и оператора. Второе связано со злоупотреблением её возможностями со стороны атакующих. Третье — устойчивость к косвенным инъекциям инструкций, или indirect prompt injections, IPI: вредоносная команда прячется во внешнем документе, письме либо веб-странице, которую ИИ получает для обработки.
Google опубликовала оценку модели и сообщила, что Argon занял первое место в IPI-бенчмарке Gray Swan, опередив конкурентов в испытаниях, связанных с косвенными инъекциями. Результат стоит читать именно как заявление Google: независимые подробности тестирования в представленных данных не приведены. Даже высокий балл на Gray Swan не устраняет риск, поскольку новые вредоносные инструкции можно маскировать способами, которых не было в тестовом наборе.
Для контроля рассогласования Google внедряет механизмы, наблюдающие за ходом рассуждений Argon и совершаемыми им действиями. Если поведение становится опасным, выполнение задачи прекращается. Формулировка компании звучит прямо: «Мы внедряем меры против рассогласования, которые отслеживают цепочку рассуждений и действия Argon и при необходимости останавливают выполнение». Такой надзор особенно существенен для модели, способной не просто описать уязвимость, а проверить её и подготовить исправление.
Google призвала Google DeepMind, Anthropic, OpenAI и остальных участников отрасли сохранять прозрачность рассуждений по мере роста возможностей моделей. Доступный для наблюдения ход рассуждений помогает заметить рассогласование, понять его причину и вмешаться во время работы системы, а не после ущерба. Компания сформулировала позицию так: «Мы настоятельно призываем остальную отрасль сохранять прозрачность рассуждений в эти переломные моменты роста возможностей и работы с рисками рассогласования, чтобы мысли моделей оставались полезными для выявления и диагностики рассогласования».[/final]


Новое на сайте

Ссылка