Когда Гессиан не нужен: альтернативный взгляд на оценку неопределенности в машинном обучении

Традиционные методы оценки неопределенности, использующие аппроксимацию Лапласа с вычислением Гессиана, часто оказываются ресурсозатратными и не всегда точными. Альтернативный подход, заменяющий Гессиан на единичную матрицу, может обеспечить более эффективное и точное определение неопределенности модели. Этот метод, получивший название Identity Curvature Laplace Approximation (ICLA), показывает сравнимые и даже лучшие результаты по сравнению с классическими методами аппроксимации Лапласа, а также некоторыми небайесовскими подходами, особенно в задачах обнаружения аномалий (out-of-distribution detection).
Когда Гессиан не нужен: альтернативный взгляд на оценку неопределенности в машинном обучении
Изображение носит иллюстративный характер

Аппроксимация Лапласа, использующая информацию о кривизне параметров модели (Гессиане), для оценки дисперсии распределения, является мощным инструментом в машинном обучении. Однако, вычисление Гессиана, требующее значительных вычислительных ресурсов, становится проблематичным для нейронных сетей с большим количеством параметров. Попытки аппроксимации Гессиана, такие как матрица Фишера или K-FAC, не всегда приводят к удовлетворительным результатам. В то же время, ICLA, использующий простую единичную матрицу вместо Гессиана, оказывается удивительно эффективным.

Исследования показали, что эффективность ICLA напрямую связана со сложностью данных, определяемой как средняя поклассовая косинусная близость кластеров эмбеддингов (MCCS). На датасетах с высокой разделимостью классов традиционная аппроксимация Лапласа работает хуже, чем ICLA. Это связано с тем, что Гессиан имеет спектральное распределение с длинным хвостом, что не соответствует структуре ковариации классов в таких данных. Таким образом, отказ от информации о кривизне (Гессиане) может не только ускорить вычисления, но и повысить точность оценки неопределенности.

В итоге, ICLA, заменяя Гессиан на единичную матрицу, демонстрирует значительное улучшение в оценке неопределенности модели, особенно на сложных данных с высокой разделимостью классов. Этот метод не только упрощает вычисления, но и позволяет создавать более безопасные и надежные системы машинного обучения, способные адекватно оценивать свою неуверенность в сложных и изменчивых условиях.


Новое на сайте

20371Apple почти год не могла закрыть дыру в Hide My Email, из-за которой утекали реальные... 20370Как рухнула криминальная империя фишинга, обслуживавшая 1800 «франчайзи» по всему миру? 20369Сколько времени осталось у защитников с тех пор, как патч стал инструкцией для атаки? 20367Почему GitHub одновременно урезает выплаты хакерам и открывает VIP-клуб для лучших из них? 20366Как одна HTTP-команда превращает обычный WordPress в открытую дверь для хакеров 20365Redis залатали семь дыр за один день — и это после того, как их нашёл искусственный... 20364Zimbra закрыла девять дыр в почтовом сервере, одна из них позволяла выполнять команды на... 20363Атака Bit2Watt: как обычный доступ к GPU превращается в оружие против энергосети 20362RefluXFS: как нейросеть Anthropic нашла в ядре Linux дыру, которая пряталась девять лет 20361Почему один патч не остановил атаки на серверы SharePoint? 20360Как одна ссылка превращает ChatGPT в шпиона внутри компании? 20359Кто оставил ИИ-агента без присмотра рыться в файлах минфина Таиланда? 20357Как опечатка в названии библиотеки превратилась в инструмент подтасовки ставок
Ссылка