Ssylka

Платформа Selectel для inference: аватар среди ML-решений

Платформа Selectel для инференса ML-моделей выделяется среди стандартных решений, таких как деплой с Helm chart и Triton в Kubernetes, благодаря пяти ключевым элементам. Во-первых, используется Canary Deployment на основе Istio для плавного обновления моделей и тестирования новых версий на ограниченном трафике. Это позволяет минимизировать риски и обеспечить стабильную работу сервиса.
Платформа Selectel для inference: аватар среди ML-решений
Изображение носит иллюстративный характер

Во-вторых, платформа поддерживает автоматическое масштабирование, используя Prometheus-адаптер для отслеживания метрик и Horisontal Pod Autoscaler (HPA) для управления количеством реплик. Процесс автоскейлинга ускорен за счет кэширования весов моделей в NFS или S3, а также благодаря применению сжатия ZSTD для образов. Для GPU-ресурсов применяются технологии разделения, такие как MIG, TimeSlicing и MPS, что позволяет эффективно использовать имеющиеся мощности.

В-третьих, для создания сложных цепочек моделей платформа предлагает использование инференс-графов на основе Ray Serve. Этот подход позволяет объединять различные модели, запущенные на разных нодах, для решения комплексных задач, например, транскрибации аудио и генерации изображений. Несмотря на существующие сложности с распределением деплоев на worker-нодах, платформа обеспечивает гибкость в создании сложных ML-пайплайнов.

В-четвертых, платформа оптимизирует работу Triton Inference Server, применяя батчинг запросов для увеличения пропускной способности и использует инструменты Model Analyzer и Model Navigator для подбора оптимальных конфигураций и форматов моделей. Такой подход позволяет значительно ускорить инференс и снизить затраты. Наконец, пользовательский интерфейс платформы реализован на базе Grafana, Kiali и Jaeger, что обеспечивает удобное мониторинга и визуализацию метрик, трафика и логов без необходимости привлекать фронтенд-разработчиков.


Новое на сайте

19026Станет ли бактериальная система самоуничтожения SPARDA более гибким инструментом... 19025Насколько опасной и грязной была вода в древнейших банях Помпей? 19024Гравитационная ориентация и структура космических плоскостей от земли до сверхскоплений 19023Сколько частей тела и органов можно потерять, чтобы остаться в живых? 19022Зачем Сэм Альтман решил внедрить рекламу в бесплатные версии ChatGPT? 19021Хитроумная маскировка вредоноса GootLoader через тысячи склеенных архивов 19020Удастся ли знаменитому археологу Захи Хавассу найти гробницу Нефертити до ухода на покой? 19019Действительно ли «зомби-клетки» провоцируют самую распространенную форму эпилепсии и... 19018Генетический анализ мумий гепардов из саудовской Аравии открыл путь к возрождению... 19017Вредоносная кампания в Chrome перехватывает управление HR-системами и блокирует... 19016Глубоководные оползни раскрыли историю мегаземлетрясений зоны Каскадия за 7500 лет 19015Насколько глубоки ваши познания об эволюции и происхождении человека? 19014Как уязвимость CodeBreach в AWS CodeBuild могла привести к глобальной атаке через ошибку... 19013Затерянный фрагмент древней плиты пионер меняет карту сейсмических угроз Калифорнии 19012Генетические мутации вызывают слепоту менее чем в 30% случаев вопреки прежним прогнозам