Ssylka

Как Wildberries находит дубликаты товаров: подробный анализ

Как маркетплейс Wildberries находит одинаковые товары от разных продавцов для предложения более выгодной цены или быстрой доставки? Процесс начинается с отбора кандидатов на основе текстовых и визуальных данных, которые преобразуются в эмбеддинги и обрабатываются алгоритмами ближайшего соседства. На этом этапе используются модели E5-small и Vit-H, а также реализация Faiss на GPU для ускорения поиска.
Как Wildberries находит дубликаты товаров: подробный анализ
Изображение носит иллюстративный характер

Затем, на этапе классификации, отбираются точные дубликаты с помощью двух моделей: Bi-encoder и Cross-encoder. Bi-encoder, обученный для каждой категории товаров, опирается на эмбеддинги, а Cross-encoder использует текстовые описания, исключая шумные данные. Использование двухэтапной модели позволяет достичь баланса между точностью и скоростью работы.

Для уточнения результатов применяется графовый анализ. Используя алгоритмы выделения сообществ, система объединяет товары в полносвязные группы и отсекает слабые связи, тем самым повышая точность и качество результатов.

Финальный результат: более трети из 130 миллионов товаров идентифицированы как дубликаты. Обновление алгоритмов, замена моделей, применение mmap + Faiss, а также добавление этапа Cross-encoder значительно повлияли на метрики, в частности, на точность и выручку.


Новое на сайте

18884Знаете ли вы, что приматы появились до вымирания динозавров, и готовы ли проверить свои... 18883Четыреста колец в туманности эмбрион раскрыли тридцатилетнюю тайну звездной эволюции 18882Телескоп Джеймс Уэбб раскрыл тайны сверхэффективной звездной фабрики стрелец B2 18881Математический анализ истинного количества сквозных отверстий в человеческом теле 18880Почему даже элитные суперраспознаватели проваливают тесты на выявление дипфейков без... 18879Шесть легендарных древних городов и столиц империй, местоположение которых до сих пор... 18878Обзор самых необычных медицинских диагнозов и клинических случаев 2025 года 18877Критическая уязвимость CVE-2025-14847 в MongoDB открывает удаленный доступ к памяти... 18876Научное обоснование классификации солнца как желтого карлика класса G2V 18875Как безграничная преданность горным гориллам привела Дайан Фосси к жестокой гибели? 18874Новый родственник спинозавра из Таиланда меняет представления об эволюции хищников Азии 18873Как новая электрохимическая технология позволяет удвоить добычу водорода и снизить... 18872Могут ли ледяные гиганты Уран и Нептун на самом деле оказаться каменными? 18871Внедрение вредоносного кода в расширение Trust Wallet привело к хищению 7 миллионов... 18870Проверка клинического мышления на основе редких медицинских случаев 2025 года