Как Wildberries находит дубликаты товаров: подробный анализ

Как маркетплейс Wildberries находит одинаковые товары от разных продавцов для предложения более выгодной цены или быстрой доставки? Процесс начинается с отбора кандидатов на основе текстовых и визуальных данных, которые преобразуются в эмбеддинги и обрабатываются алгоритмами ближайшего соседства. На этом этапе используются модели E5-small и Vit-H, а также реализация Faiss на GPU для ускорения поиска.
Как Wildberries находит дубликаты товаров: подробный анализ
Изображение носит иллюстративный характер

Затем, на этапе классификации, отбираются точные дубликаты с помощью двух моделей: Bi-encoder и Cross-encoder. Bi-encoder, обученный для каждой категории товаров, опирается на эмбеддинги, а Cross-encoder использует текстовые описания, исключая шумные данные. Использование двухэтапной модели позволяет достичь баланса между точностью и скоростью работы.

Для уточнения результатов применяется графовый анализ. Используя алгоритмы выделения сообществ, система объединяет товары в полносвязные группы и отсекает слабые связи, тем самым повышая точность и качество результатов.

Финальный результат: более трети из 130 миллионов товаров идентифицированы как дубликаты. Обновление алгоритмов, замена моделей, применение mmap + Faiss, а также добавление этапа Cross-encoder значительно повлияли на метрики, в частности, на точность и выручку.


Новое на сайте

20099Нейронаука одиночества: есть ли в мозге клетки, которые страдают? 20098Почему глаза так долго привыкают к темноте — и что за этим стоит? 20097Мыть или не мыть рис: что реально происходит в кастрюле 20095Мне не предоставили текст для написания статьи. 20094Мыть или не мыть рис: что реально происходит в кастрюле 20092Почему глаза так долго привыкают к темноте — и что за этим стоит? 20087Игла сквозь череп: медицинский случай с рыбой-иглой и задачей, которую хирурги решали... 20085Живая квантовая сеть в Нью-Йорке: как Qunnect пытается построить интернет, который нельзя... 20084Живые обои: дрожжи, алгинат и 3D-принтер вместо поклейки 20083ИИ-агент уничтожил базу данных за 9 секунд и сам же признался в этом 20082CVE-2026-5027: почему уязвимость в Langflow уже активно эксплуатируется хакерами? 20081GreatXML: новый обход BitLocker через Recovery Partition 20080Июньский Patch Tuesday 2026: 206 уязвимостей, три zero-day и неуправляемый ИИ в поиске дыр
Ссылка