Ssylka

Методика оценки качества чат-ботов: сравнение LLM и Intent-based решений

Эксперимент, сравнивший чат-бота на основе LLM (GPT-4o) и бота на интентах, показал, что LLM-решение выиграло по общему впечатлению и суммарной оценке критериев, таких как актуальность и проактивность. Однако, LLM-бот проигрывал в скорости ответа, стабильности работы и достоверности информации, иногда выдавая «галлюцинации».
Методика оценки качества чат-ботов: сравнение LLM и Intent-based решений
Изображение носит иллюстративный характер

Тестирование проводилось на базе действующего бота компании КНАУФ. Фокус-группа оценивала ботов по ряду критериев, включая понятность функционала, решение поставленной задачи, общее впечатление и соответствие утверждениям, опирающимся на принципы дизайна разговорных интерфейсов.

Анализ комментариев респондентов выявил, что бот на интентах лучше воспринимался как справочник для пользователей, знающих, что ищут, в то время как LLM-бот лучше справлялся с общими вопросами. При этом классическое решение получило высокую оценку за навигацию и лаконичность, а LLM-версия была многословной.

В ходе эксперимента подтвердилась гипотеза о целесообразности гибридного подхода, сочетающего прописанные скрипты и LLM для улучшения навигации и обработки нестандартных ситуаций. Red политики компании в целом оказались полезными при работе над личностью бота.


Новое на сайте

19014Как уязвимость CodeBreach в AWS CodeBuild могла привести к глобальной атаке через ошибку... 19013Затерянный фрагмент древней плиты пионер меняет карту сейсмических угроз Калифорнии 19012Генетические мутации вызывают слепоту менее чем в 30% случаев вопреки прежним прогнозам 19011Завершено строительство космического телескопа Nancy Grace Roman для поиска ста тысяч... 19010Вязкость пространства и фононы вакуума как разгадка аномалий расширения вселенной 19009Приведет ли массовое плодоношение дерева Риму к рекордному росту популяции какапо? 19008Как уязвимость CVE-2026-23550 в плагине Modular DS позволяет захватить управление сайтом? 19007Может ли уличная драка французского авантюриста раскрыть кризис американского гражданства... 19006Может ли один клик по легитимной ссылке заставить Microsoft Copilot и другие ИИ тайно... 19005Утрата истинного мастерства в эпоху алгоритмов и скрытые механизмы человеческого... 19004Почему защита самих моделей ИИ становится бессмысленной, если уязвимыми остаются рабочие... 19003Какие устаревшие привычки уничтожают эффективность MTTR вашего SOC в 2026 году? 19002Критическая ошибка в GlobalProtect позволяет удаленно отключить защиту межсетевых экранов... 19001Как дешевые серверы RedVDS стали инструментом глобального мошенничества на 40 миллионов... 19000Являются ли обнаруженные телескопом «Джеймс Уэбб» загадочные объекты «коконами» для...