Ускорение инференса больших языковых моделей

Для ускорения генерации текста большими языковыми моделями (LLM) применяют различные алгоритмы, нацеленные на сокращение количества вычислений, необходимых для генерации каждого токена. Эти методы эксплуатируют неоднородность процесса генерации текста, когда некоторые токены предсказуемы, а другие требуют полных вычислений.
Ускорение инференса больших языковых моделей
Изображение носит иллюстративный характер

Спекулятивный декодинг использует «драфт» модель, меньшую и более быструю, для предсказания последовательности токенов. Затем эти «спекулятивные» токены проверяются основной моделью, и принимаются или отклоняются с определенной вероятностью. Lookahead декодинг идет дальше, используя хеш-таблицы для хранения и повторного использования принятых последовательностей токенов, дополнительно повышая стабильность и скорость.

Другие подходы, такие как early exit и skip decode, требуют переобучения модели и добавления дополнительных слоев или модификации процесса обучения, что является более сложным, но может привести к существенному ускорению. Методы, основанные на предсказании нескольких токенов за раз, такие как Medusa и Eagle, достигают высокой скорости за счет обучения дополнительных голов или «тушки» модели, предсказывающих несколько токенов, что позволяет эффективнее использовать ресурсы. Eagle использует идею спекулятивного декодирования, обучая небольшую тушку и комбинируя ее с весами основной модели.

Выбор конкретного метода зависит от доступных ресурсов, возможности дообучения модели и поддерживаемых фреймворков. Lookahead является хорошим вариантом, когда нет ресурсов на обучение. Спекулятивный декодинг прост в реализации при наличии draft модели. Методы Eagle/Medusa, хоть и сложнее, при наличии ресурсов могут обеспечить наибольшее ускорение.


Новое на сайте

20327Кости прерий: как истребление бизонов породило целую индустрию — и сама себя же уничтожила 20326Кто и зачем взламывает серверы Ollama и ComfyUI ради ключей от AWS? 20325Как злоумышленники спрятали командный сервер внутри блокчейна и почему его невозможно... 20324Брюссель заставляет Android делиться секретами с чужими ИИ-помощниками 20323WordPress: как два бага слились в одну критическую дыру, которую назвали wp2shell 20322Как китайские хакеры обманули DigiCert и украли сертификаты для подписи кода? 20321Что скрывается за уязвимостью, которую агентство США внесло в список активно используемых... 20320Автономные системы наступают быстрее, чем инфраструктура для управления ими: кто выиграет... 20319Почему в OpenSSL нашли дыру, съедающую память серверов, но не дали ей даже номер CVE? 20317SonicWall SMA 1000: как два бага превратили VPN-шлюз в бэкдор для атакующих 20316Может ли уязвимость в клиенте Zoom для Windows открыть доступ к чужому аккаунту без... 20315TELEPUZ: новый вредонос на C, который научился прятаться в Telegram, Steam и блокчейне... 20314Дома из дёрна: как исландцы триста лет прятались от холода под слоем земли и травы 20313Как один токен от чужого сервиса мог впустить злоумышленника в чужой аккаунт n8n?
Ссылка