Меню

Архитектура и ключевые компоненты LLM Llama 3

Кейтлайн

Llama 3 анализирует текст, преобразуя его в последовательность числовых идентификаторов токенов, используя токенизатор Tiktoken. Затем эти идентификаторы преобразуются в векторы в 4096-мерном пространстве с помощью механизма эмбеддинга, что позволяет модели обрабатывать текст как числовые данные.
Архитектура и ключевые компоненты LLM Llama 3

Архитектура и ключевые компоненты LLM Llama 3

Изображение носит иллюстративный характер

Трансформер, ядро Llama 3, состоит из 32 последовательных блоков TransformerBlock, каждый из которых играет ключевую роль в обработке информации.

Внутри TransformerBlock модуль self-attention вычисляет связи между токенами в тексте, определяя, на какие части текста следует обратить внимание при анализе каждого отдельного токена. Этот процесс включает преобразование исходных векторов в векторы запросов (Query), ключей (Key) и значений (Value), а также использование механизма кэширования (KV-cache) для оптимизации вычислений.

Завершает обработку блок FeedForward, который анализирует каждый токен независимо от других, уточняя его смысл и определяя общий контекст предложения. После прохождения через все блоки трансформера, линейный слой преобразует полученный вектор обратно в слово, выбирая наиболее вероятный токен на основе полученных оценок вероятности.

Источник: franticticktick

← Предыдущее в разделе Следующее в разделе →

Вверх

Новое на сайте

Уязвимые обучающие приложения открывают доступ к облакам Fortune 500 для криптомайнинга

Почему ботнет SSHStalker успешно атакует Linux уязвимостями десятилетней давности?

Microsoft устранила шесть уязвимостей нулевого дня и анонсировала радикальные изменения в...

Эскалация цифровой угрозы: как IT-специалисты КНДР используют реальные личности для...

Скрытые потребности клиентов и преимущество наблюдения над опросами

Академическое фиаско Дороти Паркер в Лос-Анджелесе

Китайский шпионский фреймворк DKnife захватывает роутеры с 2019 года

Каким образом корейские детские хоры 1950-х годов превратили геополитику в музыку и...

Научная революция цвета в женской моде викторианской эпохи

Как новый сканер Microsoft обнаруживает «спящих агентов» в открытых моделях ИИ?

Как новая кампания DEADVAX использует файлы VHD для скрытой доставки трояна AsyncRAT?

Как новые китайские киберкампании взламывают госструктуры Юго-Восточной Азии?

Культ священного манго и закат эпохи хунвейбинов в маоистском Китае

Готовы ли вы к эре коэффициента адаптивности, когда IQ и EQ больше не гарантируют успех?

Иранская группировка RedKitten применяет сгенерированный нейросетями код для кибершпионажа

Меню

МенюЗакрыть