Transformer
Определение
Трансформер — архитектура нейронной сети с механизмом внимания (attention), ставшая основой современных языковых моделей и генеративного AI.
Простое объяснение
Это особая конструкция AI, которая умеет смотреть на весь текст сразу и понимать связи между словами, даже если они далеко друг от друга.
Подробнее
Ключевые элементы трансформера:
- Self-attention — связь между всеми токенами
- Multi-head attention — несколько потоков внимания
- Positional encoding — учёт позиции токенов
- Feed-forward — обработка каждого токена
Статья «Attention Is All You Need» (2017) — начало эры LLM.
Связанные термины
PEFT
Parameter-Efficient Fine-Tuning — семейство методов дообучения моделей, которые обновляют лишь малую часть параметров, сохраняя качество полного fine-tuning.
FlashAttention
FlashAttention — алгоритм вычисления attention, оптимизированный для GPU, который значительно снижает использование памяти и ускоряет обучение и inference.
Pre-training
Предобучение — начальный этап обучения AI-модели на огромных объёмах неразмеченных данных для формирования базовых знаний и способностей.
Latent Space
Latent Space — многомерное пространство скрытых представлений, где нейросеть кодирует семантику данных.
