Внимание в моделях в PyTorch
Трансформеры сравнивают элементы последовательности между собой и выбирают, на что сильнее опираться при следующем шаге. Такой приём называют вниманием: каждый вектор получает смесь соседей с разными весами.
Чтобы увидеть разные типы связей параллельно, веса считают не одним блоком, а несколькими головами. Каждая голова смотрит на те же векторы, но своим набором проекций, а результаты снова собирают в одну ленту чисел.
Полный блок энкодера добавляет к вниманию нормализацию и небольшую сеть по каждому вектору. Такой слой повторяют, наращивая глубину модели.
Сами вектора слов не несут явного номера места в ряду. Позиционные числа прибавляют к эмбеддингам сигнал о порядке, чтобы модель различала начало и конец фразы.
Со всем этим мы и будем разбираться в рамках данного раздела.