Последовательности в PyTorch
Текст, речь и многие сигналы приходят не одним вектором, а рядом шагов во времени. Модели для таких данных сначала переводят символ или слово в вектор слова - компактное числовое описание, по которому удобно считать дальше.
Дальше цепочку векторов обрабатывают
рекуррентные слои. LSTM умеет
удерживать контекст на длинных
отрезках, а более лёгкий GRU
решает похожие задачи с меньшим
числом внутренних величин.
У таких слоёв есть скрытое состояние: память о том, что уже было прочитано. Его форму важно понимать, если нужно задать начальные значения или связать несколько отрезков текста.
На практике редко прогоняют одну цепочку за раз. Обычно собирают пакет последовательностей одной длины и подают одним тензором, чтобы обучение шло быстрее.
Со всем этим мы и будем разбираться в рамках данного раздела.