Текст в TensorFlow
Сети для текста получают не сами слова, а числа. Фразу из нескольких токенов превращают в ряд целых номеров по заранее собранному списку слов. Такой шаг называют векторизацией текста: он готовит данные к слоям модели.
В TensorFlow строки живут в отдельном типе тензора. Их можно приводить к одному регистру, измерять длину и убирать лишние пробелы по краям - это базовые операции со строками перед разбором фразы.
Помимо регистра и обрезки пробелов встречаются и другие приёмы обработки символов внутри тензора. Их удобно вызывать по одному, когда нужно быстро поправить вид каждой строки в партии.
Чтобы не задавать номера слов вручную, используют словарь строк: он запоминает встреченные слова и выдаёт для них целые индексы. Такой слой стыкуют с векторизацией и дальнейшими блоками сети.
Со всем этим мы и будем разбираться в рамках данного раздела.