Метод get_vocabulary класса TextVectorization
Метод get_vocabulary класса TextVectorization
возвращает список токенов словаря, который был построен
слоем векторизации текста. Словарь формируется либо
при вызове метода adapt, либо при передаче
готового словаря через метод set_vocabulary.
Метод не принимает обязательных параметров и возвращает
список строк, упорядоченный по убыванию частоты
встречаемости токенов в обучающих данных.
Синтаксис
layer.get_vocabulary()
Пример
Давайте создадим слой TextVectorization,
обучим его на простом тексте и получим словарь
через метод get_vocabulary:
import tensorflow as tf
layer = tf.keras.layers.TextVectorization()
layer.adapt(['abcde abcde model.keras'])
res = layer.get_vocabulary()
print(res)
Результат выполнения кода:
['', '[UNK]', 'abcde', 'model.keras']
Как видно из результата, первым элементом словаря
идет пустая строка, затем специальный токен
[UNK] для неизвестных слов, а далее - токены,
упорядоченные по убыванию частоты.
Пример
Давайте зададим максимальный размер словаря и посмотрим,
как изменится результат метода get_vocabulary:
import tensorflow as tf
layer = tf.keras.layers.TextVectorization(max_tokens=3)
layer.adapt(['abcde abcde abcde model.keras'])
res = layer.get_vocabulary()
print(res)
Результат выполнения кода:
['', '[UNK]', 'abcde']
Параметр max_tokens ограничивает размер словаря,
поэтому в него попал только самый частый токен
abcde, а model.keras был отброшен.
Пример
Давайте установим собственный словарь через метод
set_vocabulary и затем прочитаем его
через get_vocabulary:
import tensorflow as tf
layer = tf.keras.layers.TextVectorization()
layer.set_vocabulary(['abcde', 'model.keras'])
res = layer.get_vocabulary()
print(res)
Результат выполнения кода:
['abcde', 'model.keras']
При установке словаря вручную служебные токены
'' и [UNK] не добавляются автоматически,
поэтому список содержит только переданные токены.
Смотрите также
-
класс
TextVectorization,
который векторизует текст в последовательности токенов -
метод
adapt,
который строит словарь на основе обучающих данных -
метод
set_vocabulary,
который устанавливает готовый словарь для слоя -
метод
get_vocabulary,
который возвращает текущий словарь слоя