РЕПЕТИТОР математика физика информатика
Для школьников и студентов. Подтягивание пробелов. ЦЭ, ЦТ, ОГЭ, ЕГЭ.
Идет набор на ЛЕТО. Жмите для подробностей:)
594 of 824 menu

Метод get_vocabulary класса TextVectorization

Метод get_vocabulary класса TextVectorization возвращает список токенов словаря, который был построен слоем векторизации текста. Словарь формируется либо при вызове метода adapt, либо при передаче готового словаря через метод set_vocabulary. Метод не принимает обязательных параметров и возвращает список строк, упорядоченный по убыванию частоты встречаемости токенов в обучающих данных.

Синтаксис

layer.get_vocabulary()

Пример

Давайте создадим слой TextVectorization, обучим его на простом тексте и получим словарь через метод get_vocabulary:

import tensorflow as tf layer = tf.keras.layers.TextVectorization() layer.adapt(['abcde abcde model.keras']) res = layer.get_vocabulary() print(res)

Результат выполнения кода:

['', '[UNK]', 'abcde', 'model.keras']

Как видно из результата, первым элементом словаря идет пустая строка, затем специальный токен [UNK] для неизвестных слов, а далее - токены, упорядоченные по убыванию частоты.

Пример

Давайте зададим максимальный размер словаря и посмотрим, как изменится результат метода get_vocabulary:

import tensorflow as tf layer = tf.keras.layers.TextVectorization(max_tokens=3) layer.adapt(['abcde abcde abcde model.keras']) res = layer.get_vocabulary() print(res)

Результат выполнения кода:

['', '[UNK]', 'abcde']

Параметр max_tokens ограничивает размер словаря, поэтому в него попал только самый частый токен abcde, а model.keras был отброшен.

Пример

Давайте установим собственный словарь через метод set_vocabulary и затем прочитаем его через get_vocabulary:

import tensorflow as tf layer = tf.keras.layers.TextVectorization() layer.set_vocabulary(['abcde', 'model.keras']) res = layer.get_vocabulary() print(res)

Результат выполнения кода:

['abcde', 'model.keras']

При установке словаря вручную служебные токены '' и [UNK] не добавляются автоматически, поэтому список содержит только переданные токены.

Смотрите также

  • класс TextVectorization,
    который векторизует текст в последовательности токенов
  • метод adapt,
    который строит словарь на основе обучающих данных
  • метод set_vocabulary,
    который устанавливает готовый словарь для слоя
  • метод get_vocabulary,
    который возвращает текущий словарь слоя
Мы используем cookie для работы сайта, аналитики и персонализации. Обработка данных происходит согласно Политике конфиденциальности.
принять все настроить отклонить