Функция datasets.imdb.load_data
Функция datasets.imdb.load_data загружает
датасет IMDB - набор из 50 000 отзывов к фильмам,
разделённых на положительные и отрицательные.
Первым параметром передаётся путь к файлу с данными,
вторым - количество наиболее частотных слов для
ограничения словаря. Отзывы возвращаются в виде
последовательностей целых чисел, где каждое число
является индексом слова в словаре.
Синтаксис
tf.keras.datasets.imdb.load_data(path="imdb.npz", [num_words], [skip_top], [maxlen], [seed], [start_char], [oov_char], [index_from])
Пример
Давайте загрузим датасет IMDB и посмотрим количество отзывов в обучающей и тестовой выборках:
import tensorflow as tf
(x_train, y_train), (x_test, y_test) = tf.keras.datasets.imdb.load_data()
print(len(x_train), len(x_test))
Результат выполнения кода:
25000 25000
Пример
Давайте загрузим датасет с ограничением словаря до 10000 наиболее частотных слов и выведем первый отзыв:
Результат выполнения кода:
[1, 14, 22, 16, 43, 530, 973, 1622, 1385, 65, 458, 4468, 66, 3941, 4, 173, 36, 256, 5, 25, 100, 43, 838, 112, 50, 670, 2, 9]
Пример
Давайте выведем метку первого отзыва обучающей выборки:
import tensorflow as tf
(x_train, y_train), (x_test, y_test) = tf.keras.datasets.imdb.load_data(num_words=10000)
print(y_train[0])
Результат выполнения кода:
1
Пример
Давайте загрузим датасет и посмотрим словарь соответствия слов индексам:
import tensorflow as tf
word_index = tf.keras.datasets.imdb.get_word_index()
print(len(word_index))
Результат выполнения кода:
88584
Смотрите также
-
функцию
imdb,
которая предоставляет доступ к датасету IMDB -
функцию
reuters,
которая загружает датасет новостей Reuters -
функцию
mnist,
которая загружает датасет рукописных цифр MNIST -
функцию
fashion_mnist,
которая загружает датасет изображений одежды Fashion-MNIST