Функция datasets.reuters.load_data
Функция datasets.reuters.load_data загружает датасет Reuters - набор новостных текстов, размеченных по 46 темам. Первым параметром передаётся путь к файлу с данными. Вторым параметром можно указать количество слов для ограничения словаря. Третьим параметром задаётся смещение индекса словаря. Также можно передать путь к файлу с индексами слов и тестовую долю выборки.
Синтаксис
tf.keras.datasets.reuters.load_data(
path='reuters.npz',
num_words=None,
skip_top=0,
maxlen=None,
test_split=0.2,
seed=113,
start_char=1,
oov_char=2,
index_from=3
)
Пример
Давайте загрузим датасет Reuters и выведем количество обучающих и тестовых примеров:
import tensorflow as tf
(x_train, y_train), (x_test, y_test) = tf.keras.datasets.reuters.load_data()
print(len(x_train))
print(len(x_test))
Результат выполнения кода:
8982
2246
Пример
Давайте выведем первый обучающий пример и его метку:
import tensorflow as tf
(x_train, y_train), (x_test, y_test) = tf.keras.datasets.reuters.load_data()
print(x_train[0])
print(y_train[0])
Результат выполнения кода:
[1, 27595, 28842, 8, 43, 10, 447, 5, 25, 207, 270, 5, 3095, 111, 16, 369, 186, 90, 67, 7, 89, 5, 19, 102, 6, 19, 124, 15, 90, 67, 84, 22, 482, 26, 7, 48, 4, 49, 8, 864, 39, 209, 154, 6, 151, 6, 83, 11, 15, 22, 155, 11, 15, 7, 48, 9, 4579, 1005, 504, 6, 258, 6, 272, 11, 15, 22, 134, 44, 11, 15, 16, 8, 197, 1245, 90, 67, 52, 29, 6, 1]
3
Пример
Давайте ограничим словарь первыми 10000 словами и выведем размер словаря:
import tensorflow as tf
(x_train, y_train), (x_test, y_test) = tf.keras.datasets.reuters.load_data(num_words=10000)
print(len(x_train[0]))
Результат выполнения кода:
87
Смотрите также
-
функцию
imdb.load_data,
которая загружает датасет IMDB для анализа тональности -
функцию
mnist.load_data,
которая загружает датасет MNIST для распознавания цифр -
функцию
to_categorical,
которая преобразует метки в one-hot encoding -
функцию
TextLineDataset,
которая создаёт датасет из текстовых строк