Картинка в TensorFlow
Нейросеть для картинок получает не одну таблицу чисел, а пакет картинок: несколько изображений сразу, у каждого есть высота, ширина и несколько каналов цвета. Такой пакет удобно описывать формой из четырёх чисел.
Чтобы находить контуры и детали, поверх карты пикселей применяют свёртку: маленькое окно скользит по изображению и собирает новые карты признаков. После неё часто сжимают карту через макс-пул - в каждом окне оставляют одно наибольшее значение.
Глубокие модели сглаживают разброс значений внутри пакета с помощью нормализации батча. Когда карта ещё двумерная, но дальше нужен обычный ряд чисел, её сводят глобальным пулом - усредняют или берут крайнее значение по всей площади каждого канала.
Разные задачи требуют одного размера на входе: для этого есть слой смены размера. Готовые файлы на диске удобно подключать из папки картинок, где подкаталоги задают классы.
Кроме обычной свёртки по плоскости есть варианты для рядов и для объёмных данных; для сжатия карты подойдёт не только максимум, но и среднее. Перед обучением картинки иногда случайно отражают или поворачивают, а внутри блоков встречаются новые функции активации.
Со всем этим мы и будем разбираться в рамках данного раздела.