Parquet в Pandas
Столбцовый бинарный Parquet сжимает данные и быстро отдаёт их при повторном чтении. Метод to_parquet записывает таблицу в файл, функция read_parquet возвращает таблицу из сохранённого файла.
Соберём таблицу с городами и температурой, запишем её в cities.parquet без индекса строк и выведем таблицу после чтения:
import pandas as pd
data = {
'city': ['Paris', 'Rome'],
'temp': [18, 22],
}
weather = pd.DataFrame(data)
weather.to_parquet(
'cities.parquet',
index=False,
)
loaded = pd.read_parquet('cities.parquet')
print(loaded) # выведет city temp
# 0 Paris 18
# 1 Rome 22
В выводе снова две строки
и те же значения в столбцах
city и temp.
Создайте таблицу с полями
team и goals для
Fox 3 и Owl 1.
Сохраните её в match.parquet,
загрузите файл и выведите
полную таблицу.
Из столбцов sku и stock
с A1 50 и B2 20
запишите данные в items.parquet
без индекса. Прочитайте файл
и выведите имя первого столбца.
Соберите таблицу class
Math, Art и hours
4, 2. Выгрузите её
в schedule.parquet, прочитайте
обратно и покажите сумму
столбца hours.