Метод to_parquet
Метод to_parquet применяется к DataFrame
и сохраняет данные в файл формата Parquet. Это колоночный
формат хранения, который эффективно сжимает данные и поддерживает
сложные структуры. Первым обязательным параметром указывается путь
к файлу. Дополнительно можно задать метод сжатия,
способ индексации и другие настройки.
Синтаксис
df.to_parquet(path, engine='auto', compression='snappy', index=True)
Пример
Давайте сохраним таблицу в файл формата Parquet:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
df.to_parquet('data.parquet')
После выполнения кода в текущей директории появится файл data.parquet.
Пример
Укажем метод сжатия gzip для уменьшения размера файла:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
df.to_parquet('data_compressed.parquet', compression='gzip')
Файл будет сохранен со сжатием gzip.
Пример
Отключим сохранение индекса в файл:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
df.to_parquet('data_no_index.parquet', index=False)
При загрузке такого файла индекс будет сгенерирован заново.
Пример
Прочитаем сохраненный файл обратно в DataFrame:
import pandas as pd
df = pd.read_parquet('data.parquet')
print(df)
Результат выполнения кода:
a b
0 1 10
1 2 20
2 3 30
3 4 40
4 5 50