Функция read_parquet
Функция read_parquet используется для загрузки данных из файлов в формате Parquet. Parquet - это эффективный колоночный формат хранения, который хорошо подходит для больших объёмов данных. Функция может читать как отдельные файлы, так и целые каталоги с множеством файлов Parquet. Первым параметром передаётся путь к файлу или каталогу. Дополнительные параметры позволяют управлять процессом чтения: выбирать конкретные колонки, фильтровать строки при загрузке, указывать движок для чтения.
Синтаксис
pd.read_parquet(
path,
columns=None,
filters=None,
engine='auto',
storage_options=None
)
Пример
Чтение данных из файла Parquet в DataFrame:
a,b
1,10
2,20
3,30
4,40
5,50
import pandas as pd
df = pd.read_parquet('data.parquet')
print(df)
Результат выполнения кода:
a b
0 1 10
1 2 20
2 3 30
3 4 40
4 5 50
Пример
Чтение только определённых колонок с помощью параметра columns:
a,b,c
1,10,100
2,20,200
3,30,300
4,40,400
5,50,500
import pandas as pd
df = pd.read_parquet('data.parquet', columns=['a', 'c'])
print(df)
Результат выполнения кода:
a c
0 1 100
1 2 200
2 3 300
3 4 400
4 5 500
Пример
Фильтрация данных при загрузке с помощью параметра filters. Передаётся список условий в формате [('колонка', 'оператор', значение)]:
a,b
1,10
2,20
3,30
4,40
5,50
import pandas as pd
df = pd.read_parquet(
'data.parquet',
filters=[('a', '>', 2)]
)
print(df)
Результат выполнения кода:
a b
0 3 30
1 4 40
2 5 50
Пример
Чтение данных с указанием движка. Доступные движки: 'pyarrow', 'fastparquet' и 'auto' (выбирается автоматически):
a,b
1,10
2,20
3,30
import pandas as pd
df = pd.read_parquet(
'data.parquet',
engine='pyarrow'
)
print(df)
Результат выполнения кода:
a b
0 1 10
1 2 20
2 3 30
Смотрите также
-
функция
read_csv,
которая читает данные из CSV-файла -
функция
read_json,
которая читает данные из JSON-формата -
функция
read_feather,
которая читает данные из формата Feather -
функция
read_pickle,
которая читает данные из pickle-файла