Метод to_orc
Метод to_orc применяется к DataFrame
и сохраняет данные в файл формата ORC.
Основной параметр - путь к файлу.
Формат ORC обеспечивает высокую степень сжатия и
оптимизирован для чтения больших объёмов данных.
Дополнительно можно управлять параметрами сжатия и
индексацией.
Синтаксис
df.to_orc(path, engine='pyarrow', index=True, compression='default', ...)
Пример
Сохраним таблицу в файл ORC:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
df.to_orc('data.orc')
print("Data saved to data.orc")
Результат выполнения кода:
"Data saved to data.orc"
Пример
Сохраним таблицу без индекса. Для этого
установим параметр index в значение False:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
df.to_orc('data_no_index.orc', index=False)
print("Data saved without index")
Результат выполнения кода:
"Data saved without index"
Пример
Изменим движок для сохранения и укажем
параметр сжатия. Доступные движки: pyarrow
и fastparquet. В примере используем
движок pyarrow с уровнем сжатия snappy:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
df.to_orc('data_compressed.orc', engine='pyarrow', compression='snappy')
print("Data saved with snappy compression")
Результат выполнения кода:
"Data saved with snappy compression"
Смотрите также
-
метод
to_parquet,
который сохраняет таблицу в формате Parquet -
метод
to_csv,
который сохраняет таблицу в CSV-формат -
метод
read_orc,
который читает данные из файла ORC -
метод
to_json,
который сохраняет таблицу в JSON-формат