Метод describe
Метод describe применяется к DataFrame
и возвращает описательную статистику для каждого числового столбца.
По умолчанию вычисляются количество значений, среднее, стандартное отклонение,
минимум, квартили и максимум. Если передать параметр include,
можно включить в расчет и нечисловые столбцы.
Синтаксис
df.describe(percentiles=None, include=None, exclude=None)
Параметры
Основные параметры метода describe:
-
percentiles- список процентилей, которые нужно включить в результат. По умолчанию[.25, .5, .75]. -
include- список типов данных, которые нужно включить в статистику. Может принимать значения'all', список типов илиNone. -
exclude- список типов данных, которые нужно исключить из статистики.
Пример
Давайте получим описательную статистику для всех числовых столбцов таблицы:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50],
'c': ['x', 'y', 'z', 'x', 'y']
})
print(df.describe())
Результат выполнения кода:
a b
count 5.0 5.0
mean 3.0 30.0
std 1.6 15.8
min 1.0 10.0
25% 2.0 20.0
50% 3.0 30.0
75% 4.0 40.0
max 5.0 50.0
Пример
Укажем свои процентили с помощью параметра percentiles:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50]
})
print(df.describe(percentiles=[0.1, 0.9]))
Результат выполнения кода:
a b
count 5.0 5.0
mean 3.0 30.0
std 1.6 15.8
min 1.0 10.0
10% 1.4 14.0
50% 3.0 30.0
90% 4.6 46.0
max 5.0 50.0
Пример
Включим в статистику все столбцы, включая категориальные, с помощью параметра include='all':
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 3, 4, 5],
'b': [10, 20, 30, 40, 50],
'c': ['x', 'y', 'z', 'x', 'y']
})
print(df.describe(include='all'))
Результат выполнения кода:
a b c
count 5.0 5.0 5
unique NaN NaN 3
top NaN NaN x
freq NaN NaN 2
mean 3.0 30.0 NaN
std 1.6 15.8 NaN
min 1.0 10.0 NaN
25% 2.0 20.0 NaN
50% 3.0 30.0 NaN
75% 4.0 40.0 NaN
max 5.0 50.0 NaN