Метод duplicated
Метод duplicated применяется к DataFrame
и возвращает Series с булевыми значениями, где
True указывает на дублирующиеся строки.
Первым параметром можно задать подмножество столбцов
для проверки. Вторым параметром указать, какое
вхождение считать дубликатом: first (первое),
last (последнее) или False (все).
Синтаксис
df.duplicated(subset=None, keep='first')
Пример
Давайте найдём дубликаты в таблице с повторяющимися строками:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 2, 3, 3],
'b': [10, 20, 20, 30, 30]
})
print(df.duplicated())
Результат выполнения кода:
0 False
1 False
2 True
3 False
4 True
dtype: bool
Пример
Проверим дубликаты только по столбцу a:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 2, 3, 3],
'b': [10, 20, 25, 30, 35]
})
print(df.duplicated(subset=['a']))
Результат выполнения кода:
0 False
1 False
2 True
3 False
4 True
dtype: bool
Пример
Пометим дубликаты как последние вхождения:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 2, 3, 3],
'b': [10, 20, 20, 30, 30]
})
print(df.duplicated(keep='last'))
Результат выполнения кода:
0 False
1 True
2 False
3 True
4 False
dtype: bool
Пример
Пометим все дубликаты без исключений:
import pandas as pd
df = pd.DataFrame({
'a': [1, 2, 2, 3, 3],
'b': [10, 20, 20, 30, 30]
})
print(df.duplicated(keep=False))
Результат выполнения кода:
0 False
1 True
2 True
3 True
4 True
dtype: bool
Смотрите также
-
метод
drop_duplicates,
который удаляет дублирующиеся строки -
метод
isin,
который проверяет вхождение значений -
метод
query,
который фильтрует строки по условию -
метод
value_counts,
который считает частоту уникальных значений