Метод duplicated
Метод duplicated применяется к объекту Index
и возвращает булев массив, где True указывает
на элементы, которые являются дубликатами.
Первым параметром можно передать стратегию
определения дубликатов: 'first' (по умолчанию),
'last' или False.
Синтаксис
index.duplicated([keep='first'])
Пример
Создадим индекс с дублирующимися значениями
и найдём дубликаты со стратегией 'first':
import pandas as pd
idx = pd.Index([1, 2, 2, 3, 3, 4])
res = idx.duplicated(keep='first')
print(res)
Результат выполнения кода:
[False False True False True False]
Пример
Используем стратегию 'last' для поиска дубликатов.
В этом случае последние вхождения будут считаться
уникальными:
import pandas as pd
idx = pd.Index([1, 2, 2, 3, 3, 4])
res = idx.duplicated(keep='last')
print(res)
Результат выполнения кода:
[False True False True False False]
Пример
Стратегия False помечает все дублирующиеся
элементы, включая первое вхождение:
import pandas as pd
idx = pd.Index([1, 2, 2, 3, 3, 4])
res = idx.duplicated(keep=False)
print(res)
Результат выполнения кода:
[False True True True True False]
Пример
Применим метод к индексу со строковыми значениями:
import pandas as pd
idx = pd.Index(['a', 'b', 'b', 'c', 'c', 'd'])
res = idx.duplicated(keep='first')
print(res)
Результат выполнения кода:
[False False True False True False]
Смотрите также
-
метод
drop_duplicates,
который удаляет дубликаты из индекса -
атрибут
is_unique,
который проверяет индекс на уникальность -
метод
unique,
который возвращает уникальные значения индекса -
метод
value_counts,
который подсчитывает количество каждого значения