РЕПЕТИТОР математика физика информатика
Для школьников и студентов. Подтягивание пробелов. ЦЭ, ЦТ, ОГЭ, ЕГЭ.
Идет набор на ЛЕТО. Жмите для подробностей:)
35 of 687 menu

Метод duplicated

Метод duplicated применяется к DataFrame и возвращает Series с булевыми значениями, где True указывает на дублирующиеся строки. Первым параметром можно задать подмножество столбцов для проверки. Вторым параметром указать, какое вхождение считать дубликатом: first (первое), last (последнее) или False (все).

Синтаксис

df.duplicated(subset=None, keep='first')

Пример

Давайте найдём дубликаты в таблице с повторяющимися строками:

import pandas as pd df = pd.DataFrame({ 'a': [1, 2, 2, 3, 3], 'b': [10, 20, 20, 30, 30] }) print(df.duplicated())

Результат выполнения кода:

0 False 1 False 2 True 3 False 4 True dtype: bool

Пример

Проверим дубликаты только по столбцу a:

import pandas as pd df = pd.DataFrame({ 'a': [1, 2, 2, 3, 3], 'b': [10, 20, 25, 30, 35] }) print(df.duplicated(subset=['a']))

Результат выполнения кода:

0 False 1 False 2 True 3 False 4 True dtype: bool

Пример

Пометим дубликаты как последние вхождения:

import pandas as pd df = pd.DataFrame({ 'a': [1, 2, 2, 3, 3], 'b': [10, 20, 20, 30, 30] }) print(df.duplicated(keep='last'))

Результат выполнения кода:

0 False 1 True 2 False 3 True 4 False dtype: bool

Пример

Пометим все дубликаты без исключений:

import pandas as pd df = pd.DataFrame({ 'a': [1, 2, 2, 3, 3], 'b': [10, 20, 20, 30, 30] }) print(df.duplicated(keep=False))

Результат выполнения кода:

0 False 1 True 2 True 3 True 4 True dtype: bool

Смотрите также

  • метод drop_duplicates,
    который удаляет дублирующиеся строки
  • метод isin,
    который проверяет вхождение значений
  • метод query,
    который фильтрует строки по условию
  • метод value_counts,
    который считает частоту уникальных значений
Мы используем cookie для работы сайта, аналитики и персонализации. Обработка данных происходит согласно Политике конфиденциальности.
принять все настроить отклонить