НачатьНачать бесплатно

Поиск дубликатов

После обновления конвейера данных, который поставляет информацию в ride_sharing, в таблицу был добавлен столбец ride_id — уникальный идентификатор каждой поездки.

Однако сразу после обновления среднее время поездок резко сократилось, а даты рождения пользователей стали указываться в будущем. Главное — количество поездок за одну ночь выросло на 20%, что наводит на мысль о наличии как полных, так и неполных дубликатов в DataFrame ride_sharing.

В этом упражнении вы проверите эту гипотезу, найдя повторяющиеся записи. В вашем окружении доступны образец ride_sharing и все пакеты, с которыми вы работали ранее.

Это упражнение является частью курса

Очистка данных в Python

Посмотреть курс

Инструкции к упражнению

  • Найдите дублирующиеся строки по столбцу ride_id в DataFrame ride_sharing, установив параметр keep в значение False.
  • Отфильтруйте ride_sharing по duplicates, отсортируйте результат по ride_id и сохраните его в переменную duplicated_rides.
  • Выведите столбцы ride_id, duration и user_birth_year из duplicated_rides именно в этом порядке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Find duplicates
duplicates = ____.____(____, ____)

# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')

# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])
Редактировать и запускать код