Поиск дубликатов
После обновления конвейера данных, который поставляет информацию в ride_sharing, в таблицу был добавлен столбец ride_id — уникальный идентификатор каждой поездки.
Однако сразу после обновления среднее время поездок резко сократилось, а даты рождения пользователей стали указываться в будущем. Главное — количество поездок за одну ночь выросло на 20%, что наводит на мысль о наличии как полных, так и неполных дубликатов в DataFrame ride_sharing.
В этом упражнении вы проверите эту гипотезу, найдя повторяющиеся записи. В вашем окружении доступны образец ride_sharing и все пакеты, с которыми вы работали ранее.
Это упражнение является частью курса
Очистка данных в Python
Инструкции к упражнению
- Найдите дублирующиеся строки по столбцу
ride_idв DataFrameride_sharing, установив параметрkeepв значениеFalse. - Отфильтруйте
ride_sharingпоduplicates, отсортируйте результат поride_idи сохраните его в переменнуюduplicated_rides. - Выведите столбцы
ride_id,durationиuser_birth_yearизduplicated_ridesименно в этом порядке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])