Пошук дублікатів
Нове оновлення конвеєра даних, який постачає дані до ride_sharing, додало стовпець ride_id, що є унікальним ідентифікатором для кожної поїздки.
Однак після оновлення середня тривалість поїздок різко скоротилася, а дати народження користувачів подекуди опинилися в майбутньому. Найважливіше — кількість поїздок за ніч зросла на 20%, тож ви підозрюєте, що в датафреймі ride_sharing з’явилися як повні, так і неповні дублікати.
У цій вправі ви підтвердите цю підозру, знайшовши ці дублікати. Зразок ride_sharing уже є у вашому середовищі, як і всі пакети, з якими ви працювали раніше.
Ця вправа є частиною курсу
Очищення даних у Python
Інструкції до вправи
- Знайдіть дубліковані рядки
ride_idу датафрейміride_sharing, встановившиkeepу значенняFalse. - Відібрані за маскою
duplicatesрядки зride_sharingвідсортуйте заride_idі збережіть у зміннійduplicated_rides. - Виведіть стовпці
ride_id,durationіuser_birth_yearзduplicated_ridesсаме в такому порядку.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])