Pełne duplikaty
Otrzymano informację, że potok danych dotyczących współdzielenia rowerów został zaktualizowany w celu zwiększenia wydajności, ale w wyniku tej zmiany częściej mogą pojawiać się duplikaty. Aby móc nadal korzystać z tych samych skryptów do cotygodniowych analiz statystyk przejazdów, trzeba najpierw upewnić się, że wszystkie duplikaty w zbiorze danych zostaną usunięte.
Gdy wiele wierszy ramki danych ma takie same wartości we wszystkich kolumnach, mówimy o pełnych duplikatach. Usuwanie takich duplikatów jest ważne – te same wartości powtórzone wielokrotnie mogą zaburzać statystyki podsumowujące, takie jak średnia czy mediana. Każdy przejazd, łącznie z ride_id, powinien być unikalny.
Pakiet dplyr jest załadowany, a zbiór danych bike_share_rides jest dostępny.
To ćwiczenie jest częścią kursu
Czyszczenie danych w R
Instrukcje do ćwiczenia
- Oblicz całkowitą liczbę pełnych duplikatów w zbiorze
bike_share_rides. - Usuń wszystkie pełne duplikaty ze zbioru
bike_share_ridesi zapisz nową ramkę danych jakobike_share_rides_unique. - Oblicz całkowitą liczbę pełnych duplikatów w nowej ramce danych
bike_share_rides_unique.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___