Usuwanie częściowych duplikatów
Po zidentyfikowaniu i usunięciu pełnych duplikatów czas sprawdzić, czy w danych nie ma częściowych duplikatów. Są one nieco trudniejsze w obsłudze niż pełne duplikaty. W tym ćwiczeniu najpierw je zidentyfikujesz, a następnie przećwiczysz najpopularniejszą metodę radzenia sobie z nimi – usunięcie wszystkich częściowych duplikatów z zachowaniem tylko pierwszego wystąpienia.
dplyr jest załadowany, a bike_share_rides jest dostępny.
To ćwiczenie jest częścią kursu
Czyszczenie danych w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Find duplicated ride_ids
bike_share_rides %>%
# Count the number of occurrences of each ride_id
___ %>%
# Filter for rows with a count > 1
___