Zacznij terazZacznij za darmo

Pełne duplikaty

Otrzymano informację, że potok danych dotyczących współdzielenia rowerów został zaktualizowany w celu zwiększenia wydajności, ale w wyniku tej zmiany częściej mogą pojawiać się duplikaty. Aby móc nadal korzystać z tych samych skryptów do cotygodniowych analiz statystyk przejazdów, trzeba najpierw upewnić się, że wszystkie duplikaty w zbiorze danych zostaną usunięte.

Gdy wiele wierszy ramki danych ma takie same wartości we wszystkich kolumnach, mówimy o pełnych duplikatach. Usuwanie takich duplikatów jest ważne – te same wartości powtórzone wielokrotnie mogą zaburzać statystyki podsumowujące, takie jak średnia czy mediana. Każdy przejazd, łącznie z ride_id, powinien być unikalny.

Pakiet dplyr jest załadowany, a zbiór danych bike_share_rides jest dostępny.

To ćwiczenie jest częścią kursu

Czyszczenie danych w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz całkowitą liczbę pełnych duplikatów w zbiorze bike_share_rides.
  • Usuń wszystkie pełne duplikaty ze zbioru bike_share_rides i zapisz nową ramkę danych jako bike_share_rides_unique.
  • Oblicz całkowitą liczbę pełnych duplikatów w nowej ramce danych bike_share_rides_unique.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
Edytuj i uruchom kod