Agregowanie częściowych duplikatów
Innym sposobem radzenia sobie z częściowymi duplikatami jest obliczenie statystyki podsumowującej dla wartości, które się między nimi różnią – na przykład średniej, mediany, maksimum lub minimum. Przydaje się to, gdy nie masz pewności, jak zostały zebrane dane i zależy ci na wartości uśrednionej, albo gdy – na podstawie wiedzy dziedzinowej – wolisz zawyżone szacunki niż zaniżone (lub odwrotnie).
Biblioteka dplyr jest załadowana, a zbiór danych bike_share_rides jest dostępny.
To ćwiczenie jest częścią kursu
Czyszczenie danych w R
Instrukcje do ćwiczenia
- Zgrupuj zbiór danych
bike_share_rideswedług kolumnride_ididate. - Dodaj kolumnę o nazwie
duration_min_avg, która będzie zawierać średni czas przejazdu dla danegoride_ididate. - Usuń duplikaty na podstawie kolumn
ride_ididate, zachowując wszystkie kolumny ramki danych. - Usuń kolumnę
duration_min.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)