Przycinanie ciągów znaków
W poprzednim ćwiczeniu udało się zidentyfikować właściwy typ danych i przekonwertować kolumnę user_birth_year na poprawny typ, co pozwoliło wyciągnąć liczby dające nieco więcej informacji o zbiorze danych.
Innym częstym problemem z brudnymi danymi jest obecność dodatkowych elementów – takich jak znaki procentu czy kropki w liczbach – przez które są one wczytywane jako typ character. Aby móc wykonywać na nich obliczenia, trzeba usunąć te zbędne elementy i przekonwertować liczby z typu character na numeric. W tym ćwiczeniu przekonwertujesz kolumnę duration z typu character na numeric, ale najpierw konieczne jest usunięcie słowa "minutes" z każdej wartości.
Biblioteki dplyr, assertive i stringr są już załadowane, a zbiór bike_share_rides jest dostępny.
To ćwiczenie jest częścią kursu
Czyszczenie danych w R
Instrukcje do ćwiczenia
- Użyj funkcji
str_remove(), aby usunąć"minutes"z kolumnydurationw zbiorzebike_share_rides. Dodaj wynik jako nową kolumnę o nazwieduration_trimmed. - Przekonwertuj kolumnę
duration_trimmedna typnumerici dodaj wynik jako nową kolumnę o nazwieduration_mins. - Sprawdź strukturę
bike_share_ridesza pomocąglimpsei zweryfikuj, że kolumnaduration_minsjest typunumeric. - Oblicz średnią wartość kolumny
duration_mins.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
bike_share_rides <- bike_share_rides %>%
# Remove 'minutes' from duration: duration_trimmed
mutate(duration_trimmed = ___,
# Convert duration_trimmed to numeric: duration_mins
duration_mins = ___)
# Glimpse at bike_share_rides
___
# Assert duration_mins is numeric
___
# Calculate mean duration
___