Ořezávání řetězců
V předchozím cvičení sis dokázal/a určit správný datový typ a převést sloupec user_birth_year na správný typ – to ti umožnilo získat počty, které ti přinesly zajímavější pohled na dataset.
Dalším běžným problémem s nečistými daty je přítomnost nadbytečných znaků, jako jsou procenta nebo tečky v číslech, kvůli kterým jsou tato čísla načtena jako character. Aby bylo možné s těmito čísly pracovat, musíš nadbytečné znaky odstranit a čísla převést z typu character na numeric. V tomto cvičení budeš potřebovat převést sloupec duration z typu character na numeric, ale nejprve je nutné z každé hodnoty odstranit slovo "minutes".
Balíčky dplyr, assertive a stringr jsou načtené a dataset bike_share_rides je k dispozici.
Toto cvičení je součástí kurzu
Čištění dat v R
Pokyny k cvičení
- Pomocí funkce
str_remove()odstraň"minutes"ze sloupcedurationv datasetubike_share_rides. Výsledek ulož jako nový sloupec s názvemduration_trimmed. - Převeď sloupec
duration_trimmedna číselný typ a výsledek ulož jako nový sloupec s názvemduration_mins. - Prohlédni si strukturu datasetu
bike_share_ridespomocíglimpsea ověř, že sloupecduration_minsje typunumeric. - Vypočítej průměr sloupce
duration_mins.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
bike_share_rides <- bike_share_rides %>%
# Remove 'minutes' from duration: duration_trimmed
mutate(duration_trimmed = ___,
# Convert duration_trimmed to numeric: duration_mins
duration_mins = ___)
# Glimpse at bike_share_rides
___
# Assert duration_mins is numeric
___
# Calculate mean duration
___