Обрезка строк
В предыдущем упражнении вы определили правильный тип данных и преобразовали user_birth_year к нужному типу, что позволило извлечь счётчики и получить дополнительное представление о наборе данных.
Ещё одна распространённая проблема «грязных» данных — лишние символы в числах, например знаки процента или точки. Из-за них числа считываются как значения типа character. Чтобы с ними можно было работать, лишние символы нужно удалить, а сами значения преобразовать из типа character в numeric. В этом упражнении вам предстоит преобразовать столбец duration из типа character в numeric, однако сначала нужно удалить слово "minutes" из каждого значения.
Библиотеки dplyr, assertive и stringr загружены, набор данных bike_share_rides доступен.
Это упражнение является частью курса
Очистка данных в R
Инструкции к упражнению
- С помощью
str_remove()удалите"minutes"из столбцаdurationнабора данныхbike_share_rides. Сохраните результат в новый столбецduration_trimmed. - Преобразуйте столбец
duration_trimmedк числовому типу и сохраните результат в новый столбецduration_mins. - Выведите краткую сводку
bike_share_ridesи убедитесь, что столбецduration_minsимеет типnumeric. - Вычислите среднее значение столбца
duration_mins.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
bike_share_rides <- bike_share_rides %>%
# Remove 'minutes' from duration: duration_trimmed
mutate(duration_trimmed = ___,
# Convert duration_trimmed to numeric: duration_mins
duration_mins = ___)
# Glimpse at bike_share_rides
___
# Assert duration_mins is numeric
___
# Calculate mean duration
___