Обрізання рядків
У попередній вправі ви змогли визначити правильний тип даних і перетворити user_birth_year на коректний тип, що дало змогу отримати підрахунки й трохи краще зрозуміти набір даних.
Ще одна поширена проблема «брудних» даних — наявність зайвих елементів, як-от відсотки чи крапки в числах, через що вони зчитуються як character. Щоб мати змогу обробляти ці числа, зайві елементи потрібно прибрати, а числа — перетворити з character на numeric. У цій вправі вам потрібно перетворити стовпець duration з character на numeric, але перед цим із кожного значення слід прибрати слово "minutes".
Пакети dplyr, assertive і stringr завантажено, а bike_share_rides доступний.
Ця вправа є частиною курсу
Очищення даних в R
Інструкції до вправи
- Використайте
str_remove(), щоб прибрати"minutes"зі стовпцяdurationуbike_share_rides. Додайте результат як новий стовпецьduration_trimmed. - Перетворіть стовпець
duration_trimmedна числовий тип і додайте його як новий стовпецьduration_mins. - Огляньте
bike_share_ridesі перевірте, що стовпецьduration_minsмає типnumeric. - Обчисліть середнє значення
duration_mins.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
bike_share_rides <- bike_share_rides %>%
# Remove 'minutes' from duration: duration_trimmed
mutate(duration_trimmed = ___,
# Convert duration_trimmed to numeric: duration_mins
duration_mins = ___)
# Glimpse at bike_share_rides
___
# Assert duration_mins is numeric
___
# Calculate mean duration
___