НачатьНачать бесплатно

Обрезка строк

В предыдущем упражнении вы определили правильный тип данных и преобразовали user_birth_year к нужному типу, что позволило извлечь счётчики и получить дополнительное представление о наборе данных.

Ещё одна распространённая проблема «грязных» данных — лишние символы в числах, например знаки процента или точки. Из-за них числа считываются как значения типа character. Чтобы с ними можно было работать, лишние символы нужно удалить, а сами значения преобразовать из типа character в numeric. В этом упражнении вам предстоит преобразовать столбец duration из типа character в numeric, однако сначала нужно удалить слово "minutes" из каждого значения.

Библиотеки dplyr, assertive и stringr загружены, набор данных bike_share_rides доступен.

Это упражнение является частью курса

Очистка данных в R

Посмотреть курс

Инструкции к упражнению

  • С помощью str_remove() удалите "minutes" из столбца duration набора данных bike_share_rides. Сохраните результат в новый столбец duration_trimmed.
  • Преобразуйте столбец duration_trimmed к числовому типу и сохраните результат в новый столбец duration_mins.
  • Выведите краткую сводку bike_share_rides и убедитесь, что столбец duration_mins имеет тип numeric.
  • Вычислите среднее значение столбца duration_mins.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

bike_share_rides <- bike_share_rides %>%
  # Remove 'minutes' from duration: duration_trimmed
  mutate(duration_trimmed = ___,
         # Convert duration_trimmed to numeric: duration_mins
         duration_mins = ___)

# Glimpse at bike_share_rides
___

# Assert duration_mins is numeric
___

# Calculate mean duration
___
Редактировать и запускать код