Группировка и изменение формы схожих столбцов
На этом уроке мы увидели, как некоторые столбцы в наборе данных опроса Kaggle по науке о данных связаны между собой — например, столбцы, отражающие частоту различных рабочих трудностей. Как правило, такие переменные удобно рассматривать вместе, однако сначала нужно их найти и преобразовать в более удобный формат. Давайте отработаем этот процесс на вопросах о том, насколько полезными респонденты считали различные платформы для обучения.
Набор данных multiple_choice_responses уже загружен.
Это упражнение является частью курса
Категориальные данные в Tidyverse
Инструкции к упражнению
- Выберите только столбцы, в названии которых содержится
"LearningPlatformUsefulness". - Преобразуйте данные из широкого формата в длинный, создав два столбца:
learning_platformиusefulness. - Удалите строки, в которых
usefulnessимеет значение NA. - Удалите подстроку
"LearningPlatformUsefulness"из каждого значения в столбцеlearning_platform.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
learning_platform_usefulness <- multiple_choice_responses %>%
# Select columns with LearningPlatformUsefulness in title
___(___("LearningPlatformUsefulness")) %>%
# Change data from wide to long
___(everything(), names_to = "learning_platform", values_to = "usefulness") %>%
# Remove rows where usefulness is NA
___(___()) %>%
# Remove "LearningPlatformUsefulness" from each string in learning_platform
mutate(learning_platform = ___())