НачатьНачать бесплатно

Группировка и изменение формы схожих столбцов

На этом уроке мы увидели, как некоторые столбцы в наборе данных опроса Kaggle по науке о данных связаны между собой — например, столбцы, отражающие частоту различных рабочих трудностей. Как правило, такие переменные удобно рассматривать вместе, однако сначала нужно их найти и преобразовать в более удобный формат. Давайте отработаем этот процесс на вопросах о том, насколько полезными респонденты считали различные платформы для обучения.

Набор данных multiple_choice_responses уже загружен.

Это упражнение является частью курса

Категориальные данные в Tidyverse

Посмотреть курс

Инструкции к упражнению

  • Выберите только столбцы, в названии которых содержится "LearningPlatformUsefulness".
  • Преобразуйте данные из широкого формата в длинный, создав два столбца: learning_platform и usefulness.
  • Удалите строки, в которых usefulness имеет значение NA.
  • Удалите подстроку "LearningPlatformUsefulness" из каждого значения в столбце learning_platform.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

learning_platform_usefulness <- multiple_choice_responses %>%
  # Select columns with LearningPlatformUsefulness in title
  ___(___("LearningPlatformUsefulness")) %>%
  # Change data from wide to long
  ___(everything(), names_to = "learning_platform", values_to = "usefulness") %>%
  # Remove rows where usefulness is NA
  ___(___()) %>%
  # Remove "LearningPlatformUsefulness" from each string in learning_platform 
  mutate(learning_platform = ___())
Редактировать и запускать код