НачатьНачать бесплатно

Обобщение данных

Теперь создадим фасетный график для сравнения полезности разных учебных платформ.

В этом упражнении мы познакомимся с новой функцией из пакета dplyradd_count(). Функция add_count() добавляет в набор данных столбец n, сохраняя то же количество строк, что и в исходном наборе. Как и count(), по умолчанию n равно количеству строк в каждой группе, однако это поведение можно изменить с помощью аргумента wt (вес). Если задать wt равным другому столбцу, то n будет равно сумме значений этого столбца для каждой группы.

Предположим, вы хотите добавить в iris столбец с суммой Petal.Length для всех цветов одного вида Species. Это делается так:

iris %>%
   add_count(Species, wt = Petal.Length) %>%
   select(Species, Petal.Length, n)

Результат будет выглядеть следующим образом:

# A tibble: 150 x 3
   Species Petal.Length     n
   <fct>          <dbl> <dbl>
 1 setosa           1.4  73.1
 2 setosa           1.4  73.1
 3 virginica        6.4  278.

Это упражнение является частью курса

Категориальные данные в Tidyverse

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

learning_platform_usefulness %>%
  # Change dataset to one row per learning_platform usefulness pair with number of entries for each
  ___(___, ___)
Редактировать и запускать код