Изучение количества уровней
В пакете dplyr есть ещё две полезные функции для изучения набора данных. Первая — slice_max(var, n = x) — возвращает первые x строк набора данных по значению переменной var. Вторая — pull() — позволяет извлечь столбец, оставив только его значения без имени столбца.
Например, чтобы получить два наибольших значения mpg из классического набора данных mtcars в виде набора значений, нужно написать:
mtcars %>%
slice_max(mpg, n = 2) %>%
pull(mpg)
Результат будет следующим:
[1] 32.4 33.9
Это упражнение является частью курса
Категориальные данные в Tidyverse
Инструкции к упражнению
- Используйте
slice_max(), чтобы вывести 3 строки с наибольшим количеством уровней фактора. - Отфильтруйте данные по переменной
CurrentJobTitleSelectи с помощьюpullизвлеките количество её уровней.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Select the 3 rows with the highest number of levels
number_of_levels %>%
___(num_levels, n = 3)
number_of_levels %>%
# Filter for where the column called variable equals CurrentJobTitleSelect
filter(___) %>%
# Pull num_levels
___