НачатьНачать бесплатно

Изучение количества уровней

В пакете dplyr есть ещё две полезные функции для изучения набора данных. Первая — slice_max(var, n = x) — возвращает первые x строк набора данных по значению переменной var. Вторая — pull() — позволяет извлечь столбец, оставив только его значения без имени столбца.

Например, чтобы получить два наибольших значения mpg из классического набора данных mtcars в виде набора значений, нужно написать:

mtcars %>%
  slice_max(mpg, n = 2) %>%
  pull(mpg)

Результат будет следующим:

[1] 32.4 33.9

Это упражнение является частью курса

Категориальные данные в Tidyverse

Посмотреть курс

Инструкции к упражнению

  • Используйте slice_max(), чтобы вывести 3 строки с наибольшим количеством уровней фактора.
  • Отфильтруйте данные по переменной CurrentJobTitleSelect и с помощью pull извлеките количество её уровней.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Select the 3 rows with the highest number of levels
number_of_levels %>%
    ___(num_levels, n = 3)
    
number_of_levels %>%
	# Filter for where the column called variable equals CurrentJobTitleSelect
    filter(___) %>%
	# Pull num_levels
    ___
Редактировать и запускать код