Обзор итогового набора данных
К этому моменту вы объединили информацию из наборов данных rating и survey с исходным набором данных.
Мы добавили в набор данных org_final ряд дополнительных сведений о сотрудниках: compensation, no_leaves_taken (количество использованных дней отпуска), hiring_source и другие. Изучите этот набор данных, прежде чем перейти к конструированию признаков в следующей главе.
Это упражнение является частью курса
HR-аналитика: прогнозирование текучести кадров на R
Инструкции к упражнению
- Используйте
glimpse(), чтобы просмотреть структуру набора данныхorg_final. - Присвойте переменной
variablesколичество переменных в наборе данныхorg_final. - Постройте диаграмму «ящик с усами», чтобы визуализировать распределение
distance_from_homeдля активных (Active) и неактивных (Inactive) сотрудников.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# View the structure of the dataset
___
# Number of variables in the dataset
variables <- ___
# Compare the travel distance of Active and Inactive employees
ggplot(org_final, aes(x = ___, y = ___)) +
___