Знакомство с данными
В рабочей области загружен набор данных salesData. Он содержит информацию о клиентах за первые три месяца. Из четвёртого месяца включены только данные о продажах. В таблице ниже приведено описание некоторых переменных, значение которых может быть не сразу очевидным.
| Переменная | Описание |
|---|---|
| id | идентификационный номер клиента |
| mostFreqStore | магазин, в котором клиент совершал покупки чаще всего |
| mostFreqCat | категория товаров, которую клиент покупал чаще всего |
| nCats | количество различных категорий товаров |
| preferredBrand | бренд, который клиент покупал чаще всего |
| nBrands | количество различных брендов |
Пакеты readr, dplyr, corrplot и ggplot2 уже установлены и загружены.
Это упражнение является частью курса
Машинное обучение для маркетинговой аналитики на R
Инструкции к упражнению
- Используйте команду
str(), чтобы получить общее представление о структуре данных. - Теперь визуализируйте корреляцию между непрерывными объясняющими переменными за прошедшие три месяца и переменной продаж текущего месяца. Используйте функции
cor()иcorrplot()вместе с оператором пайпа. Обратите внимание: нужные переменные уже выбраны за вас. - Дополнительно постройте ящик с усами (boxplot), отображающий распределение
salesThisMonпо уровням категориальной переменнойpreferredBrand. Аналогичный график для категориальной переменнойmostFreqStoreуже построен.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))