Ознайомлення з даними
Набір даних salesData завантажено в робоче середовище. Він містить інформацію про клієнтів за перші три місяці. Лише продажі четвертого місяця включено окремою змінною. У таблиці нижче наведено опис деяких змінних, значення яких менш очевидні.
| Змінна | Опис |
|---|---|
| id | ідентифікаційний номер клієнта |
| mostFreqStore | магазин, у якому людина купувала найчастіше |
| mostFreqCat | категорія, яку людина купувала найчастіше |
| nCats | кількість різних категорій |
| preferredBrand | бренд, який людина купувала найчастіше |
| nBrands | кількість різних брендів |
Пакети readr, dplyr, corrplot і ggplot2 встановлено та підключено.
Ця вправа є частиною курсу
Machine Learning для маркетингової аналітики в R
Інструкції до вправи
- Скористайтеся командою для перегляду структури
str(), щоб отримати загальне уявлення про дані. - Тепер візуалізуйте кореляцію безперервних пояснювальних змінних за попередні три місяці зі змінною продажів цього місяця. Використайте функції
cor()іcorrplot()та оператор конвеєра. Зверніть увагу, що потрібні змінні вже вибрано за вас. - Додатково побудуйте діаграму розмаху (boxplot), що показує розподіл
salesThisMonзалежно від рівнів категоріальної змінноїpreferredBrand. Те саме вже зроблено для категоріальної залежної змінноїmostFreqStore.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))