ПочатиПочніть безкоштовно

Ознайомлення з даними

Набір даних salesData завантажено в робоче середовище. Він містить інформацію про клієнтів за перші три місяці. Лише продажі четвертого місяця включено окремою змінною. У таблиці нижче наведено опис деяких змінних, значення яких менш очевидні.

Змінна Опис
id ідентифікаційний номер клієнта
mostFreqStore магазин, у якому людина купувала найчастіше
mostFreqCat категорія, яку людина купувала найчастіше
nCats кількість різних категорій
preferredBrand бренд, який людина купувала найчастіше
nBrands кількість різних брендів

Пакети readr, dplyr, corrplot і ggplot2 встановлено та підключено.

Ця вправа є частиною курсу

Machine Learning для маркетингової аналітики в R

Переглянути курс

Інструкції до вправи

  • Скористайтеся командою для перегляду структури str(), щоб отримати загальне уявлення про дані.
  • Тепер візуалізуйте кореляцію безперервних пояснювальних змінних за попередні три місяці зі змінною продажів цього місяця. Використайте функції cor() і corrplot() та оператор конвеєра. Зверніть увагу, що потрібні змінні вже вибрано за вас.
  • Додатково побудуйте діаграму розмаху (boxplot), що показує розподіл salesThisMon залежно від рівнів категоріальної змінної preferredBrand. Те саме вже зроблено для категоріальної залежної змінної mostFreqStore.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
Редагувати та запускати код