CommencezCommencez gratuitement

Explorer les données

L'ensemble de données salesData est chargé dans l'espace de travail. Il contient de l'information sur les clients pour les mois un à trois. Seules les ventes du mois quatre sont incluses. Le tableau suivant décrit certaines variables dont la signification est moins évidente.

Variable Description
id numéro d'identification du client
mostFreqStore magasin où la personne a surtout acheté
mostFreqCat catégorie dans laquelle la personne a surtout acheté
nCats nombre de catégories différentes
preferredBrand marque que la personne a le plus achetée
nBrands nombre de marques différentes

Les packages readr, dplyr, corrplot et ggplot2 ont été installés et chargés.

Cette activité fait partie du cours

Machine Learning for Marketing Analytics in R

Voir le cours

Instructions de l’exercice

  • Utilisez la commande de structure str() pour obtenir un aperçu des données.
  • Visualisez maintenant la corrélation des variables explicatives continues des trois derniers mois avec la variable de ventes de ce mois-ci. Utilisez les fonctions cor() et corrplot() ainsi que l'opérateur pipe. Notez que les bonnes variables ont déjà été sélectionnées pour vous.
  • En plus, faites un diagramme en boîtes (boxplot) montrant la distribution de salesThisMon selon les modalités de la variable catégorielle preferredBrand. La même chose a déjà été faite pour la variable catégorielle dépendante mostFreqStore.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
Modifier et exécuter le code