CommencerCommencez gratuitement

Explorer les données

Le jeu de données salesData est chargé dans l'environnement de travail. Il contient des informations sur les clients pour les mois un à trois. Seules les ventes du mois quatre sont incluses. Le tableau suivant décrit certaines variables dont le sens est moins évident.

Variable Description
id numéro d'identification du client
mostFreqStore magasin où la personne a le plus souvent acheté
mostFreqCat catégorie la plus souvent achetée par la personne
nCats nombre de catégories différentes
preferredBrand marque la plus souvent achetée par la personne
nBrands nombre de marques différentes

Les packages readr, dplyr, corrplot et ggplot2 ont été installés et chargés.

Cet exercice fait partie du cours

<cours>Machine Learning for Marketing Analytics in R</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez la commande de structure str() afin d'obtenir une vue d'ensemble des données.
  • Visualisez maintenant la corrélation des variables explicatives continues des trois derniers mois avec la variable de ventes de ce mois-ci. Utilisez les fonctions cor() et corrplot() ainsi que l'opérateur pipe. Notez que les bonnes variables ont déjà été sélectionnées pour vous.
  • En complément, réalisez un boxplot affichant la distribution de salesThisMon selon les modalités de la variable catégorielle preferredBrand. La même chose a déjà été faite pour la variable catégorielle dépendante mostFreqStore.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
Modifier et exécuter le code