Explorer les données
Le jeu de données salesData est chargé dans l'environnement de travail. Il contient des informations sur les clients pour les mois un à trois. Seules les ventes du mois quatre sont incluses. Le tableau suivant décrit certaines variables dont le sens est moins évident.
| Variable | Description |
|---|---|
| id | numéro d'identification du client |
| mostFreqStore | magasin où la personne a le plus souvent acheté |
| mostFreqCat | catégorie la plus souvent achetée par la personne |
| nCats | nombre de catégories différentes |
| preferredBrand | marque la plus souvent achetée par la personne |
| nBrands | nombre de marques différentes |
Les packages readr, dplyr, corrplot et ggplot2 ont été installés et chargés.
Cet exercice fait partie du cours
<cours>Machine Learning for Marketing Analytics in R</cours>Instructions de l’exercice
- Utilisez la commande de structure
str()afin d'obtenir une vue d'ensemble des données. - Visualisez maintenant la corrélation des variables explicatives continues des trois derniers mois avec la variable de ventes de ce mois-ci. Utilisez les fonctions
cor()etcorrplot()ainsi que l'opérateur pipe. Notez que les bonnes variables ont déjà été sélectionnées pour vous. - En complément, réalisez un boxplot affichant la distribution de
salesThisMonselon les modalités de la variable catégoriellepreferredBrand. La même chose a déjà été faite pour la variable catégorielle dépendantemostFreqStore.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))