Explorer les données
L'ensemble de données salesData est chargé dans l'espace de travail. Il contient de l'information sur les clients pour les mois un à trois. Seules les ventes du mois quatre sont incluses. Le tableau suivant décrit certaines variables dont la signification est moins évidente.
| Variable | Description |
|---|---|
| id | numéro d'identification du client |
| mostFreqStore | magasin où la personne a surtout acheté |
| mostFreqCat | catégorie dans laquelle la personne a surtout acheté |
| nCats | nombre de catégories différentes |
| preferredBrand | marque que la personne a le plus achetée |
| nBrands | nombre de marques différentes |
Les packages readr, dplyr, corrplot et ggplot2 ont été installés et chargés.
Cette activité fait partie du cours
Machine Learning for Marketing Analytics in R
Instructions de l’exercice
- Utilisez la commande de structure
str()pour obtenir un aperçu des données. - Visualisez maintenant la corrélation des variables explicatives continues des trois derniers mois avec la variable de ventes de ce mois-ci. Utilisez les fonctions
cor()etcorrplot()ainsi que l'opérateur pipe. Notez que les bonnes variables ont déjà été sélectionnées pour vous. - En plus, faites un diagramme en boîtes (boxplot) montrant la distribution de
salesThisMonselon les modalités de la variable catégoriellepreferredBrand. La même chose a déjà été faite pour la variable catégorielle dépendantemostFreqStore.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))