Explorarea datelor
Setul de date salesData este încărcat în spațiul de lucru. Conține informații despre clienți pentru lunile unu până la trei. Sunt incluse doar vânzările din luna a patra. Tabelul de mai jos descrie câteva variabile al căror sens nu este imediat evident.
| Variabilă | Descriere |
|---|---|
| id | numărul de identificare al clientului |
| mostFreqStore | magazinul din care clientul a cumpărat cel mai des |
| mostFreqCat | categoria din care clientul a achiziționat cel mai des |
| nCats | numărul de categorii diferite |
| preferredBrand | brandul achiziționat cel mai des de client |
| nBrands | numărul de branduri diferite |
Pachetele readr, dplyr, corrplot și ggplot2 au fost instalate și încărcate.
Acest exercițiu face parte din cursul
Machine Learning pentru Analiză de Marketing în R
Instrucțiuni pentru exercițiu
- Folosește comanda
str()pentru a obține o privire de ansamblu asupra datelor. - Vizualizează corelația dintre variabilele explicative continue din ultimele trei luni și variabila de vânzări din această lună. Folosește funcțiile
cor()șicorrplot()împreună cu operatorul pipe. Variabilele potrivite au fost deja selectate pentru tine. - În plus, creează un boxplot care să afișeze distribuția variabilei
salesThisMonîn funcție de nivelurile variabilei categorialepreferredBrand. Același lucru a fost deja realizat pentru variabila categorială dependentămostFreqStore.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))