Utforska data
Datamängden salesData är inläst i arbetsytan. Den innehåller information om kunder för månaderna ett till tre. Enbart försäljningen för månad fyra ingår. Tabellen nedan beskriver några av variablerna vars innebörd inte är helt självklar.
| Variabel | Beskrivning |
|---|---|
| id | kundens identifikationsnummer |
| mostFreqStore | butiken kunden handlade mest i |
| mostFreqCat | kategorin kunden köpte mest inom |
| nCats | antal olika kategorier |
| preferredBrand | varumärket kunden köpte mest |
| nBrands | antal olika varumärken |
Paketen readr, dplyr, corrplot och ggplot2 har installerats och laddats.
Den här övningen är en del av kursen
Maskininlärning för marknadsanalys i R
Övningsinstruktioner
- Använd strukturkommandot
str()för att få en översikt över data. - Visualisera nu korrelationen mellan de kontinuerliga förklaringsvariablerna för de senaste tre månaderna och försäljningsvariabeln för den här månaden. Använd funktionerna
cor()ochcorrplot()samt pipe-operatorn. Observera att rätt variabler redan har valts ut åt dig. - Skapa dessutom ett lådagram som visar fördelningen av
salesThisMonberoende på nivåerna hos den kategoriska variabelnpreferredBrand. Samma sak har redan gjorts för den kategoriska beroende variabelnmostFreqStore.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))