Kom igångKom igång gratis

Utforska data

Datamängden salesData är inläst i arbetsytan. Den innehåller information om kunder för månaderna ett till tre. Enbart försäljningen för månad fyra ingår. Tabellen nedan beskriver några av variablerna vars innebörd inte är helt självklar.

Variabel Beskrivning
id kundens identifikationsnummer
mostFreqStore butiken kunden handlade mest i
mostFreqCat kategorin kunden köpte mest inom
nCats antal olika kategorier
preferredBrand varumärket kunden köpte mest
nBrands antal olika varumärken

Paketen readr, dplyr, corrplot och ggplot2 har installerats och laddats.

Den här övningen är en del av kursen

Maskininlärning för marknadsanalys i R

Visa kurs

Övningsinstruktioner

  • Använd strukturkommandot str() för att få en översikt över data.
  • Visualisera nu korrelationen mellan de kontinuerliga förklaringsvariablerna för de senaste tre månaderna och försäljningsvariabeln för den här månaden. Använd funktionerna cor() och corrplot() samt pipe-operatorn. Observera att rätt variabler redan har valts ut åt dig.
  • Skapa dessutom ett lådagram som visar fördelningen av salesThisMon beroende på nivåerna hos den kategoriska variabeln preferredBrand. Samma sak har redan gjorts för den kategoriska beroende variabeln mostFreqStore.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
Redigera och kör kod