Zacznij terazZacznij za darmo

Analiza danych

Zbiór danych salesData jest wczytany do przestrzeni roboczej. Zawiera informacje o klientach z miesięcy pierwszego do trzeciego. Uwzględniona jest również sprzedaż z miesiąca czwartego. Poniższa tabela opisuje zmienne, których znaczenie może nie być oczywiste.

Zmienna Opis
id numer identyfikacyjny klienta
mostFreqStore sklep, w którym klient robił zakupy najczęściej
mostFreqCat kategoria produktów kupowanych najczęściej
nCats liczba różnych kategorii
preferredBrand marka kupowana najczęściej
nBrands liczba różnych marek

Biblioteki readr, dplyr, corrplot i ggplot2 zostały zainstalowane i wczytane.

To ćwiczenie jest częścią kursu

Uczenie maszynowe w analizie marketingowej w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj funkcji str(), aby uzyskać ogólny przegląd danych.
  • Zwizualizuj korelację między ciągłymi zmiennymi objaśniającymi z trzech poprzednich miesięcy a zmienną sprzedaży z bieżącego miesiąca. Zastosuj funkcje cor() i corrplot() połączone operatorem potoku. Odpowiednie zmienne zostały już dla ciebie wybrane.
  • Na koniec stwórz wykres pudełkowy przedstawiający rozkład zmiennej salesThisMon w zależności od poziomów zmiennej kategorycznej preferredBrand. To samo zostało już wykonane dla kategorycznej zmiennej mostFreqStore.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
Edytuj i uruchom kod