Analiza danych
Zbiór danych salesData jest wczytany do przestrzeni roboczej. Zawiera informacje o klientach z miesięcy pierwszego do trzeciego. Uwzględniona jest również sprzedaż z miesiąca czwartego. Poniższa tabela opisuje zmienne, których znaczenie może nie być oczywiste.
| Zmienna | Opis |
|---|---|
| id | numer identyfikacyjny klienta |
| mostFreqStore | sklep, w którym klient robił zakupy najczęściej |
| mostFreqCat | kategoria produktów kupowanych najczęściej |
| nCats | liczba różnych kategorii |
| preferredBrand | marka kupowana najczęściej |
| nBrands | liczba różnych marek |
Biblioteki readr, dplyr, corrplot i ggplot2 zostały zainstalowane i wczytane.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w analizie marketingowej w R
Instrukcje do ćwiczenia
- Użyj funkcji
str(), aby uzyskać ogólny przegląd danych. - Zwizualizuj korelację między ciągłymi zmiennymi objaśniającymi z trzech poprzednich miesięcy a zmienną sprzedaży z bieżącego miesiąca. Zastosuj funkcje
cor()icorrplot()połączone operatorem potoku. Odpowiednie zmienne zostały już dla ciebie wybrane. - Na koniec stwórz wykres pudełkowy przedstawiający rozkład zmiennej
salesThisMonw zależności od poziomów zmiennej kategorycznejpreferredBrand. To samo zostało już wykonane dla kategorycznej zmiennejmostFreqStore.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))