Powrót do danych hurtowych: eksploracja
Z poprzedniej analizy wynika, że k = 2 daje najwyższą średnią szerokość sylwetki. W tym ćwiczeniu będziesz kontynuować analizę danych klientów hurtowych – zbudujesz i zbadasz model k-means z 2 skupieniami.
To ćwiczenie jest częścią kursu
Analiza skupień w R
Instrukcje do ćwiczenia
- Zbuduj model k-means o nazwie
model_customersdla danychcustomers_spend, używając funkcjikmeans()z parametremcenters = 2. - Wyodrębnij wektor przypisań do skupień z modelu
model_customers$clusteri zapisz go w zmiennejclust_customers. - Dodaj przypisania do skupień jako kolumnę
clusterdo ramki danychcustomers_spendi zapisz wynik do nowej ramki danych o nazwiesegment_customers. - Oblicz rozmiar każdego skupienia, używając funkcji
count().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
set.seed(42)
# Build a k-means model for the customers_spend with a k of 2
model_customers <- ___
# Extract the vector of cluster assignments from the model
clust_customers <- ___
# Build the segment_customers data frame
segment_customers <- mutate(___, cluster = ___)
# Calculate the size of each cluster
count(___, ___)
# Calculate the mean for each category
segment_customers %>%
group_by(cluster) %>%
summarise_all(list(mean))