Utforska kluster bland grossistkunder
Du fortsätter arbetet med grossistdatasetet och är nu redo att analysera klusternas egenskaper.
Eftersom du arbetar med fler än 2 dimensioner är det svårt att visualisera klustren i ett spridningsdiagram. Istället använder du sammanfattande statistik för att utforska klustren. I den här övningen analyserar du den genomsnittliga utgiften per kluster för alla tre kategorier.
Den här övningen är en del av kursen
Klusteranalys i R
Övningsinstruktioner
- Beräkna storleken på varje kluster med hjälp av
count(). - Färglägg och rita dendrogrammet med höjden 15 000.
- Beräkna den genomsnittliga utgiften för varje kategori inom varje kluster med hjälp av funktionen
summarise_all().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
dist_customers <- dist(customers_spend)
hc_customers <- hclust(dist_customers)
clust_customers <- cutree(hc_customers, h = 15000)
segment_customers <- mutate(customers_spend, cluster = clust_customers)
# Count the number of customers that fall into each cluster
count(___, ___)
# Color the dendrogram based on the height cutoff
dend_customers <- as.dendrogram(hc_customers)
dend_colored <- color_branches(___, ___)
# Plot the colored dendrogram
# Calculate the mean for each category
segment_customers %>%
group_by(cluster) %>%
summarise_all(list(mean))