Kom igångKom igång gratis

Utforska kluster bland grossistkunder

Du fortsätter arbetet med grossistdatasetet och är nu redo att analysera klusternas egenskaper.

Eftersom du arbetar med fler än 2 dimensioner är det svårt att visualisera klustren i ett spridningsdiagram. Istället använder du sammanfattande statistik för att utforska klustren. I den här övningen analyserar du den genomsnittliga utgiften per kluster för alla tre kategorier.

Den här övningen är en del av kursen

Klusteranalys i R

Visa kurs

Övningsinstruktioner

  • Beräkna storleken på varje kluster med hjälp av count().
  • Färglägg och rita dendrogrammet med höjden 15 000.
  • Beräkna den genomsnittliga utgiften för varje kategori inom varje kluster med hjälp av funktionen summarise_all().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

dist_customers <- dist(customers_spend)
hc_customers <- hclust(dist_customers)
clust_customers <- cutree(hc_customers, h = 15000)
segment_customers <- mutate(customers_spend, cluster = clust_customers)

# Count the number of customers that fall into each cluster
count(___, ___)

# Color the dendrogram based on the height cutoff
dend_customers <- as.dendrogram(hc_customers)
dend_colored <- color_branches(___, ___)

# Plot the colored dendrogram


# Calculate the mean for each category
segment_customers %>% 
  group_by(cluster) %>% 
  summarise_all(list(mean))
Redigera och kör kod