Aan de slagBegin gratis

Verken clusters van groothandelsklanten

Je werkt verder met de wholesale-gegevensset en bent nu klaar om de kenmerken van deze clusters te analyseren.

Omdat je met meer dan 2 dimensies werkt, is het lastig om een spreidingsdiagram van de clusters te maken. In plaats daarvan ga je af op samenvattende statistieken om de clusters te verkennen. In deze oefening analyseer je het gemiddelde bedrag dat in elk cluster is uitgegeven voor alle drie de categorieën.

Deze oefening maakt deel uit van de cursus

Clusteranalyse in R

Bekijk cursus

Oefeninstructies

  • Bereken de grootte van elk cluster met count().
  • Kleur en plot het dendrogram met een hoogte van 15.000.
  • Bereken de gemiddelde uitgaven per categorie binnen elk cluster met de functie summarise_all().

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

dist_customers <- dist(customers_spend)
hc_customers <- hclust(dist_customers)
clust_customers <- cutree(hc_customers, h = 15000)
segment_customers <- mutate(customers_spend, cluster = clust_customers)

# Count the number of customers that fall into each cluster
count(___, ___)

# Color the dendrogram based on the height cutoff
dend_customers <- as.dendrogram(hc_customers)
dend_colored <- color_branches(___, ___)

# Plot the colored dendrogram


# Calculate the mean for each category
segment_customers %>% 
  group_by(cluster) %>% 
  summarise_all(list(mean))
Code bewerken en uitvoeren