Wholesale-data opnieuw bekijken: verkennen
Uit de vorige analyse bleek dat k = 2 de hoogste gemiddelde silhouette-breedte heeft. In deze oefening ga je verder met het analyseren van de wholesale-klantgegevens door een kmeans-model met 2 clusters te bouwen en te verkennen.
Deze oefening maakt deel uit van de cursus
Clusteranalyse in R
Oefeninstructies
- Bouw een k-meansmodel genaamd
model_customersvoor decustomers_spend-gegevens met de functiekmeans()encenters = 2. - Haal de vector met cluster-toewijzingen uit het model
model_customers$clusteren sla deze op in de variabeleclust_customers. - Voeg de cluster-toewijzingen als kolom
clustertoe aan de data framecustomers_spenden sla het resultaat op in een nieuwe data framesegment_customers. - Bereken de grootte van elk cluster met
count().
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
set.seed(42)
# Build a k-means model for the customers_spend with a k of 2
model_customers <- ___
# Extract the vector of cluster assignments from the model
clust_customers <- ___
# Build the segment_customers data frame
segment_customers <- mutate(___, cluster = ___)
# Calculate the size of each cluster
count(___, ___)
# Calculate the mean for each category
segment_customers %>%
group_by(cluster) %>%
summarise_all(list(mean))