Tillbaka till partihandelsdata: Utforskning
Från den tidigare analysen har du sett att k = 2 ger den högsta genomsnittliga silhuettbredden. I den här övningen fortsätter du att analysera partihandelsdatan genom att bygga och utforska en k-means-modell med 2 kluster.
Den här övningen är en del av kursen
Klusteranalys i R
Övningsinstruktioner
- Bygg en k-means-modell kallad
model_customersför datamängdencustomers_spendmed hjälp av funktionenkmeans()ochcenters = 2. - Extrahera vektorn med klustertilldelningar från modellen
model_customers$clusteroch lagra den i variabelnclust_customers. - Lägg till klustertilldelningarna som en kolumn
clusteri dataramencustomers_spendoch spara resultatet i en ny dataram kalladsegment_customers. - Beräkna storleken på varje kluster med hjälp av
count().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
set.seed(42)
# Build a k-means model for the customers_spend with a k of 2
model_customers <- ___
# Extract the vector of cluster assignments from the model
clust_customers <- ___
# Build the segment_customers data frame
segment_customers <- mutate(___, cluster = ___)
# Calculate the size of each cluster
count(___, ___)
# Calculate the mean for each category
segment_customers %>%
group_by(cluster) %>%
summarise_all(list(mean))