Zpět k velkoobchodním datům: průzkum
Z předchozí analýzy vyplynulo, že k = 2 dosahuje nejvyšší průměrné šířky silhouette. V tomto cvičení budeš pokračovat v analýze dat velkoobchodních zákazníků – vytvoříš a prozkoumáš model k-means se 2 shluky.
Toto cvičení je součástí kurzu
Cluster Analysis v R
Pokyny k cvičení
- Vytvoř model k-means s názvem
model_customerspro datacustomers_spendpomocí funkcekmeans()s parametremcenters = 2. - Extrahuj vektor přiřazení shluků z modelu
model_customers$clustera ulož ho do proměnnéclust_customers. - Přidej přiřazení shluků jako sloupec
clusterdo datového rámcecustomers_spenda výsledek ulož do nového datového rámce s názvemsegment_customers. - Zjisti velikost každého shluku pomocí funkce
count().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
set.seed(42)
# Build a k-means model for the customers_spend with a k of 2
model_customers <- ___
# Extract the vector of cluster assignments from the model
clust_customers <- ___
# Build the segment_customers data frame
segment_customers <- mutate(___, cluster = ___)
# Calculate the size of each cluster
count(___, ___)
# Calculate the mean for each category
segment_customers %>%
group_by(cluster) %>%
summarise_all(list(mean))