Avaliação do agrupamento de grãos

No exercício anterior, você observou no gráfico de inércia que 3 é um bom número de clusters para os dados de grãos. Na verdade, as amostras de grãos são provenientes de uma mistura de três variedades diferentes de grãos: "Kama", "Rosa" e "Canadian". Neste exercício, agrupe as amostras de grãos em três grupos e compare os grupos com as variedades de grãos usando uma tabulação cruzada.

Você tem a matriz samples de amostras de grãos e uma lista varieties com a variedade de grãos de cada amostra. Os pandas (pd) e KMeans já foram importados para você.

Este exercicio faz parte do curso

Unsupervised Learning em Python

Instruções do exercicio

Crie um modelo KMeans chamado model com clusters 3.
Use o método .fit_predict() de model para ajustá-lo a samples e derivar os rótulos de cluster. Usar .fit_predict() é o mesmo que usar .fit() seguido de .predict().
Crie um DataFrame df com duas colunas denominadas 'labels' e 'varieties', usando labels e varieties, respectivamente, para os valores das colunas. Isso foi feito para você.
Use a função pd.crosstab() em df['labels'] e df['varieties'] para contar o número de vezes que cada variedade de grão coincide com cada rótulo de cluster. Atribua o resultado a ct.
Clique em enviar para ver a tabulação cruzada!

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Create a KMeans model with 3 clusters: model
model = ____

# Use fit_predict to fit model and obtain cluster labels: labels
labels = ____

# Create a DataFrame with labels and varieties as columns: df
df = pd.DataFrame({'labels': labels, 'varieties': varieties})

# Create crosstab: ct
ct = ____

# Display ct
print(ct)

Editar e Executar Código

Este exercicio faz parte do curso

Unsupervised Learning em Python

IntermediárioNível de habilidade

4.8+

Comece o curso gratuitamente

Learn how to discover the underlying groups (or "clusters") in a dataset. By the end of this chapter, you'll be clustering companies using their stock market prices, and distinguishing different species by clustering their measurements.

Exercise 1: Aprendizagem não supervisionada Exercise 2: Quantos clusters você tem?Exercise 3: Agrupamento de pontos 2D Exercise 4: Inspecione seu clustering Exercise 5: Avaliação de um clustering Exercise 6: Quantos cachos de grãos você tem?Exercise 7: Avaliação do agrupamento de grãos

Exercicio Atual

Exercise 8: Transformação de recursos para melhores agrupamentos Exercise 9: Dimensionamento de dados de peixes para agrupamento Exercise 10: Agrupamento dos dados de peixes Exercise 11: Agrupamento de ações usando KMeans Exercise 12: Quais ações se movem juntas?

In this chapter, you'll learn about two unsupervised learning techniques for data visualization, hierarchical clustering and t-SNE. Hierarchical clustering merges the data samples into ever-coarser clusters, yielding a tree visualization of the resulting cluster hierarchy. t-SNE maps the data samples into 2d space so that the proximity of the samples to one another can be visualized.

Exercise 1: Visualizing hierarchies Exercise 2: How many merges?Exercise 3: Hierarchical clustering of the grain data Exercise 4: Hierarchies of stocks Exercise 5: Cluster labels in hierarchical clustering Exercise 6: Which clusters are closest?Exercise 7: Different linkage, different hierarchical clustering!Exercise 8: Intermediate clusterings Exercise 9: Extracting the cluster labels Exercise 10: t-SNE for 2-dimensional maps Exercise 11: t-SNE visualization of grain dataset Exercise 12: A t-SNE map of the stock market

Dimension reduction summarizes a dataset using its common occuring patterns. In this chapter, you'll learn about the most fundamental of dimension reduction techniques, "Principal Component Analysis" ("PCA"). PCA is often used before supervised learning to improve model performance and generalization. It can also be useful for unsupervised learning. For example, you'll employ a variant of PCA will allow you to cluster Wikipedia articles by their content!

Exercise 1: Visualizing the PCA transformation Exercise 2: Correlated data in nature Exercise 3: Decorrelating the grain measurements with PCA Exercise 4: Principal components Exercise 5: Intrinsic dimension Exercise 6: The first principal component Exercise 7: Variance of the PCA features Exercise 8: Intrinsic dimension of the fish data Exercise 9: Dimension reduction with PCA Exercise 10: Dimension reduction of the fish measurements Exercise 11: A tf-idf word-frequency array Exercise 12: Clustering Wikipedia part I Exercise 13: Clustering Wikipedia part II

In this chapter, you'll learn about a dimension reduction technique called "Non-negative matrix factorization" ("NMF") that expresses samples as combinations of interpretable parts. For example, it expresses documents as combinations of topics, and images in terms of commonly occurring visual patterns. You'll also learn to use NMF to build recommender systems that can find you similar articles to read, or musical artists that match your listening history!

Exercise 1: Non-negative matrix factorization (NMF)Exercise 2: Non-negative data Exercise 3: NMF applied to Wikipedia articles Exercise 4: NMF features of the Wikipedia articles Exercise 5: NMF reconstructs samples Exercise 6: NMF learns interpretable parts Exercise 7: NMF learns topics of documents Exercise 8: Explore the LED digits dataset Exercise 9: NMF learns the parts of images Exercise 10: PCA doesn't learn parts Exercise 11: Building recommender systems using NMF Exercise 12: Which articles are similar to 'Cristiano Ronaldo'?Exercise 13: Recommend musical artists part I Exercise 14: Recommend musical artists part II Exercise 15: Final thoughts