La première composante principale
La première composante principale des données est la direction dans laquelle les données varient le plus. Dans cet exercice, votre tâche est d'utiliser la PCA pour trouver la première composante principale des mesures de longueur et de largeur des échantillons de grain, puis de la représenter par une flèche sur le nuage de points.
Le tableau grains contient la longueur et la largeur des échantillons de grain. PyPlot (plt) et PCA ont déjà été importés pour vous.
Cette activité fait partie du cours
Unsupervised Learning in Python
Instructions de l’exercice
- Faites un nuage de points des mesures des grains. Cela a déjà été fait pour vous.
- Créez une instance de
PCAappeléemodel. - Ajustez le modèle aux données
grains. - Extrayez les coordonnées de la moyenne des données à l'aide de l'attribut
.mean_demodel. - Récupérez la première composante principale de
modelavec l'attribut.components_[0,:]. - Tracez la première composante principale sous forme de flèche sur le nuage de points à l'aide de la fonction
plt.arrow(). Vous devez préciser les deux premiers arguments :mean[0]etmean[1].
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Make a scatter plot of the untransformed points
plt.scatter(grains[:,0], grains[:,1])
# Create a PCA instance: model
model = ____
# Fit model to points
____
# Get the mean of the grain samples: mean
mean = ____
# Get the first principal component: first_pc
first_pc = ____
# Plot first_pc as an arrow, starting at mean
plt.arrow(____, ____, first_pc[0], first_pc[1], color='red', width=0.01)
# Keep axes on same scale
plt.axis('equal')
plt.show()