Principalkomponentanalys
I de senaste 2 kapitlen har du sett flera exempel på hur man minskar dimensionaliteten i en datamängd, bland annat med hjälp av regularisering och särdragsurval. Det är viktigt att kunna förklara olika aspekter av dimensionsreduktion i en maskininlärningsintervju. Stora datamängder tar lång tid att bearbeta, och brus i datan kan snedvrida resultaten.
Ett sätt att minska dimensionaliteten är principalkomponentanalys. Det är en effektiv metod för att krympa datamängden genom att skapa nya särdrag som bevarar den mest användbara informationen, samtidigt som multikollinearitet elimineras. I den här övningen använder du modulen sklearn.decomposition för att utföra PCA på särdragen i datamängden diabetes, med målvariabeln progression isolerad.
Här befinner du dig i pipeline:n:

Den här övningen är en del av kursen
Öva på maskininlärningsintervjufrågor i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']