Principal Component Analysis
Negli ultimi 2 capitoli hai visto vari modi per ridurre la dimensionalità del tuo insieme di dati, tra cui regolarizzazione e selezione delle caratteristiche. In un colloquio di Machine Learning è importante saper spiegare i diversi aspetti della riduzione della dimensionalità. Gli insiemi di dati di grandi dimensioni richiedono molto tempo di calcolo e il rumore nei dati può introdurre bias nei risultati.
Un modo per ridurre la dimensionalità è la Principal Component Analysis (PCA). È un metodo efficace per ridurre la dimensione dei dati creando nuove caratteristiche che preservano le informazioni più utili dell’insieme di dati e, allo stesso tempo, eliminano la multicollinearità. In questo esercizio userai il modulo sklearn.decomposition per eseguire la PCA sulle caratteristiche del dataset diabetes, isolando la variabile target progression.
Qui è dove ti trovi nella pipeline:

Questo esercizio fa parte del corso
Esercitarsi con le domande di colloquio di Machine Learning in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']