Analiza componentelor principale
În ultimele 2 capitole, ai văzut diverse exemple despre cum să reduci dimensionalitatea setului de date, inclusiv prin regularizare și selecție de caracteristici. Este important să poți explica diferitele aspecte ale reducerii dimensionalității într-un interviu de machine learning. Seturile de date mari necesită timp îndelungat de procesare, iar zgomotul din date îți poate distorsiona rezultatele.
O modalitate de reducere a dimensionalității este analiza componentelor principale. Aceasta reprezintă o metodă eficientă de reducere a dimensiunilor datelor, prin crearea de noi caracteristici care păstrează cele mai relevante informații din set, eliminând în același timp multicoliniaritatea. În acest exercițiu, vei folosi modulul sklearn.decomposition pentru a aplica PCA pe caracteristicile setului de date diabetes, izolând variabila țintă progression.
Iată unde te afli în pipeline:

Acest exercițiu face parte din cursul
Exersează întrebări de interviu pentru Machine Learning în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']