ÎncepețiÎncepe gratuit

Analiza componentelor principale

În ultimele 2 capitole, ai văzut diverse exemple despre cum să reduci dimensionalitatea setului de date, inclusiv prin regularizare și selecție de caracteristici. Este important să poți explica diferitele aspecte ale reducerii dimensionalității într-un interviu de machine learning. Seturile de date mari necesită timp îndelungat de procesare, iar zgomotul din date îți poate distorsiona rezultatele.

O modalitate de reducere a dimensionalității este analiza componentelor principale. Aceasta reprezintă o metodă eficientă de reducere a dimensiunilor datelor, prin crearea de noi caracteristici care păstrează cele mai relevante informații din set, eliminând în același timp multicoliniaritatea. În acest exercițiu, vei folosi modulul sklearn.decomposition pentru a aplica PCA pe caracteristicile setului de date diabetes, izolând variabila țintă progression.

Iată unde te afli în pipeline:

Machine learning pipeline

Acest exercițiu face parte din cursul

Exersează întrebări de interviu pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import module
from ____.____ import ____

# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']
Editează și rulează codul