Techniky multikolinearity – PCA
V předchozím cvičení jsi použil/a feature engineering ke sloučení nezávislých proměnných s1 a s2 do proměnné s1_s2, protože vykazovaly nejvyšší korelaci v datasetu diabetes.
V tomto cvičení provedeš PCA na datasetu diabetes, abys odstranil/a multikolinearitu před aplikací lineární regrese. Poté porovnáš výstupní metriky s výsledky z předchozího cvičení. Nakonec si vizualizuješ korelační matici a heatmapu datasetu – uvidíš, jak PCA multikolinearitu zcela eliminuje.
Toto cvičení je součástí kurzu
Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import
from sklearn.decomposition import ____
# Instantiate
pca = ____()
# Fit on train
pca.____(____)
# Transform train and test
X_trainPCA = pca.____(____)
X_testPCA = pca.____(____)