Методы устранения мультиколлинеарности — PCA
В предыдущем упражнении вы использовали конструирование признаков, чтобы объединить независимые переменные s1 и s2 в новую переменную s1_s2, поскольку они показали наибольшую корреляцию в наборе данных diabetes.
В этом упражнении вы примените PCA к набору данных diabetes, чтобы устранить мультиколлинеарность перед построением линейной регрессии. Затем сравните полученные метрики с результатами предыдущего упражнения. Наконец, вы визуализируете матрицу корреляции и тепловую карту набора данных — после PCA мультиколлинеарность полностью исчезает.
Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import
from sklearn.decomposition import ____
# Instantiate
pca = ____()
# Fit on train
pca.____(____)
# Transform train and test
X_trainPCA = pca.____(____)
X_testPCA = pca.____(____)