Метод главных компонент
В последних двух главах вы рассмотрели различные способы снижения размерности набора данных, включая регуляризацию и отбор признаков. Умение объяснить разные подходы к снижению размерности — важный навык для собеседования по машинному обучению. Большие наборы данных требуют значительных вычислительных ресурсов, а шум в данных может искажать результаты.
Один из способов снижения размерности — метод главных компонент (Principal Component Analysis, PCA). Он эффективно уменьшает объём данных, создавая новые признаки, которые сохраняют наиболее полезную информацию и одновременно устраняют мультиколлинеарность. В этом упражнении вы воспользуетесь модулем sklearn.decomposition, чтобы применить PCA к признакам набора данных diabetes, выделив целевую переменную progression.
Вот где вы находитесь в пайплайне:

Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']