НачатьНачать бесплатно

Метод главных компонент

В последних двух главах вы рассмотрели различные способы снижения размерности набора данных, включая регуляризацию и отбор признаков. Умение объяснить разные подходы к снижению размерности — важный навык для собеседования по машинному обучению. Большие наборы данных требуют значительных вычислительных ресурсов, а шум в данных может искажать результаты.

Один из способов снижения размерности — метод главных компонент (Principal Component Analysis, PCA). Он эффективно уменьшает объём данных, создавая новые признаки, которые сохраняют наиболее полезную информацию и одновременно устраняют мультиколлинеарность. В этом упражнении вы воспользуетесь модулем sklearn.decomposition, чтобы применить PCA к признакам набора данных diabetes, выделив целевую переменную progression.

Вот где вы находитесь в пайплайне:

Machine learning pipeline

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import module
from ____.____ import ____

# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']
Редактировать и запускать код