ПочатиПочніть безкоштовно

Методи фільтрації та обгортки

Питання про зменшення розмірності набору даних дуже поширені на співбесідах з машинного навчання. Один зі способів зменшити розмірність — обрати лише релевантні ознаки у вашому наборі даних.

Тут ви попрактикуєте метод фільтрації на датафреймі diabetes, а потім 2 різні стилі методів-обгорток, що включають перехресну перевірку. Ви використовуватимете pandas, matplotlib.pyplot та seaborn, щоб візуалізувати кореляції, обробити дані та застосувати методи відбору ознак до вашого набору даних.

Матриця ознак без цільового стовпця (progression) завантажена як X, а цільова змінна — як y.

Зверніть увагу, що pandas, matplotlib.pyplot і seaborn уже імпортовано у ваш робочий простір з псевдонімами pd, plt і sns відповідно.

Зверніть увагу, що ви додали крок Cross-validate до свого конвеєра (він стосується останніх 3 кроків):

Конвеєр машинного навчання

Ця вправа є частиною курсу

Практика співбесід з Machine Learning у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Редагувати та запускати код