CommencezCommencez gratuitement

Techniques contre la multicolinéarité – ingénierie des caractéristiques

La multicolinéarité est un enjeu fréquent qui peut nuire au rendement dans tout contexte de Machine Learning. Savoir en parler clairement peut faire passer votre explication de la modélisation de correcte à excellente et vraiment vous démarquer en entrevue.

Dans cet exercice, vous allez créer un modèle de base avec une régression linéaire sur l'ensemble de données diabetes et examiner quelques mesures de sortie. Ensuite, vous allez explorer visuellement la corrélation entre les variables indépendantes, puis effectuer de l'ingénierie de caractéristiques sur 2 variables fortement corrélées.

Pour les deux premières étapes, utilisez X_train, X_test, y_train et y_test, déjà importées dans votre espace de travail.

De plus, tous les modules pertinents ont été importés pour vous : pandas sous pd, train_test_split de sklearn.model_selection, LinearRegression de sklearn.linear_model, mean_squared_error et r2_score de sklearn.metrics, matplotlib.pyplot sous plt et seaborn sous sns.

Cette activité fait partie du cours

S'exercer aux questions d'entrevue en Machine Learning avec Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Modifier et exécuter le code