Tecniche per la multicollinearità - feature engineering
La multicollinearità è un problema comune che può influire sulle prestazioni in qualunque contesto di Machine Learning. Saper parlare con precisione di questo aspetto può portare la tua spiegazione del modello da buona a eccellente e davvero farti spiccare in un colloquio.
In questo esercizio, praticherai creando un modello di base usando la Regressione Lineare sul dataset diabetes ed esplorerai alcune delle metriche di output. Poi applicherai tecniche per esplorare visivamente la correlazione tra le variabili indipendenti e infine farai feature engineering su 2 variabili altamente correlate.
Per i primi due passaggi, usa X_train, X_test, y_train e y_test, già importati nel tuo workspace.
Inoltre, tutti i pacchetti rilevanti sono già stati importati per te:
pandas come pd, train_test_split da sklearn.model_selection, LinearRegression da sklearn.linear_model, mean_squared_error e r2_score da sklearn.metrics, matplotlib.pyplot come plt e seaborn come sns.
Questo esercizio fa parte del corso
Esercitarsi con le domande di colloquio di Machine Learning in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))