Techniky pro multikolinearitu – feature engineering
Multikolinearita je běžný problém, který může negativně ovlivnit výkon modelu v různých situacích strojového učení. Schopnost dobře vysvětlit tuto záležitost může posunout tvoji prezentaci modelování na vyšší úroveň a výrazně tě odlišit od ostatních kandidátů.
V tomto cvičení si procvičíš vytvoření základního modelu pomocí lineární regrese na datové sadě diabetes a prozkoumáš některé výstupní metriky. Pak si vyzkoušíš techniky pro vizuální zkoumání korelace mezi nezávislými proměnnými a nakonec provedeš feature engineering na 2 proměnných s vysokou vzájemnou korelací.
Pro první dva kroky použij X_train, X_test, y_train a y_test, které jsou již načteny v tvém pracovním prostředí.
Všechny potřebné balíčky jsou také připraveny:
pandas jako pd, train_test_split z sklearn.model_selection, LinearRegression z sklearn.linear_model, mean_squared_error a r2_score z sklearn.metrics, matplotlib.pyplot jako plt a seaborn jako sns.
Toto cvičení je součástí kurzu
Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))