Začněte nyníZačněte zdarma

Techniky pro multikolinearitu – feature engineering

Multikolinearita je běžný problém, který může negativně ovlivnit výkon modelu v různých situacích strojového učení. Schopnost dobře vysvětlit tuto záležitost může posunout tvoji prezentaci modelování na vyšší úroveň a výrazně tě odlišit od ostatních kandidátů.

V tomto cvičení si procvičíš vytvoření základního modelu pomocí lineární regrese na datové sadě diabetes a prozkoumáš některé výstupní metriky. Pak si vyzkoušíš techniky pro vizuální zkoumání korelace mezi nezávislými proměnnými a nakonec provedeš feature engineering na 2 proměnných s vysokou vzájemnou korelací.

Pro první dva kroky použij X_train, X_test, y_train a y_test, které jsou již načteny v tvém pracovním prostředí.

Všechny potřebné balíčky jsou také připraveny: pandas jako pd, train_test_split z sklearn.model_selection, LinearRegression z sklearn.linear_model, mean_squared_error a r2_score z sklearn.metrics, matplotlib.pyplot jako plt a seaborn jako sns.

Toto cvičení je součástí kurzu

Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Upravit a spustit kód