Zacznij terazZacznij za darmo

Techniki radzenia sobie z multikolinearnością – inżynieria cech

Multikolinearność to częsty problem, który może negatywnie wpływać na wyniki modelu uczenia maszynowego. Umiejętność omówienia tego szczegółu może podnieść jakość twoich wyjaśnień dotyczących modelowania na wyższy poziom i naprawdę wyróżnić cię podczas rozmowy kwalifikacyjnej.

W tym ćwiczeniu przećwiczysz tworzenie modelu bazowego z użyciem regresji liniowej na zbiorze danych diabetes oraz przeanalizujesz wybrane metryki wyjściowe. Następnie zastosujesz techniki wizualnej eksploracji korelacji między zmiennymi niezależnymi, a na koniec wykonasz inżynierię cech na 2 zmiennych o wysokiej korelacji.

W pierwszych dwóch krokach skorzystaj z X_train, X_test, y_train i y_test, które zostały już zaimportowane do twojego obszaru roboczego.

Wszystkie niezbędne pakiety zostały za ciebie zaimportowane: pandas jako pd, train_test_split z sklearn.model_selection, LinearRegression z sklearn.linear_model, mean_squared_error i r2_score z sklearn.metrics, matplotlib.pyplot jako plt oraz seaborn jako sns.

To ćwiczenie jest częścią kursu

Ćwiczenie pytań rekrutacyjnych z uczenia maszynowego w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Edytuj i uruchom kod