ÎncepețiÎncepe gratuit

Tehnici pentru multicolinearitate – ingineria caracteristicilor

Multicolinearitatea este o problemă frecventă care poate afecta performanța în orice context de învățare automată. Știind cum să abordezi acest detaliu, poți transforma o explicație a modelării din bună în excelentă și te poți diferenția cu adevărat într-un interviu.

În acest exercițiu, vei exersa crearea unui model de bază folosind Regresia Liniară pe setul de date diabetes și vei explora câteva dintre metricile de ieșire. Apoi vei aplica tehnici de explorare vizuală a corelației dintre variabilele independente, pentru ca în final să realizezi ingineria caracteristicilor pe 2 variabile cu corelație ridicată.

Pentru primii doi pași, folosește X_train, X_test, y_train și y_test, care au fost importate în spațiul tău de lucru.

De asemenea, toate pachetele relevante au fost importate pentru tine: pandas ca pd, train_test_split din sklearn.model_selection, LinearRegression din sklearn.linear_model, mean_squared_error și r2_score din sklearn.metrics, matplotlib.pyplot ca plt și seaborn ca sns.

Acest exercițiu face parte din cursul

Exersează întrebări de interviu pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Editează și rulează codul