Tekniker mot multikolinjäritet – särdragskonstruktion
Multikolinjäritet är ett vanligt problem som kan påverka prestandan i alla maskininlärningssammanhang. Att kunna diskutera den här detaljen kan lyfta din förklaring av modellering från bra till utmärkt – och verkligen särskilja dig i en intervju.
I den här övningen tränar du på att skapa en basmodell med linjär regression på diabetes-datamängden och utforskar några av utdatamåtten. Sedan tränar du på tekniker för att visuellt undersöka korrelationen mellan de oberoende variablerna, och slutligen utför du särdragskonstruktion på 2 variabler som är starkt korrelerade.
Använd X_train, X_test, y_train och y_test för de två första stegen – dessa har redan importerats till din arbetsyta.
Dessutom har alla relevanta paket importerats åt dig:
pandas som pd, train_test_split från sklearn.model_selection, LinearRegression från sklearn.linear_model, mean_squared_error och r2_score från sklearn.metrics, matplotlib.pyplot som plt samt seaborn som sns.
Den här övningen är en del av kursen
Öva på maskininlärningsintervjufrågor i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))