Kom igångKom igång gratis

Tekniker mot multikolinjäritet – särdragskonstruktion

Multikolinjäritet är ett vanligt problem som kan påverka prestandan i alla maskininlärningssammanhang. Att kunna diskutera den här detaljen kan lyfta din förklaring av modellering från bra till utmärkt – och verkligen särskilja dig i en intervju.

I den här övningen tränar du på att skapa en basmodell med linjär regression på diabetes-datamängden och utforskar några av utdatamåtten. Sedan tränar du på tekniker för att visuellt undersöka korrelationen mellan de oberoende variablerna, och slutligen utför du särdragskonstruktion på 2 variabler som är starkt korrelerade.

Använd X_train, X_test, y_train och y_test för de två första stegen – dessa har redan importerats till din arbetsyta.

Dessutom har alla relevanta paket importerats åt dig: pandas som pd, train_test_split från sklearn.model_selection, LinearRegression från sklearn.linear_model, mean_squared_error och r2_score från sklearn.metrics, matplotlib.pyplot som plt samt seaborn som sns.

Den här övningen är en del av kursen

Öva på maskininlärningsintervjufrågor i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Redigera och kör kod