Kom igångKom igång gratis

Fördelningar för träning och test

I en maskininlärningsintervju kommer du nästan säkert att arbeta med träningsdata och testdata. Som nämnts tidigare kan dålig modellprestanda uppstå om fördelningarna för tränings- och testdatamängderna skiljer sig åt.

I den här övningen använder du funktioner från sklearn.model_selection samt seaborn och matplotlib.pyplot för att dela upp loan_data i en träningsuppsättning och en testuppsättning, och sedan visualisera deras fördelningar för att hitta eventuella avvikelser.

Observera att seaborn och matplotlib.pyplot redan har importerats till din arbetsmiljö och fått aliasen sns respektive plt.

Pipelinen innehåller nu Train/Test split:

Machine learning pipeline

Den här övningen är en del av kursen

Öva på maskininlärningsintervjufrågor i Python

Visa kurs

Övningsinstruktioner

  • Filtrera loan_data till att bara innehålla särdragen Credit Score och Annual Income samt målvariabeln Loan Status i den ordningen.
  • Skapa en 80/20-uppdelning av loan_data och tilldela den till loan_data_subset.
  • Skapa pairplots för trainingSet och testSet (i den ordningen) och sätt argumentet hue till målvariabeln Loan Status.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Redigera och kör kod