Fördelningar för träning och test
I en maskininlärningsintervju kommer du nästan säkert att arbeta med träningsdata och testdata. Som nämnts tidigare kan dålig modellprestanda uppstå om fördelningarna för tränings- och testdatamängderna skiljer sig åt.
I den här övningen använder du funktioner från sklearn.model_selection samt seaborn och matplotlib.pyplot för att dela upp loan_data i en träningsuppsättning och en testuppsättning, och sedan visualisera deras fördelningar för att hitta eventuella avvikelser.
Observera att seaborn och matplotlib.pyplot redan har importerats till din arbetsmiljö och fått aliasen sns respektive plt.
Pipelinen innehåller nu Train/Test split:

Den här övningen är en del av kursen
Öva på maskininlärningsintervjufrågor i Python
Övningsinstruktioner
- Filtrera
loan_datatill att bara innehålla särdragenCredit ScoreochAnnual Incomesamt målvariabelnLoan Statusi den ordningen. - Skapa en 80/20-uppdelning av
loan_dataoch tilldela den tillloan_data_subset. - Skapa pairplots för
trainingSetochtestSet(i den ordningen) och sätt argumentethuetill målvariabelnLoan Status.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()