Distribuzioni train/test
In un colloquio di Machine Learning, molto probabilmente lavorerai con dati di training e dati di test. Come discusso in precedenza, se le distribuzioni dei dataset di training e di test differiscono, le prestazioni del modello possono peggiorare.
In questo esercizio userai funzioni di sklearn.model_selection insieme a seaborn e matplotlib.pyplot per suddividere loan_data in un training set e un test set e per visualizzarne le distribuzioni così da individuare eventuali discrepanze.
Tieni presente che seaborn e matplotlib.pyplot sono già stati importati nel tuo workspace con gli alias sns e plt.
La pipeline ora include lo split Train/Test:

Questo esercizio fa parte del corso
Esercitarsi con le domande di colloquio di Machine Learning in Python
Istruzioni dell'esercizio
- Sottinsieme di
loan_datalimitato alle caratteristicheCredit ScoreeAnnual Income, e alla variabile targetLoan Statusin questo ordine. - Crea uno split 80/20 di
loan_datae assegnalo aloan_data_subset. - Crea i pairplot di
trainingSetetestSet(in quest'ordine) impostando l'argomentohuesulla variabile targetLoan Status.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()