Inizia subitoInizia gratis

Distribuzioni train/test

In un colloquio di Machine Learning, molto probabilmente lavorerai con dati di training e dati di test. Come discusso in precedenza, se le distribuzioni dei dataset di training e di test differiscono, le prestazioni del modello possono peggiorare.

In questo esercizio userai funzioni di sklearn.model_selection insieme a seaborn e matplotlib.pyplot per suddividere loan_data in un training set e un test set e per visualizzarne le distribuzioni così da individuare eventuali discrepanze.

Tieni presente che seaborn e matplotlib.pyplot sono già stati importati nel tuo workspace con gli alias sns e plt.

La pipeline ora include lo split Train/Test:

Machine learning pipeline

Questo esercizio fa parte del corso

Esercitarsi con le domande di colloquio di Machine Learning in Python

Visualizza corso

Istruzioni dell'esercizio

  • Sottinsieme di loan_data limitato alle caratteristiche Credit Score e Annual Income, e alla variabile target Loan Status in questo ordine.
  • Crea uno split 80/20 di loan_data e assegnalo a loan_data_subset.
  • Crea i pairplot di trainingSet e testSet (in quest'ordine) impostando l'argomento hue sulla variabile target Loan Status.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Modifica ed esegui il codice