Distributions entraînement/test
Lors d'une entrevue en Machine Learning, vous travaillerez presque assurément avec des données d'entraînement et des données de test. Comme nous l'avons vu, un rendement médiocre peut survenir si les distributions des ensembles d'entraînement et de test diffèrent.
Dans cet exercice, vous utiliserez des fonctions de sklearn.model_selection ainsi que seaborn et matplotlib.pyplot pour diviser loan_data en un ensemble d'entraînement et un ensemble de test, puis visualiser leurs distributions afin de repérer toute divergence.
Notez que seaborn et matplotlib.pyplot ont déjà été importés dans votre espace de travail et renommés sns et plt, respectivement.
La chaîne de traitement comprend maintenant le Train/Test split :

Cette activité fait partie du cours
S'exercer aux questions d'entrevue en Machine Learning avec Python
Instructions de l’exercice
- Réduisez
loan_dataaux seules caractéristiquesCredit ScoreetAnnual Income, ainsi qu'à la variable cibleLoan Status— dans cet ordre. - Créez une division 80/20 de
loan_dataet assignez-la àloan_data_subset. - Créez des pairplots de
trainingSetettestSet(dans cet ordre) en définissant l'argumenthueà la variable cibleLoan Status.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()