CommencezCommencez gratuitement

Distributions entraînement/test

Lors d'une entrevue en Machine Learning, vous travaillerez presque assurément avec des données d'entraînement et des données de test. Comme nous l'avons vu, un rendement médiocre peut survenir si les distributions des ensembles d'entraînement et de test diffèrent.

Dans cet exercice, vous utiliserez des fonctions de sklearn.model_selection ainsi que seaborn et matplotlib.pyplot pour diviser loan_data en un ensemble d'entraînement et un ensemble de test, puis visualiser leurs distributions afin de repérer toute divergence.

Notez que seaborn et matplotlib.pyplot ont déjà été importés dans votre espace de travail et renommés sns et plt, respectivement.

La chaîne de traitement comprend maintenant le Train/Test split :

Pipeline de Machine Learning

Cette activité fait partie du cours

S'exercer aux questions d'entrevue en Machine Learning avec Python

Voir le cours

Instructions de l’exercice

  • Réduisez loan_data aux seules caractéristiques Credit Score et Annual Income, ainsi qu'à la variable cible Loan Status — dans cet ordre.
  • Créez une division 80/20 de loan_data et assignez-la à loan_data_subset.
  • Créez des pairplots de trainingSet et testSet (dans cet ordre) en définissant l'argument hue à la variable cible Loan Status.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Modifier et exécuter le code