CommencezCommencez gratuitement

Transformations d'entraînement et de test (II)

Tout comme vous appliquez le même normalisateur à vos ensembles d'entraînement et de test, si vous avez retiré les valeurs aberrantes de l'ensemble d'entraînement, vous voudrez probablement faire la même chose pour l'ensemble de test. Encore une fois, assurez-vous d'utiliser les seuils calculés uniquement à partir de l'ensemble d'entraînement pour retirer les valeurs aberrantes de l'ensemble de test.

Comme dans l'exercice précédent, nous divisons le DataFrame so_numeric_df en ensembles d'entraînement (so_train_numeric) et de test (so_test_numeric).

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Calculez l'écart-type et la moyenne de la colonne ConvertedSalary.
  • Calculez les bornes supérieure et inférieure comme trois écarts-types autour de la moyenne, dans les deux directions.
  • Réduisez le DataFrame so_test_numeric pour ne conserver que les lignes où ConvertedSalary se situe entre les bornes inférieure et supérieure.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Modifier et exécuter le code