Transformations d'entraînement et de test (II)
Tout comme vous appliquez le même normalisateur à vos ensembles d'entraînement et de test, si vous avez retiré les valeurs aberrantes de l'ensemble d'entraînement, vous voudrez probablement faire la même chose pour l'ensemble de test. Encore une fois, assurez-vous d'utiliser les seuils calculés uniquement à partir de l'ensemble d'entraînement pour retirer les valeurs aberrantes de l'ensemble de test.
Comme dans l'exercice précédent, nous divisons le DataFrame so_numeric_df en ensembles d'entraînement (so_train_numeric) et de test (so_test_numeric).
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Instructions de l’exercice
- Calculez l'écart-type et la moyenne de la colonne
ConvertedSalary. - Calculez les bornes supérieure et inférieure comme trois écarts-types autour de la moyenne, dans les deux directions.
- Réduisez le DataFrame
so_test_numericpour ne conserver que les lignes oùConvertedSalaryse situe entre les bornes inférieure et supérieure.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____
cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off
# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
& (so_test_numeric['ConvertedSalary'] > ____)]