ÎncepețiÎncepe gratuit

Transformări pe antrenament și testare (II)

Similar cu aplicarea aceluiași scaler atât pe setul de antrenament, cât și pe cel de testare, dacă ai eliminat valorile aberante din setul de antrenament, cel mai probabil vei dori să faci același lucru și pentru setul de testare. Din nou, asigură-te că folosești pragurile calculate exclusiv din setul de antrenament pentru a elimina valorile aberante din setul de testare.

Ca și în exercițiul anterior, am împărțit DataFrame-ul so_numeric_df în seturile de antrenament (so_train_numeric) și de testare (so_test_numeric).

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează abaterea standard și media coloanei ConvertedSalary.
  • Calculează limitele superioară și inferioară ca fiind la trei abateri standard față de medie, în ambele direcții.
  • Filtrează DataFrame-ul so_test_numeric pentru a păstra doar rândurile în care ConvertedSalary se află între limita inferioară și cea superioară.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Editează și rulează codul