Transformacje na zbiorach treningowym i testowym (II)
Podobnie jak w przypadku stosowania tego samego skalera do zbiorów treningowego i testowego, jeśli usunięto wartości odstające ze zbioru treningowego, warto zrobić to samo ze zbiorem testowym. Ponownie zadbaj o to, aby do usuwania wartości odstających ze zbioru testowego używać progów obliczonych wyłącznie na zbiorze treningowym.
Podobnie jak w poprzednim ćwiczeniu, ramka danych so_numeric_df jest podzielona na zbiór treningowy (so_train_numeric) i testowy (so_test_numeric).
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Oblicz odchylenie standardowe i średnią kolumny
ConvertedSalary. - Wyznacz górną i dolną granicę jako trzy odchylenia standardowe od średniej w obu kierunkach.
- Przytnij ramkę danych
so_test_numeric, zachowując tylko wiersze, w którychConvertedSalarymieści się w wyznaczonych granicach.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____
cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off
# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
& (so_test_numeric['ConvertedSalary'] > ____)]