Zacznij terazZacznij za darmo

Transformacje na zbiorach treningowym i testowym (II)

Podobnie jak w przypadku stosowania tego samego skalera do zbiorów treningowego i testowego, jeśli usunięto wartości odstające ze zbioru treningowego, warto zrobić to samo ze zbiorem testowym. Ponownie zadbaj o to, aby do usuwania wartości odstających ze zbioru testowego używać progów obliczonych wyłącznie na zbiorze treningowym.

Podobnie jak w poprzednim ćwiczeniu, ramka danych so_numeric_df jest podzielona na zbiór treningowy (so_train_numeric) i testowy (so_test_numeric).

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz odchylenie standardowe i średnią kolumny ConvertedSalary.
  • Wyznacz górną i dolną granicę jako trzy odchylenia standardowe od średniej w obu kierunkach.
  • Przytnij ramkę danych so_test_numeric, zachowując tylko wiersze, w których ConvertedSalary mieści się w wyznaczonych granicach.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Edytuj i uruchom kod