Začněte nyníZačněte zdarma

Transformace trénovací a testovací sady (II)

Stejně jako při aplikaci stejného scaleru na trénovací i testovací sadu platí, že pokud jsi odstranil/a odlehlé hodnoty z trénovací sady, pravděpodobně chceš totéž provést i na testovací sadě. Opět je důležité používat prahové hodnoty vypočítané pouze z trénovací sady k odstranění odlehlých hodnot z testovací sady.

Podobně jako v předchozím cvičení jsme rozdělili DataFrame so_numeric_df na trénovací (so_train_numeric) a testovací (so_test_numeric) sadu.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej směrodatnou odchylku a průměr sloupce ConvertedSalary.
  • Vypočítej horní a dolní hranici jako trojnásobek směrodatné odchylky na obě strany od průměru.
  • Ořež DataFrame so_test_numeric tak, aby obsahoval pouze řádky, kde hodnota ConvertedSalary leží mezi dolní a horní hranicí.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Upravit a spustit kód