Transformace trénovací a testovací sady (II)
Stejně jako při aplikaci stejného scaleru na trénovací i testovací sadu platí, že pokud jsi odstranil/a odlehlé hodnoty z trénovací sady, pravděpodobně chceš totéž provést i na testovací sadě. Opět je důležité používat prahové hodnoty vypočítané pouze z trénovací sady k odstranění odlehlých hodnot z testovací sady.
Podobně jako v předchozím cvičení jsme rozdělili DataFrame so_numeric_df na trénovací (so_train_numeric) a testovací (so_test_numeric) sadu.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Vypočítej směrodatnou odchylku a průměr sloupce
ConvertedSalary. - Vypočítej horní a dolní hranici jako trojnásobek směrodatné odchylky na obě strany od průměru.
- Ořež DataFrame
so_test_numerictak, aby obsahoval pouze řádky, kde hodnotaConvertedSalaryleží mezi dolní a horní hranicí.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____
cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off
# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
& (so_test_numeric['ConvertedSalary'] > ____)]