Transformationer för träning och test (II)
Precis som när du tillämpar samma skalare på både tränings- och testdatamängden bör du, om du har tagit bort avvikande värden från träningsdatamängden, göra samma sak med testdatamängden. Återigen är det viktigt att du använder de tröskelvärden som enbart beräknats från träningsdatamängden för att ta bort avvikande värden från testdatamängden.
Precis som i förra övningen delar vi upp DataFrame:n so_numeric_df i en träningsdatamängd (so_train_numeric) och en testdatamängd (so_test_numeric).
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Beräkna standardavvikelsen och medelvärdet för kolumnen
ConvertedSalary. - Beräkna den övre och nedre gränsen som tre standardavvikelser från medelvärdet i båda riktningarna.
- Filtrera DataFrame:n
so_test_numericså att du behåller alla rader därConvertedSalaryligger inom den nedre och övre gränsen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____
cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off
# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
& (so_test_numeric['ConvertedSalary'] > ____)]