Kom igångKom igång gratis

Transformationer för träning och test (II)

Precis som när du tillämpar samma skalare på både tränings- och testdatamängden bör du, om du har tagit bort avvikande värden från träningsdatamängden, göra samma sak med testdatamängden. Återigen är det viktigt att du använder de tröskelvärden som enbart beräknats från träningsdatamängden för att ta bort avvikande värden från testdatamängden.

Precis som i förra övningen delar vi upp DataFrame:n so_numeric_df i en träningsdatamängd (so_train_numeric) och en testdatamängd (so_test_numeric).

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Beräkna standardavvikelsen och medelvärdet för kolumnen ConvertedSalary.
  • Beräkna den övre och nedre gränsen som tre standardavvikelser från medelvärdet i båda riktningarna.
  • Filtrera DataFrame:n so_test_numeric så att du behåller alla rader där ConvertedSalary ligger inom den nedre och övre gränsen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Redigera och kör kod