Identifiera särdrag för standardisering
I den här övningen undersöker du variansen i kolumnerna i UFO-datamängden för att avgöra vilka särdrag som bör standardiseras. När du tittar på variansen i kolumnerna seconds och minutes kommer du att se att variansen i seconds-kolumnen är extremt hög. Eftersom seconds och minutes är relaterade till varandra – något vi hanterar när vi väljer särdrag för modellering – ska vi log-normalisera seconds-kolumnen.
Den här övningen är en del av kursen
Förbehandling för maskininlärning i Python
Övningsinstruktioner
- Beräkna variansen i kolumnerna
secondsochminutesoch titta noga på resultaten. - Utför log-normalisering på kolumnen
secondsoch lagra resultatet i en ny kolumn med namnetseconds_log. - Skriv ut variansen för kolumnen
seconds_log.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Check the variance of the seconds and minutes columns
print(____)
# Log normalize the seconds column
ufo["seconds_log"] = ____
# Print out the variance of just the seconds_log column
print(____)